论文解读

Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective

语音生成 | 7.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4296 字 阅读 →
论文解读

Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-Resource Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-17 · 约 8 分钟 · 3795 字 阅读 →
论文解读

Z-Scores: A Metric for Linguistically Assessing Disfluency Removal

模型评估 | 6.5/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4710 字 阅读 →
论文解读

ZK-VSA: Zero-Knowledge Verifiable Speaker Anonymization Leveraging Phase Vocoder with Time-Scale Modification

语音匿名化 | 7.5/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4541 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4244 字 阅读 →
论文解读

β-AVSDNET: A Novel End-To-End Neural Network Architecture For Audio-Visual Speaker Diarization

说话人分离 | 7.5/10

 · 更新于 2026-09-17 · 约 12 分钟 · 5853 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-17 · 约 87 分钟 · 43144 字 阅读 →
论文解读

A Functorial Formulation of Neighborhood Aggregating Deep Learning

理论分析 | 6.5/10

 · 更新于 2026-09-17 · 约 7 分钟 · 3389 字 阅读 →
论文解读

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

音频问答 | 6.5/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4036 字 阅读 →
论文解读

An event-based sequence modeling approach to recognizing non-triad chords with oversegmentation minimization

音乐理解 | 7.5/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4400 字 阅读 →
论文解读

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

跨模态 | 8.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4377 字 阅读 →
论文解读

Come Together: Analyzing Popular Songs Through Statistical Embeddings

音乐信息检索 | 6.5/10

 · 更新于 2026-09-17 · 约 8 分钟 · 3526 字 阅读 →
论文解读

Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features

语音生物标志物 | 8.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4365 字 阅读 →
论文解读

Explainable AI in Speaker Recognition -- Making Latent Representations Understandable

说话人识别 | 7.5/10

 · 更新于 2026-09-17 · 约 8 分钟 · 3672 字 阅读 →
论文解读

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

音视频 | 8.5/10

 · 更新于 2026-09-17 · 约 12 分钟 · 5626 字 阅读 →
论文解读

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

音频大模型 | 8.0/10

 · 更新于 2026-09-17 · 约 11 分钟 · 5044 字 阅读 →
论文解读

Latent-Hysteresis Graph ODEs: Modeling Coupled Topology-Feature Evolution via Continuous Phase Transitions

图神经网络 | 8.0/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4777 字 阅读 →
论文解读

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

音频场景理解 | 8.0/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4909 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4497 字 阅读 →
论文解读

Meta-Ensemble Learning with Diverse Data Splits for Improved Respiratory Sound Classification

音频分类 | 8.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4218 字 阅读 →