论文解读

当一句非洲对话里藏着两种语言,语音识别该听哪一种?

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8671 字 阅读 →
论文解读

长音频不是更长的短音频:AudioSpan 如何逼模型证明它真的听见了

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8805 字 阅读 →
论文解读

会数停顿的尺子,为什么比会说话的模型更懂流利度?

语音质量评估 | 6.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9539 字 阅读 →
论文解读

说出来就变了味:当语音不再是文本的透明通道

音视频问答 | 8.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7692 字 阅读 →
论文解读

合成语音越多越好吗?在音素层面重新称量文本的价值

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8699 字 阅读 →
论文解读

梵颂为何难唱:当吟诵的旋律不在文本里

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8810 字 阅读 →
论文解读

克隆与匿名本是一体两面:把 27k 小时的 TTS 直接当成隐私滤镜

语音转换 | 8.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8455 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 87 分钟 · 43538 字 阅读 →
论文解读

忘掉不等于擦除:语音网络把关键期痕迹压在了最底层

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4703 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

音频理解 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6093 字 阅读 →
论文解读

Unsupervised Speech Recognition at the Syllable Level

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5121 字 阅读 →
论文解读

Aslema at NADI 2026: Augmentation through Fewshot for SLU

语音交互 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4468 字 阅读 →
论文解读

Understanding Multilingual Medical ASR Adaptation Through Layer-Wise Analysis

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5145 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23525 字 阅读 →
论文解读

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4189 字 阅读 →
论文解读

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

音乐理解 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7579 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-19

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 40 分钟 · 19678 字 阅读 →
论文解读

Cached LLM Probability Retrieval for Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7301 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6303 字 阅读 →