论文解读

别只听响度:为什么 AI 炸点声会在“尾巴”里露馅

音频伪造检测 | 5.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8682 字 阅读 →
论文解读

同样的两段声音,为何转写稳得住、问答就垮掉?

音频理解 | 6.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8603 字 阅读 →
论文解读

会数停顿的尺子,为什么比会说话的模型更懂流利度?

语音质量评估 | 6.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9539 字 阅读 →
论文解读

同音不同形,真的同音吗?当语义在频谱里留下指纹

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8782 字 阅读 →
论文解读

当乐评人说两位歌手很像,声音本身答应吗?

音乐推荐 | 5.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6935 字 阅读 →
论文解读

不只给一个抑郁概率:把声音拆成四条可审计的 DSM-5 线索

语音情感识别 | 7.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7092 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 87 分钟 · 43538 字 阅读 →
论文解读

别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理

音频理解 | 6.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5836 字 阅读 →
论文解读

让每个频率格为自己的关系负责:DS 接入音乐模型

音乐理解 | 7.2/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4422 字 阅读 →
论文解读

忘掉不等于擦除:语音网络把关键期痕迹压在了最底层

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4703 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 54 分钟 · 26637 字 阅读 →
论文解读

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

语音合成 | 9.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5401 字 阅读 →
论文解读

From local kernels to global form: modeling the emergence of musical content

音乐理解 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5260 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6318 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 68 分钟 · 33830 字 阅读 →
论文解读

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

音视频交互 | 5.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4533 字 阅读 →
论文解读

Self-Supervised Speech Representations Track Spoken Language Convergence to Adult Models in Infants and Children Who Are Deaf/Hard-of-Hearing

语音属性识别 | 9.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4955 字 阅读 →
论文解读

Separating Voice from Age in COPD Screening

语音属性识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5333 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-25

共分析 46 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 101 分钟 · 50381 字 阅读 →
论文解读

Explainability by Design: Structured Kolmogorov-Arnold Networks over Probabilistic Attributes for Speech Deepfake Source Tracing

语音伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4938 字 阅读 →