论文解读

从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径

在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11722 字 阅读 →
论文解读

打开混响黑盒:从 Schroeder 结构到可核对的分析与移植路径

论文以 Schroeder 历史混响为案例,主张用开放架构重建 comb 与 all-pass 组合,通过 Csound 脉冲响应分析与 par/seq 重建验证理解过程,代价是遇到效率限制而把 C 编译 opcode 留作后续工作。

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
论文解读

注意力三角:当音频-视频边把鹦鹉的话转给海盗

论文研究文本到音频视频联合生成中的语义泄漏与声源归属错误,提出只在推理时对文本-视频、文本-音频、音频-视频三条交叉注意力边加偏置的转向方法,在 100 个挑战提示上把 Qwen 声源归属分从 0.1216 提高到 0.1349,代价是约 2.5 倍推理开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11200 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →
论文解读

听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气

语音情感识别 | 6.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14405 字 阅读 →
论文解读

别只看频谱长什么样:用 19 维力学视角重写环境声音的描述方式

音频分类 | 5.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9991 字 阅读 →
论文解读

听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验

语音伪造检测 | 7.4/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13039 字 阅读 →
论文解读

单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作

音频分离 | 6.6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12996 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34077 字 阅读 →
论文解读

把咳嗽声拆开:用高斯对齐让模型忘记敏感属性

音频分类 | 5.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 22 分钟 · 11019 字 阅读 →
论文解读

别再比谁更像人:当生成音乐的评价回到音乐人的工作台

音乐生成 | 7.3/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9673 字 阅读 →
论文解读

模型听见的是期待的语调:当讽刺检测依赖高音与停顿的刻板印象

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13353 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 151 分钟 · 75584 字 阅读 →
论文解读

对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化

音视频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8045 字 阅读 →
论文解读

当和声不再只谈音高:用搬运代价度量音色的几何

音乐理解 | 5.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7830 字 阅读 →
论文解读

0.76 分里的诚实:当语音失灵时,眼睛如何泄露下一句话的时机

语音交互 | 6.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9435 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 66 分钟 · 32614 字 阅读 →