论文解读

听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气

语音情感识别 | 6.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14405 字 阅读 →
论文解读

三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差

多模态模型 | 5.1/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9106 字 阅读 →
论文解读

掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处

音视频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 26 分钟 · 13008 字 阅读 →
论文解读

没有配对报告时,如何让呼吸声自己找到临床语义?

音频分类 | 7.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11049 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34077 字 阅读 →
论文解读

当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问

语音识别 | 8.1/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10990 字 阅读 →
论文解读

当文字当指挥:MAESTRO 如何让声画专家按序就位

音视频理解 | 6.0/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10691 字 阅读 →
论文解读

别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11536 字 阅读 →
论文解读

当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令

音乐生成 | 7.1/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13132 字 阅读 →
论文解读

模型听见的是期待的语调:当讽刺检测依赖高音与停顿的刻板印象

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13353 字 阅读 →
论文解读

当声音在笑、文字在哭:大音频语言模型为何听不见讽刺

语音情感识别 | 8.1/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12067 字 阅读 →
论文解读

文字答得滴水不漏,声音却露了怯:财报电话会里的双重规避

语音情感识别 | 6.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9247 字 阅读 →
论文解读

对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化

音视频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8045 字 阅读 →
论文解读

看得懂谱,听得出演奏,才算懂音乐:MuSP-Bench 为何要把乐谱与演奏放在一起考

音乐理解 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7239 字 阅读 →
论文解读

把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分

音视频理解 | 5.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9507 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 66 分钟 · 32614 字 阅读 →
论文解读

当语音和文本各说各话,重排器如何当翻译官?

LoRA | 5.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8739 字 阅读 →
论文解读

长音频不是更长的短音频:AudioSpan 如何逼模型证明它真的听见了

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8805 字 阅读 →
论文解读

同样的两段声音,为何转写稳得住、问答就垮掉?

音频理解 | 6.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8603 字 阅读 →
论文解读

别只看那一刻有多自信,要看一路有多摇晃:TRACE 用轨迹来判断情感是否可信

音视频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9757 字 阅读 →