论文解读

想练好一句难开口的话,机器得先学会怎么“演人”:Conversation Coach 的延迟与演技取舍

语音交互 | 6.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12239 字 阅读 →
论文解读

听见了却不听从:音频大模型在编码器里记住语气,在解码器里忘记语气

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14405 字 阅读 →
论文解读

别只看频谱长什么样:用 19 维力学视角重写环境声音的描述方式

音频分类 | 5.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9991 字 阅读 →
论文解读

把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉

音乐检索 | 7.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12385 字 阅读 →
论文解读

从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间

音频分离 | 5.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5061 字 阅读 →
论文解读

听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验

语音伪造检测 | 7.4/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13039 字 阅读 →
论文解读

一句里换一种口音:用帧级掩码把全局引导切开

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12956 字 阅读 →
论文解读

别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读

语音合成 | 7.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11235 字 阅读 →
论文解读

不做硬切分:用连续说话人占比给 Whisper 注入重叠感知

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11582 字 阅读 →
论文解读

会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒

音频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12384 字 阅读 →
论文解读

三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差

多模态模型 | 5.1/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9106 字 阅读 →
论文解读

掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处

音视频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 13008 字 阅读 →
论文解读

不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer

音乐转录 | 7.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11036 字 阅读 →
论文解读

相位不再复用:当 Transformer 学会看懂复数谱图

语音增强 | 6.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11532 字 阅读 →
论文解读

只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口

语音情感识别 | 7.1/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11195 字 阅读 →
论文解读

单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作

音频分离 | 6.6/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12996 字 阅读 →
论文解读

没有配对报告时,如何让呼吸声自己找到临床语义?

音频分类 | 7.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11049 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34077 字 阅读 →
论文解读

把响度与形状拆开:用归一化解耦让板混响参数在病态地形中收敛

音乐理解 | 6.3/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10647 字 阅读 →
论文解读

当解码器缺的不是声音,而是下一词的语义证据

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11111 字 阅读 →