论文解读

咳嗽不是噪声:让对话智能体在轮次间听见呼吸

音频事件检测 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7497 字 阅读 →
论文解读

既要指向性,又要去混响:一次前向如何重建干净的虚拟方向麦克风

空间音频 | 5.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7955 字 阅读 →
论文解读

当 AI 自己给艺术分类:28 个簇与 6 个人类标签的错位

音视频理解 | 4.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9446 字 阅读 →
论文解读

会数停顿的尺子,为什么比会说话的模型更懂流利度?

语音质量评估 | 6.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9539 字 阅读 →
论文解读

同音不同形,真的同音吗?当语义在频谱里留下指纹

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8782 字 阅读 →
论文解读

不训练模型,只靠对齐:用图像把英文单词钉到印地语语音里

音频检索 | 7.3/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9174 字 阅读 →
论文解读

Omni 不等于会选:当模型被要求用对的模态回答

音视频理解 | 7.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8261 字 阅读 →
论文解读

有害不在一处:当声音与画面由多模态共同拼出

音视频生成 | 7.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7570 字 阅读 →
论文解读

不只用文字指挥检索:当嵌入器学会看区域、听时段

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9187 字 阅读 →
论文解读

当八成轮替都重叠时,静音阈值为什么会失灵?

多模态模型 | 5.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8392 字 阅读 →
论文解读

当乐评人说两位歌手很像,声音本身答应吗?

音乐推荐 | 5.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6935 字 阅读 →
论文解读

说出来就变了味:当语音不再是文本的透明通道

音视频问答 | 8.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7692 字 阅读 →
论文解读

合成语音越多越好吗?在音素层面重新称量文本的价值

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8699 字 阅读 →
论文解读

把嘴边的电极收回指尖:按需贴合如何让无声语音既可用又不打扰隐私

语音识别 | 5.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6626 字 阅读 →
论文解读

听错一个字就全盘皆输:SpeechGym 把语音智能体的失败变成可训练的梯度

语音交互 | 7.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8505 字 阅读 →
论文解读

边播边改:当音视频生成从片段走向持续世界

音频生成 | 8.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8087 字 阅读 →
论文解读

不只给一个抑郁概率:把声音拆成四条可审计的 DSM-5 线索

语音情感识别 | 7.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7092 字 阅读 →
论文解读

梵颂为何难唱:当吟诵的旋律不在文本里

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8810 字 阅读 →
论文解读

当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意

语音交互 | 6.6/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10404 字 阅读 →
论文解读

克隆与匿名本是一体两面:把 27k 小时的 TTS 直接当成隐私滤镜

语音转换 | 8.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8455 字 阅读 →