论文解读

不改脸只改声:把保护藏进人耳听不见的掩蔽阴影

语音合成 | 4.3/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11558 字 阅读 →
论文解读

类型未知时如何判真假:用两套耳朵听同一段音频

音频伪造检测 | 6.3/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11814 字 阅读 →
论文解读

长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起

音频字幕生成 | 6.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10434 字 阅读 →
论文解读

用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型

音乐理解 | 6.5/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10477 字 阅读 →
论文解读

用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12869 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10440 字 阅读 →
论文解读

在一条潜流里同时生成两条音轨:解耦语义与声学后的少步分离

音乐源分离 | 5.3/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11167 字 阅读 →
论文解读

从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12606 字 阅读 →
论文解读

把咳嗽声拆开:用高斯对齐让模型忘记敏感属性

音频分类 | 5.5/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10348 字 阅读 →
论文解读

7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大

扩散模型 | 5.9/10

 · 更新于 2026-09-25 · 约 30 分钟 · 14580 字 阅读 →
论文解读

会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来

语音交互 | 7.3/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2608 字 阅读 →
论文解读

朗读课文不该读出抑郁:用证据边界把筛查关进可审计的笼子

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11117 字 阅读 →
论文解读

在噪声里听见和弦:一次卷积如何让田野录音带上调性色彩

音乐生成 | 5.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10057 字 阅读 →
论文解读

听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音

说话人日志 | 7.0/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14406 字 阅读 →
论文解读

文字比原声更懂情绪:把生成音乐放进效价-唤醒坐标系来称重

音乐生成 | 6.0/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11830 字 阅读 →
论文解读

当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10990 字 阅读 →
论文解读

当语音 Token 不再像自然语言:13 个编解码器在噪声下的语言统计学分化

语音编码 | 6.3/10

 · 更新于 2026-09-25 · 约 31 分钟 · 15156 字 阅读 →
论文解读

把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵

声源定位 | 5.7/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12536 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11082 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 22 分钟 · 11019 字 阅读 →