论文解读

混语口述史里英文指标最好的一档,为何恰恰丢掉了非英语片段

该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。

 · 更新于 2026-09-25 · 约 14 分钟 · 6766 字 阅读 →
论文解读

GhostWord:把后门藏进单词时间轴里,防御为何越洗越伤干净转写

GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。

 · 更新于 2026-09-25 · 约 20 分钟 · 9612 字 阅读 →
论文解读

把伦巴德效应拆成三层:说话人、音素与帧如何各管一摊

针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。

 · 更新于 2026-09-25 · 约 24 分钟 · 11554 字 阅读 →
论文解读

不训练也能听懂说话:冻结视觉语言模型的外挂语音路由何时够用

论文用冻结视觉语言模型加 Whisper 转写路由构造免训练语音中心全模态理解,在 56 个基准和 21 种语言的配对比较中语音任务可比原生全模态训练而保留视觉推理能力,代价是增加串行语音识别延迟且无法处理音乐与环境声等非语音线索。

 · 更新于 2026-09-25 · 约 19 分钟 · 9198 字 阅读 →
论文解读

听见的对话如何被核查:TRILOGUE 把多轮声称钉回源文章与配对音频

针对播客式多轮对话中声称分散与 ASR 噪声的核查难题,TRILOGUE 以源文章可追溯的英俄哈三语对话与配对音频构建受控基准,显示仅看声称的验证最难、加入源证据后大幅回升,而哈萨克语的识别与合成瓶颈仍是主要代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10512 字 阅读 →
论文解读

不对齐文本、直接生成双声道:Text-Audiobox 如何做配音与对话

针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9093 字 阅读 →
论文解读

15 秒参考合成整库:固定音色泰语 TTS 的质量与覆盖取舍

该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。

 · 更新于 2026-09-25 · 约 20 分钟 · 9770 字 阅读 →
论文解读

只抄最后一层表示:预量化潜变量蒸馏压缩流式音频前端

该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。

 · 更新于 2026-09-25 · 约 20 分钟 · 9661 字 阅读 →
论文解读

卡住最强翻译模型:难例众包与逐条验证规则

该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。

 · 更新于 2026-09-25 · 约 22 分钟 · 10621 字 阅读 →
论文解读

在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9553 字 阅读 →
论文解读

一句里换一种口音:用帧级掩码把全局引导切开

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12956 字 阅读 →
论文解读

三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差

多模态模型 | 5.1/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9106 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34077 字 阅读 →
论文解读

当解码器缺的不是声音,而是下一词的语义证据

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11111 字 阅读 →
论文解读

当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10990 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11082 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 22 分钟 · 11019 字 阅读 →
论文解读

翻译丢掉的不只是词:当语调跨越语言还能剩下多少?

语音翻译 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8041 字 阅读 →
论文解读

没有金标准时,怎么判断对齐切得准不准

语音识别 | 9.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8803 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 66 分钟 · 32614 字 阅读 →