混语口述史里英文指标最好的一档,为何恰恰丢掉了非英语片段
该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。
该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。
GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。
针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。
论文用冻结视觉语言模型加 Whisper 转写路由构造免训练语音中心全模态理解,在 56 个基准和 21 种语言的配对比较中语音任务可比原生全模态训练而保留视觉推理能力,代价是增加串行语音识别延迟且无法处理音乐与环境声等非语音线索。
针对播客式多轮对话中声称分散与 ASR 噪声的核查难题,TRILOGUE 以源文章可追溯的英俄哈三语对话与配对音频构建受控基准,显示仅看声称的验证最难、加入源证据后大幅回升,而哈萨克语的识别与合成瓶颈仍是主要代价。
针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。
该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。
该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。
该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。
语音识别 | 5.8/10
语音合成 | 8.2/10
多模态模型 | 5.1/10
共分析 23 篇语音/AI 论文
语音识别 | 8.4/10
语音识别 | 8.1/10
语音识别 | 7.8/10
语音识别 | 6.9/10
语音翻译 | 6.0/10
语音识别 | 9.1/10
共分析 22 篇语音/AI 论文