同一人说两种语言时,如何让语言验证不再被说话人带偏
针对多语说话人带来的身份偏置问题,该工作用说话人门控动态加权同说话人与跨说话人两个神经 PLDA 语言专家,在盲测上报告验证等错误率 19.13% 与识别宏平均准确率 78.94%,代价是两阶段数据复用导致开发集显著乐观。
针对多语说话人带来的身份偏置问题,该工作用说话人门控动态加权同说话人与跨说话人两个神经 PLDA 语言专家,在盲测上报告验证等错误率 19.13% 与识别宏平均准确率 78.94%,代价是两阶段数据复用导致开发集显著乐观。
针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。
IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。
该文针对合成语音评测只有分数、跨任务跨语言泛化弱的问题,构建覆盖四任务四语言的 SpeechEval 并用指令微调加奖励优化训练 SQ-LLM,最强证据是在评估与对比维度相关性上超过专家基线,代价是约 43 个 A100 小时训练与对特定伪造来源泛化仍不稳定。
针对同一说话人说多种语言时模型易依赖说话人特征走捷径的问题,该文采用在 VoxLingua107 上预训练的 ECAPA-TDNN 做编码器并比较 AAM-Softmax 与 RAM-Softmax,在 Tidy-X 上报告识别任务 85.95% 宏准确率与验证任务 16.39% 等错误率,最强证据来自与官方基线的同协议对照,代价是未充分优化未见语种验证与未 …
针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。
针对无预切分、无说话人标签的 21 语言多说话人长对话选择题任务,论文对比了 Voxtral-Mini-3B 的 LoRA 微调、冻结 Voxtral-24B 的多模态上下文学习纠偏、以及免训练语音锚定检索三条路线,最强证据是上下文学习在第二阶段评测取得 0.81 准确率,代价是微调在小数据上过拟合回落与检索前端依赖转写和切分质量。
该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。
针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。
该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。
该研究在 13 种语言上比较 6 个系统的零样本意图分类,报告混合架构与强级联相当并更能缓解转写错误,而纯端到端明显落后,且多语言效果同时受大语言模型能力与语音编码器识别质量制约。
针对英文为主和合成语音评测失真的问题,VCB Bench 用全真人中文语音构建指令跟随、知识理解与鲁棒性三维评测,在 9 个语音对话模型上显示常识问答最难而物理干扰比口误更致命。
论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。
该文把音位识别错误转到 39 维区别特征空间做可复述诊断,报告跨 12 种语言替换错误中位距离 4 对随机基线 9、平均差约 2.8 且 PS 约 0.64,代价是只分析替换错误并依赖 soundvectors 特征与自举区间判断。
针对跨文化理解所需的野外视频多语转写问题,论文用易复用的 Whisper 与 WhisperX 流水线加字幕挖掘与重切分,报告七语平均约 30% 错误经数十至二百小时微调降至约 21.7%,代价是幻觉插入与字幕参考不完美及发布受限。
该研究把文化敏感提问译成 10 种语言再合成 1315 小时语音来考 12 个大音频语言模型,报告 MERaLiON 相关性最高也未过 0.5,而 LTU 等模型的零有害只是因为答非所问。
AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。
该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。
BuzzASR 用单语微调与分词器替换加文本多任务两条路线适配 102 种语言,在 77 种语言上超过 Whisper-large-v3 并在 27 种语言上达到开源最优,代价是逐语维护模型与域内评测带来的可比性限制。
论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。