可见不等于送达:只给留存下来的译文记功的流式语音翻译
针对可修订流式语音到文本翻译中可见草稿会奖励随后被撤回内容的问题,论文提出持续交付优化,用留存前缀的参考覆盖累积中间奖励并单独计最终质量,在 7.49 小时 FLEURS 适配下相对 History-SFT 降低平均与 P90 终结感知延迟 10.8% 与 11.3% 并降低归一化擦除 15.8%,代价是需要完整轨迹回放计算回报且中间奖励依赖词面覆盖。
针对可修订流式语音到文本翻译中可见草稿会奖励随后被撤回内容的问题,论文提出持续交付优化,用留存前缀的参考覆盖累积中间奖励并单独计最终质量,在 7.49 小时 FLEURS 适配下相对 History-SFT 降低平均与 P90 终结感知延迟 10.8% 与 11.3% 并降低归一化擦除 15.8%,代价是需要完整轨迹回放计算回报且中间奖励依赖词面覆盖。
论文以 Qwen2-Audio 为案例分离词汇输出、转录不足的波形依赖行为与打包实现测量,显示 6 比特翻译选中分配在冻结重放上 chrF 提升但情绪识别下降,而反例与对照说明文本分不能替代波形使用证据。
针对转写链式思维在有监督微调中用参考转写做前缀而推理用自生成转写的不一致,论文用 GRPO 同时奖励自生成转写和以其为条件的翻译,在相同 CoVoST 2 训练样本下 CoT GRPO 在两套测试上 BLEU 领先并把 WER 相对降低 8.8% 和 7.2%,代价是需要多样本 rollout 和显式调 ASR 权重。
CVSS-X 把同一批英语真人录音经机器翻译转写为二十八种目标语言文本再用多语合成配音,构造每语言约二十四万对的英到多语并行语音,同管线复测显示其合成可懂度可用但自然度低于只合成英语的 CVSS,代价是受制于翻译质量与众包录音瑕疵。
针对大模型预测高码率语音 token 难、表达性数据难对齐的问题,Kraken 用 25 Hz 单层 VQ 低码率 token 加 LLM 与声码器双路源语音条件,在 150k 小时多任务数据上实现可复述的端到端语音到语音翻译,并在 FLEURS 与 CVSS 上保留说话人与韵律,代价是音频质量指标弱于用理想参考音色的大模型。
该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。
针对长时连续语音到语音同传难以复现评测的问题,论文用目标端语音识别加强制对齐恢复词级时间戳、再用句嵌入对齐切分到源语句组的方法,在约 10 分钟与约 45 秒两类语音上验证可行,并报告延迟随输入变长而累积的主要代价。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该研究针对博杰普尔语到印地语和爱尔兰语到英语的低资源语音翻译,采用先转录后翻译的级联路线,比较不同语音识别前端与直接和经中间语言的翻译路由,最强证据是博杰普尔语开发集上直接翻译取得 BLEU 25.59、chrF++ 42.48、TER 63.83,代价是爱尔兰语需换专用识别模型才达到全覆盖且仍依赖代理诊断而无标准翻译分数。
论文把英语语音同传拆成 Qwen3 语音识别加强制对齐与 Gemma-4 解码器翻译的同步级联,用显式源文区间加离线挑选的 8 个对齐头加 qk-fast 重算实现解码器侧 AlignAtt,在英德和英意低延迟约 2 秒与高延迟 4 秒内超过主办方基线,代价是中文方向不稳定且全头重算会明显抬高计算感知延迟。
AURA-ST 针对豪萨语、伊博语、约鲁巴语到英语的低资源语音翻译,用双流声学编码加 4 倍卷积压缩把音频变成冻结 Gemma-4-E2B 的前缀,并只调 MLP 的 LoRA,在教师强制代理 BLEU 上达到 91.29,但自由自回归解码的 SpBLEU 仅为 19.5、5.2 和 4.6,暴露了严重的暴露偏置代价。
该工作用翻译导向大模型加语音编码器处理英文语音并执行英中意德指令,以先转写后作答的思维链复用纯文本监督,在 IWSLT 2025 评测上翻译与问答达到可比最优,代价是语音编码器只训练约 0.8 轮且依赖后编辑修正格式。
针对加泰罗尼亚语到英语方言语音翻译任务,论文比较了两种级联与一种端到端系统,最强证据是 Whisper-v3 加 NLLB 级联取得 44.7 BLEU 和 65.1 chrF,而代价是依赖大规模外部语音与文本预训练和两段式推理链路。
针对无句子边界的长音频与计算感知延迟限制,用冻结音频编码器的 Qwen3-Omni-30B-A3B 只训练语言侧 LoRA 并以内化的``策略做读写决策,在官方开发集低延迟档取得英中 40.5 BLEU 与英德 27.7 BLEU,代价是依赖合成目标与固定块推理的折中。
针对 Qwen2-Audio-7B 语音翻译压缩到 4 GB 磁盘的问题,Diet-KIT 用 HQQ 分组量化打底、嵌入低比特加敏感度选层补足、AWQ 校准收尾,在 ACL 60/60 上以 3.98 GB 取得 en→de COMET 74.4、en→zh 77.1,代价是全模型统一 3 比特会使 BLEU 与 COMET 断崖式下跌。
该研究用同一套语音大模型先做短语音指令跟随再扩展到长语音,比较三种切分策略,最强证据是固定 30 秒切分取得 2.0663 的 HIFS 分数,代价是长摘要与章节任务仍不稳定且幻觉以重复插入为主。
针对北部库尔德语 Badini 变体缺平行语音文本问题,论文用 2000 句英译巴迪尼加 45 人录音验证得到 5224 条 15 小时 40 分钟语料,最强基线 W2V-BERT CTC 在测试集词错误率为 55.07%,而语音到文本翻译 BLEU 仅 5.24,代价是小数据微调仍难克服方言与书写差异。
针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。
论文用语音大模型提示打分与 COMET 加音频回归两条路线检验源语音是否有用,在 IWSLT 2026 开发集上报告音频未稳定超过纯文本,而错配音频不掉点与技术内容占比高揭示了数据与建模代价。