字幕块太碎翻不好:先固定时间,再用整句重写文本
该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。
该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。
针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。
该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。
AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。
针对文本大模型向语音统一理解与生成迁移时模态鸿沟大、单一种词元难以兼顾语义与声学的问题,该文提出理解驱动分词器与双词元建模并用约 4500 小时数据验证,理解与生成可相互促进,但细粒度声学保留与翻译类任务仍有代价与边界。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对同声传译需在部分语音下增量输出的问题,EASiST 用多延迟语义分块构造单调交错数据、全单向语音编码器加 LLM 与轻量读写策略头经三阶段训练实现自适应低重算推理,在 MuST-C 与 Europarl-ST 英德英西上取得更好的延迟质量权衡,但自适应增益依赖分块对齐质量与阈值调节。
针对多语言端到端语音翻译中共用单组低秩更新导致语言间干扰的问题,MoLoRA 把多个低秩适配模块当作专家并辅以多粒度语音融合,在 MuST-C 八语言平均 32.2 与 CoVoST-2 三语言平均 36.3 的 BLEU 下超过同量级单 LoRA,代价是路由与负载均衡等额外机制和调参成本。
针对语音到文本翻译在真实噪声下不稳定的问题,论文用可解释环境模拟器加功率谱模板原型约简与 27 组小规模超参数搜索组织鲁棒训练,在相同数据预算下使模拟噪声训练与真实噪声训练表现接近,代价是混响与精细调度需另行取舍且最优配置只在搜索范围内成立。
针对端到端语音翻译只对齐文字内容而丢失重音与情绪的问题,论文用语音编码器与风格编码器双分支加分层最优传输和注意力检索来分离并再融合两类信息,在 ContraProST 上提升方向性约 5.0 点、全局约 4.5 点,在 CoVoST-2 上 2B 平均提升 0.43 BLEU、8B 提升 0.98 BLEU,代价是两阶段训练与额外风格编码器开销。
针对同传要在质量与延迟之间选读或写的问题,REINA 用完整音频与截断音频下对数概率之差估计信息增益来训练独立策略网络,在 MUST-C 与 CVSS-C 上提升归一化流效率,但截断适配训练与单调约束不可缺且德语高延迟点仍有反例。
针对同声传译需在流式语音下联合决定何时翻译与翻译什么的问题,SASST 用句法感知分块加目标侧重排构造含等待符号的流式监督并统一到冻结 Whisper 编码器加解码器大模型中,在 CoVoST2 英德英中英日上以 2 到 4 秒级延迟取得质量优势,其代价是依赖句法分析器与额外的对齐预处理。
针对同传中为控延迟而产生的改写与概括,EviSI 用共享源证据与 Anchor/Event/Logic/Fluency 分工配合调和与确定性扣分来区分可接受变体与事实错误,在英中方向上恢复了人类系统总排序但在逐条输出上仍表现混杂。
该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。
语音识别 | 8.4/10
语音翻译 | 6.0/10
语音识别 | 6.5/10
语音翻译 | 6.9/10
语音翻译 | 8.2/10
语音翻译 | 6.4/10