论文解读

字幕块太碎翻不好:先固定时间,再用整句重写文本

该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。

 · 更新于 2026-09-24 · 约 17 分钟 · 8262 字 阅读 →
论文解读

把连续打分变钝一点:用分桶平局校准提升语音翻译质量估计的段级排序

针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。

 · 更新于 2026-09-24 · 约 17 分钟 · 8271 字 阅读 →
论文解读

让编码器自己学要看多远:动态前视掩码在同时语音翻译中的验证

该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。

 · 更新于 2026-09-24 · 约 15 分钟 · 7200 字 阅读 →
论文解读

宣称支持不等于可用:AfriVox 测出非洲语言与口音下的转写崩塌与翻译分化

AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

语义不够声学来凑行不通:用理解型词元做输入、声学词元做输出的统一建模

针对文本大模型向语音统一理解与生成迁移时模态鸿沟大、单一种词元难以兼顾语义与声学的问题,该文提出理解驱动分词器与双词元建模并用约 4500 小时数据验证,理解与生成可相互促进,但细粒度声学保留与翻译类任务仍有代价与边界。

 · 更新于 2026-09-24 · 约 17 分钟 · 8046 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

边听边译不重算:全单向架构如何让大模型学会何时读、何时写

针对同声传译需在部分语音下增量输出的问题,EASiST 用多延迟语义分块构造单调交错数据、全单向语音编码器加 LLM 与轻量读写策略头经三阶段训练实现自适应低重算推理,在 MuST-C 与 Europarl-ST 英德英西上取得更好的延迟质量权衡,但自适应增益依赖分块对齐质量与阈值调节。

 · 更新于 2026-09-24 · 约 19 分钟 · 9178 字 阅读 →
论文解读

多语言共用低秩空间为何冲突:MoLoRA 用共享与路由专家分开建模

针对多语言端到端语音翻译中共用单组低秩更新导致语言间干扰的问题,MoLoRA 把多个低秩适配模块当作专家并辅以多粒度语音融合,在 MuST-C 八语言平均 32.2 与 CoVoST-2 三语言平均 36.3 的 BLEU 下超过同量级单 LoRA,代价是路由与负载均衡等额外机制和调参成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10072 字 阅读 →
论文解读

不追求逼真、追求可控:用功率谱模板与小规模搜索做语音翻译鲁棒训练

针对语音到文本翻译在真实噪声下不稳定的问题,论文用可解释环境模拟器加功率谱模板原型约简与 27 组小规模超参数搜索组织鲁棒训练,在相同数据预算下使模拟噪声训练与真实噪声训练表现接近,代价是混响与精细调度需另行取舍且最优配置只在搜索范围内成立。

 · 更新于 2026-09-24 · 约 18 分钟 · 8894 字 阅读 →
论文解读

同样的文字为何译法不同:用双分支把重音和情绪送进语音翻译

针对端到端语音翻译只对齐文字内容而丢失重音与情绪的问题,论文用语音编码器与风格编码器双分支加分层最优传输和注意力检索来分离并再融合两类信息,在 ContraProST 上提升方向性约 5.0 点、全局约 4.5 点,在 CoVoST-2 上 2B 平均提升 0.43 BLEU、8B 提升 0.98 BLEU,代价是两阶段训练与额外风格编码器开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8473 字 阅读 →
论文解读

等还是说:REINA 用信息增益把非流式翻译模型改成同传模型

针对同传要在质量与延迟之间选读或写的问题,REINA 用完整音频与截断音频下对数概率之差估计信息增益来训练独立策略网络,在 MUST-C 与 CVSS-C 上提升归一化流效率,但截断适配训练与单调约束不可缺且德语高延迟点仍有反例。

 · 更新于 2026-09-24 · 约 16 分钟 · 7713 字 阅读 →
论文解读

不等整句就翻译:用句法块教会大模型何时等待、何时落笔

针对同声传译需在流式语音下联合决定何时翻译与翻译什么的问题,SASST 用句法感知分块加目标侧重排构造含等待符号的流式监督并统一到冻结 Whisper 编码器加解码器大模型中,在 CoVoST2 英德英中英日上以 2 到 4 秒级延迟取得质量优势,其代价是依赖句法分析器与额外的对齐预处理。

 · 更新于 2026-09-24 · 约 18 分钟 · 8531 字 阅读 →
论文解读

在允许改写的前提下如何判定语义丢失:EviSI 的证据对齐与分层扣分

针对同传中为控延迟而产生的改写与概括,EviSI 用共享源证据与 Anchor/Event/Logic/Fluency 分工配合调和与确定性扣分来区分可接受变体与事实错误,在英中方向上恢复了人类系统总排序但在逐条输出上仍表现混杂。

 · 更新于 2026-09-24 · 约 20 分钟 · 9804 字 阅读 →
论文解读

卡住最强翻译模型:难例众包与逐条验证规则

该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。

 · 更新于 2026-09-24 · 约 22 分钟 · 10621 字 阅读 →
论文解读

当解码器缺的不是声音,而是下一词的语义证据

语音识别 | 8.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11111 字 阅读 →
论文解读

翻译丢掉的不只是词:当语调跨越语言还能剩下多少?

语音翻译 | 6.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8041 字 阅读 →
论文解读

The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7035 字 阅读 →
论文解读

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

语音翻译 | 6.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5820 字 阅读 →
论文解读

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

语音翻译 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7762 字 阅读 →
论文解读

The Role of Disfluencies in Speech Translation

语音翻译 | 6.4/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10618 字 阅读 →