论文解读

把离线 Canary 搬进同传:AlignAtt 截断如何换来口袋模型的低延迟

该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。

 · 更新于 2026-09-24 · 约 17 分钟 · 8024 字 阅读 →
论文解读

长语音同传评测为何卡在切句与时间戳:一条可复现的三段式流水线

针对长时连续语音到语音同传难以复现评测的问题,论文用目标端语音识别加强制对齐恢复词级时间戳、再用句嵌入对齐切分到源语句组的方法,在约 10 分钟与约 45 秒两类语音上验证可行,并报告延迟随输入变长而累积的主要代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

转录质量决定翻译上限:WhiNN-ST 用级联与路由选择做低资源语音翻译

该研究针对博杰普尔语到印地语和爱尔兰语到英语的低资源语音翻译,采用先转录后翻译的级联路线,比较不同语音识别前端与直接和经中间语言的翻译路由,最强证据是博杰普尔语开发集上直接翻译取得 BLEU 25.59、chrF++ 42.48、TER 63.83,代价是爱尔兰语需换专用识别模型才达到全覆盖且仍依赖代理诊断而无标准翻译分数。

 · 更新于 2026-09-24 · 约 19 分钟 · 9225 字 阅读 →
论文解读

没有交叉注意力时如何做 AlignAtt:把源文钉在提示词里再重算对齐块

论文把英语语音同传拆成 Qwen3 语音识别加强制对齐与 Gemma-4 解码器翻译的同步级联,用显式源文区间加离线挑选的 8 个对齐头加 qk-fast 重算实现解码器侧 AlignAtt,在英德和英意低延迟约 2 秒与高延迟 4 秒内超过主办方基线,代价是中文方向不稳定且全头重算会明显抬高计算感知延迟。

 · 更新于 2026-09-24 · 约 20 分钟 · 9819 字 阅读 →
论文解读

不做跨注意力:把音频当作前缀塞进冻结大模型的翻译管线

AURA-ST 针对豪萨语、伊博语、约鲁巴语到英语的低资源语音翻译,用双流声学编码加 4 倍卷积压缩把音频变成冻结 Gemma-4-E2B 的前缀,并只调 MLP 的 LoRA,在教师强制代理 BLEU 上达到 91.29,但自由自回归解码的 SpBLEU 仅为 19.5、5.2 和 4.6,暴露了严重的暴露偏置代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9452 字 阅读 →
论文解读

跨语种克隆要在说得对与听得出是谁之间做取舍

该研究以英语参考音频为输入对比四种零样本跨语种克隆系统,报告了以 VoxCPM2 在阿拉伯语上同时取得 0.25 词错误率和 0.72 说话人相似度为代表的权衡证据,而代价是多数系统仍在可懂度与身份保留之间此消彼长且仅两套系统支持阿拉伯语。

 · 更新于 2026-09-24 · 约 18 分钟 · 8918 字 阅读 →
论文解读

先转写再执行:用翻译大模型统一语音识别、翻译与问答的指令跟随系统

该工作用翻译导向大模型加语音编码器处理英文语音并执行英中意德指令,以先转写后作答的思维链复用纯文本监督,在 IWSLT 2025 评测上翻译与问答达到可比最优,代价是语音编码器只训练约 0.8 轮且依赖后编辑修正格式。

 · 更新于 2026-09-24 · 约 20 分钟 · 9567 字 阅读 →
论文解读

加泰罗尼亚语到英语:级联为何仍压过端到端,瓶颈在语音端而不在翻译端

针对加泰罗尼亚语到英语方言语音翻译任务,论文比较了两种级联与一种端到端系统,最强证据是 Whisper-v3 加 NLLB 级联取得 44.7 BLEU 和 65.1 chrF,而代价是依赖大规模外部语音与文本预训练和两段式推理链路。

 · 更新于 2026-09-24 · 约 19 分钟 · 9290 字 阅读 →
论文解读

把等待学进模型里:用原生音频大模型做无切分同声传译

针对无句子边界的长音频与计算感知延迟限制,用冻结音频编码器的 Qwen3-Omni-30B-A3B 只训练语言侧 LoRA 并以内化的``策略做读写决策,在官方开发集低延迟档取得英中 40.5 BLEU 与英德 27.7 BLEU,代价是依赖合成目标与固定块推理的折中。

 · 更新于 2026-09-24 · 约 17 分钟 · 8210 字 阅读 →
论文解读

4 比特保翻译、3 比特现悬崖:Diet-KIT 如何把 16 GB 语音大模型压进 4 GB

针对 Qwen2-Audio-7B 语音翻译压缩到 4 GB 磁盘的问题,Diet-KIT 用 HQQ 分组量化打底、嵌入低比特加敏感度选层补足、AWQ 校准收尾,在 ACL 60/60 上以 3.98 GB 取得 en→de COMET 74.4、en→zh 77.1,代价是全模型统一 3 比特会使 BLEU 与 COMET 断崖式下跌。

 · 更新于 2026-09-24 · 约 17 分钟 · 8127 字 阅读 →
论文解读

短模型拉长用:固定切分为何在长语音指令跟随中最稳

该研究用同一套语音大模型先做短语音指令跟随再扩展到长语音,比较三种切分策略,最强证据是固定 30 秒切分取得 2.0663 的 HIFS 分数,代价是长摘要与章节任务仍不稳定且幻觉以重复插入为主。

 · 更新于 2026-09-24 · 约 16 分钟 · 7988 字 阅读 →
论文解读

为 Badini 补上语音基准:5224 条平行语音文本如何翻译、录制与验证

针对北部库尔德语 Badini 变体缺平行语音文本问题,论文用 2000 句英译巴迪尼加 45 人录音验证得到 5224 条 15 小时 40 分钟语料,最强基线 W2V-BERT CTC 在测试集词错误率为 55.07%,而语音到文本翻译 BLEU 仅 5.24,代价是小数据微调仍难克服方言与书写差异。

 · 更新于 2026-09-24 · 约 17 分钟 · 8452 字 阅读 →
论文解读

多加一路语音却没更准:语音翻译质量估计的音频困境

论文用语音大模型提示打分与 COMET 加音频回归两条路线检验源语音是否有用,在 IWSLT 2026 开发集上报告音频未稳定超过纯文本,而错配音频不掉点与技术内容占比高揭示了数据与建模代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7751 字 阅读 →
论文解读

长参考切短再选优:跨语言音色克隆如何兼顾内容与音色

针对中法跨语言音色克隆,该工作用 Qwen3-TTS-12 Hz-1.7B-Base 做零样本批量合成,配合 10 秒窗 5 秒步长的滑动切分与 ECAPA-TDNN 余弦选优,在中文 CER 低至 1.39% 至 2.25%、法语 WER 多为 4.40% 至 8.52% 的条件下得到中文最高 0.7052 与法语最高 0.7173 的余弦相似度,代价是保 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8929 字 阅读 →
论文解读

先转准再压短:Qwen3 级联字幕如何在时间戳不动下满足中文字幕行数与语速

该工作用流式语音识别加文本预处理加机器翻译加两阶段大模型压缩的级联管线做英译中自动字幕,在开发集上以压缩换合规并略微改善 SubER,而代价是保留时间戳不动且依赖确定性改写与人工规则阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8868 字 阅读 →
论文解读

长音频无切分条件下用两遍转写与语义合并压住幻觉的级联语音翻译

针对长时无切分英文到中文与德文离线语音翻译,论文采用 Silero VAD 加两遍转写与 150 词元语义合并的 Qwen3 级联路线,在 tst-2022 上报告 En-Zh COMET 0.8462 与 En-De 0.7854,最强证据来自两遍转写把 WER 压到 3.01%,代价是多模型串行推理与重分段计算开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9028 字 阅读 →
论文解读

不用转写也能打分:HydraQE 把语音和译文一起编码做质量估计

HydraQE 针对语音翻译无参考质量估计,用 Qwen3-ASR 同时编码源语音和译文假设,经稀疏层混合与双向重编码得到共享表示并用 DA、MetricX、xCOMET 三头监督加课程采样训练,在 IWSLT 2026 开发集与测试集段级别上超过级联文本基线,但不同预测头在语种与段级和系统级之间存在权衡且开发集系统级分数不稳定。

 · 更新于 2026-09-24 · 约 17 分钟 · 8320 字 阅读 →
论文解读

低资源下直连还是级联:博杰普尔语语音翻译的适配器与质量估计融合

针对博杰普尔语到印地语新闻领域语音翻译,论文比较了 Wav2Vec2 加 NLLB 解码器的端到端适配方案与 Whisper 加 NLLB 的级联加 QE 融合方案,最强可复述证据是开发集端到端 32.77 分与级联经 QE 融合后 COMET 提升,但测试集大幅回落暴露了标注噪声与适配器泛化瓶颈。

 · 更新于 2026-09-24 · 约 23 分钟 · 11075 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

英语音色说法语汉语为何走调:语言标签与词项检索如何稳住跨语种克隆

该工作以 FishAudio-S2-Pro 为基座研究英语参考到法语阿拉伯语汉语的跨语种克隆,用母语文字语言标签减少口音泄漏并以 GRPO 强化微调改善可懂度,再用推理时参考检索做词项匹配以稳住领域词发音,代价是汉语基线一度波动且说话人相似度与自然度总体保持稳定而非大幅提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7699 字 阅读 →