📄 The Role of Disfluencies in Speech Translation

标签:#语音翻译 #基准测试 #音频理解 #Transformer #模型评估

6.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5

6.4/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #语音翻译 | #Transformer | #基准测试 #音频理解 | arxiv

👥 作者与机构

  • 第一作者:Maike Züfle(卡尔斯鲁厄理工学院)
  • 通讯作者:未说明
  • 作者列表:Maike Züfle(卡尔斯鲁厄理工学院)、Maria Teleki(德克萨斯农工大学)、Fabian Retkowski(卡尔斯鲁厄理工学院)、Vilém Zouhar(苏黎世联邦理工学院)、Oliver Grabner(德克萨斯农工大学)、Alexander Waibel(卡尔斯鲁厄理工学院、卡内基梅隆大学)、James Caverlee(德克萨斯农工大学)、Jan Niehues(卡尔斯鲁厄理工学院)

💡 毒舌点评

这篇论文为语音翻译中的不流畅现象做了一次扎实的"验尸报告":通过人类情感标注和基准构建,首次量化了去除不流畅对情绪感知的扭曲,问题定义清晰且有现实意义。然而,该工作本质上是对现有模型盲点的系统诊断,其贡献边界应更清晰地界定。方法层面的创新有限,推理时策略的改进幅度微小且未解决根本问题——如果加两个上下文示例就能提升5个chrF点,那只能说明当前模型离解决此问题只差一点点提示工程,所谓的"盲点"可能更多是训练数据分布偏差,而非真正的认知缺陷。

📌 核心摘要

这篇论文系统研究了口语中不流畅现象(filled pauses、false starts、self-repairs等)在语音翻译中的角色,核心论点是:不流畅携带情感和语用信息,应在翻译中保留。论文首先通过受控人类情感标注实验,证明去除不流畅会改变听者感知的情感极性(如负面标签分享率在某些极端案例中变化高达71个百分点)。基于此发现,作者构建了Uh-Mazing基准,包含从Switchboard语料库中精选的80条话语的640条人工翻译,覆盖英语到8种目标语言(阿拉伯语、捷克语、德语、西班牙语、法语、印地语、意大利语、普通话),每条源话语配有disfluent/fluent双文本和对应音频,且目标语言侧同样标注不流畅位置。实验评估了级联(Cascaded)、端到端(End-to-end)、SpeechLLM和商业模型四类架构,发现false starts和self-repairs(EDITED类型)是翻译质量下降的主因,而filled pauses(INTJ)和discourse markers(PRN)几乎无影响。通过人类标注的错误分类体系(3154个错误跨度),论文指出模型失败时以删除不流畅为主(1098个跨度)而非误译(446个跨度)。此外,论文探索了束搜索(Beam Search)和上下文学习(ICL)等推理时策略,发现ICL可在不牺牲COMET的情况下提升chrF最多5个点,实现风格保留与意义保留的部分解耦。

下图可视化了这一情感强度变化。

Paper Figure 1

图中显示,去除不流畅性后,大多数情绪的感知强度增加,仅厌恶情绪降低。

主要实验结果显示:级联系统Tower with Human Transcript在开源模型中表现最佳(EN→X方向德语chrF达61.34,西班牙语达64.05),商业模型中ChatGPT with ASR Transcript领先(德语chrF 62.28)。所有系统的意义保留得分均高于风格保留得分,端到端模型Canary的差距最大。消融实验证实,仅EDITED类型不流畅导致COMET-Kiwi下降3-4分,而INTJ和PRN几乎无影响。

实际意义在于为语音翻译系统在助听可穿戴设备、多语言会议、配音等应用场景的部署提供了基准和实用指导。主要局限包括:基准规模较小(80条话语),推理时策略的改进幅度有限且未从根本上解决模型训练问题,跨语言情感感知的一致性未经验证。

🔗 开源详情

  • 代码:论文声明实验代码将在LDC批准后与数据集一同发布,但未在本论文中提供具体代码仓库链接。当前状态为"论文中未提及代码链接"。
  • 模型权重:论文未发布新模型权重,所有实验基于已有预训练模型或商业API,因此当前状态为"论文中未提及"。
  • 数据集:Uh-Mazing基准,基于Switchboard构建,包含英语到八种目标语言(阿拉伯语、捷克语、德语、西班牙语、法语、印地语、意大利语、中文)的640条人工翻译及不流畅标注,以及对应的音频文件(来源于Switchboard)。论文声明将提交至Penn LDC公开发布,但因此数据集包含Switchboard的音频和标注衍生作品,需遵循LDC许可协议,在论文发表时可能无法立即公开获取。当前无直接下载链接。
  • Demo:论文中未提及。
  • 复现材料:论文在附录中提供了详细的提示模板、标注指南和界面截图,有利于人类实验部分复现。但缺乏模型推理的精确配置(版本号、随机种子),影响了系统评估部分的完全复现。
  • 论文中提及的开源项目:
    • Canary(Sekoyan et al. 2025,论文未给出链接)
    • Whisper(Radford et al. 2022,论文未给出链接,常见地址 https://github.com/openai/whisper
    • Tower(Rei et al. 2025,论文未给出链接)
    • Llama(Grattafiori et al. 2024,论文未给出链接,常见地址 https://github.com/meta-llama/llama
    • OWSM(Peng et al. 2023,论文未给出链接,常见地址 https://github.com/espnet/espnet
    • Phi-4-MM-instruct(Abdin et al. 2024,论文未给出链接)
    • Qwen2.5-Omni(Xu et al. 2025,论文未给出链接)
    • COMET-Kiwi(Rei et al. 2022,论文未给出链接)
    • Stanza(Qi et al. 2020,论文未给出链接)
    • chrF指标实现(未明确给出具体库名)

🏗️ 方法概述和架构

本论文以构建基准和系统分析为核心方法,而非提出新的模型架构。整体方法论分为三个阶段:

第一阶段:人类情感标注实验(Section 2) 从Switchboard语料库中手工选取80条富含不流畅的话语(长度17-212词,中位数51词,总计25分钟音频),设计了三种信息丰度递减的实验条件:Audio(原始音频,含副语言线索和不流畅)、Disfluent(文本中保留不流畅标记如“um”“uh”和重复词,但去除副语言线索)、Fluent(文本中完全去除所有不流畅标记)。招募18名标注员,每人评价40条话语,每条话语在每种条件下由3名不同标注员独立评分,且同一标注员不会看到同一条话语的多个版本,以防止记忆效应。标注员可标记最多5个自由文本情绪标签,并按0-5强度评分。实验界面通过Pearmut平台提供。

为降低自由文本标签分析的主观性,论文采用两条独立流水线确保结论的稳健性:1) NRC EmoLex词典映射流水线:将自由标签通过三遍级联(直接表面形式匹配 → Snowball词干提取查找 → WordNet词元查找)映射至Plutchik的8种基本情绪(愤怒、恐惧、悲伤、厌恶、喜悦、信任、惊喜、期待),并归类为正/负/可变效价;2) OpenAI Embedding流水线:使用text-embedding-3-small模型将每个自由标签转化为嵌入向量,基于与正/负/中性种子词的余弦相似度判定效价。分析报告Cramér’s V和ε²效应量而非p值,并通过留一法(分别去掉每个标注员和每条样本)验证结论的稳定性。为探究LLM替代人类标注的可行性,论文还使用GPT-5.2在7个随机种子下复现实验,结果显示LLM自一致性高(r=0.86),但与人类的相关性低(平均r=0.35),远低于人类标注员之间的相关性上限(r=0.54),表明LLM尚不能替代人类完成此任务。

第二阶段:Uh-Mazing基准构建(Section 3) 基于前述80条Switchboard话语,通过Prolific众包平台进行两轮人工翻译。第一轮:标注员将英文不流畅源文本翻译为8种目标语言(阿拉伯语、捷克语、德语、西班牙语、法语、印地语、意大利语、中文,覆盖多样语系与文字系统),并要求用下划线(如 _uh_)标记译文中的不流畅token。第二轮:每种语言由第二位独立标注员审查第一轮译文,标准化不流畅标记,并间接提供置信度信号(两人一致比单人决定更可靠)。通过80对(每种语言10对)Prolific译文与母语专家译文的余弦相似度验证质量,使用text-embedding-3-large模型在移除不流畅标记后计算语义相似度,平均得分为0.878(σ=0.075),71/80对高于0.80,且排序在不同OpenAI嵌入模型下保持稳定。为分析不流畅的跨语言句法特征,使用Stanza依存解析器对所有语言的目标译文进行解析,计算每个不流畅前后最近内容词的依存关系分布,并分析翻译时上下文句法环境的保持率。

第三阶段:模型评估与推理策略(Section 4-6) 评估覆盖四种主要架构类别:1) 级联系统:ASR(Whisper large-v3或Canary 1B)+ 机器翻译(Tower 13B或Llama 8B),使用标准提示和带不流畅保留指令的提示两种变体,同时评估以人工转录为输入的情况,以隔离ASR错误的影响;2) 端到端模型:Canary和OWSM(OWSM不支持印地语,Canary不支持中文、印地语、阿拉伯语);3) SpeechLLM:Phi-4-MM-instruct和Qwen2.5-Omni,直接处理音频;4) 商业模型:GPT-5.2(ChatGPT)和Gemini-2.5-flash,评估时既支持音频输入也支持ASR转录和人工转录输入。

评估指标体系包含三个层次:自动指标(chrF,采用单词级分段,中文使用jieba分词;COMET-Kiwi,reference-free版本),LLM-as-a-judge(使用GPT-5.2对Style Preservation和Meaning Preservation两个维度进行0-100评分,分别在有参考译文和无参考译文两种设定下进行),人类评估(基于MQM/ESA协议,标注员对Style和Meaning进行0-100评分,并标记错误跨度和类别)。为系统分析错误模式,构建了包含General Errors(1553个跨度)和Disfluency Errors(1549个跨度)两大类的错误分类体系,标注员对每个错误跨度标记严重级别(Major/Minor)。推理时策略探索包括:束搜索(beam size 5/10/20)、温度采样(τ 0.2–1.0)和上下文学习(ICL,每次从参考池N=80中随机采样k=2个留一法示范对,排除当前测试项以防数据泄漏)。

关键设计动机在于:现有语音翻译系统将不流畅视为噪声并主动去除,但论文通过人类研究证明不流畅携带情感信号,因此需要基准和评估方法来度量系统的不流畅处理能力,并通过轻量级推理策略提供不重新训练的改进路径。该工作试图回答三个递进问题:为什么不流畅重要?当前系统表现如何?如何在不重新训练的情况下改善?

💡 核心创新点

  1. 首次系统量化不流畅的情感信息损失:通过Audio/Disfluent/Fluent三条件受控人类实验,证明去除不流畅会改变听者感知的情绪效价和强度。例如,流利文本条件的负面情绪感知强度最高,而原始音频的负面情绪感知最弱,这种"去不流畅→负面情绪放大"的模式在多数基本情绪上成立。使用效应量和留一法验证了结论的统计稳健性。

  2. Uh-Mazing多语言不流畅感知翻译基准:构建了覆盖8种类型学多样化语言(含非拉丁文字系统和形态丰富语言)的640条人工翻译基准,每条源话语配有disfluent/fluent双文本和对应音频,且目标语言侧同样标注不流畅位置。相较于仅覆盖单一语言对(英语-法语)的现有数据(Post et al., 2013),该基准在语言覆盖、标注细粒度和研究专用性上均有显著提升。

  3. 不流畅类型细粒度消融分析:通过将Switchboard标注的INTJ/PRN/EDITED三种不流畅类型系统性地重新插入fluent文本,首次分离出false starts和self-repairs(EDITED类型)是导致翻译质量下降(COMET-Kiwi下降3-4分)的唯一主因,而filled pauses和discourse markers单独或组合均无显著影响。这一发现揭示了不同类型不流畅在机器翻译中的不对称难度。

下图具体展示了不同不流畅类型对翻译性能的影响。

Figure 5: EDITED-type disfluencies drive the drop in translation performance.

图中可见,仅EDITED类型(假启动和自我修正)导致COMET-Kiwi分数显著下降,而INTJ和PRN类型几乎无影响。

  1. 不流畅翻译错误分类体系:通过人类标注构建了覆盖General Errors(语言错误、缺失内容等)和Disfluency Errors(删除、类型失配、多余不流畅等)两大类的多层次错误分类法。关键发现是模型对不流畅的主导失败模式是删除(1098个跨度)而非误译(446个跨度),且这一模式在多种语言和模型间高度一致,刻画了当前系统的系统性行为偏差。

下图总结了人工标注的错误分类结果。

Paper Figure 3

图中显示,删除不流畅性是主要的失败模式,其次是缺失内容和错误语言。

  1. 不重训练的推理时策略对比与解耦改善:系统性比较了束搜索、温度采样和上下文学习对不流畅翻译的影响,发现ICL可在几乎不影响语义质量(COMET变化<0.2点)的情况下提升chrF最多5个点,表明风格保留与意义保留可以通过推理时策略实现部分解耦,为实际部署提供了低风险、低成本的改进路径。

下图比较了不同解码策略和上下文学习对翻译质量的影响。

Figure 6: Decoding methods shape overall quality (COMET), while ICL improves disfluency preservation (chrF).

图中显示,束搜索和上下文学习能提升不流畅保留(chrF),而解码策略主要影响整体质量(COMET)。

📊 实验结果

模型类别代表系统输入条件ARCSDEESFRHIITZH
CascadedTowerHuman transcript22.3952.9061.3464.0563.6561.4362.9325.89
CascadedLlamaHuman transcript16.6443.9756.3061.4059.2933.2559.1117.07
CascadedTowerCanary ASR22.8744.4353.8654.4055.6752.2453.2121.13
CascadedLlamaWhisper ASR30.0237.9649.1951.7851.6938.9949.1113.59
End-to-endOWSMAudio26.4727.3847.7643.0243.17-40.9315.37
End-to-endCanaryAudio-43.8952.1351.6554.30-52.80-
SpeechLLMPhi-4Audio5.738.0145.7946.0327.123.5649.5814.28
SpeechLLMQwen2.5-OmniAudio17.3210.6120.9018.0218.2711.7821.2812.65
CommercialChatGPTASR transcript44.9754.1962.2860.9262.1256.1760.3426.42
CommercialGeminiAudio37.1548.9755.2458.5456.8315.9057.607.13
CommercialChatGPTHuman transcript35.6750.2959.8665.1666.0249.7566.2924.66
CommercialGeminiHuman transcript38.0046.1852.6252.5153.4447.1854.6826.31

表:EN→X方向 chrF 分数(标准提示)。数据来源:Table 2 和 Table 5。

不流畅类型组合COMET-Kiwi变化(相对Fluent基线)
INTJ only~0
PRN only~0
INTJ + PRN~0
EDITED only-3至-4
EDITED + INTJ-3至-4
EDITED + PRN-3至-4
ALL (Disfluent)-3至-4

表:不流畅类型对COMET-Kiwi的影响(4个文本模型×8语言池化)。数据基于Figure 5。

解码策略Tower chrF变化(相对Greedy)Tower COMET变化(相对Greedy)
Beam search(n=10)+1至+3+1.5至+2.5
Temperature(τ=0.6)-2至-4-1至-2
ICL(k=2)+3至+5< +0.2

表:推理时策略效果(EN→X平均,基于Figure 6)。

人类评估显示,所有系统的Meaning Preservation得分均高于Style Preservation,大多数系统-语言组合的数据点位于对角线之上,表明风格-意义差距是跨系统、跨语言的稳健现象。其中端到端模型Canary的差距最大。错误分类中,三个类别——Incorrect Language、Missing Content和Deletion——合计占所有3154个注释跨度的近四分之三。单独来看,Deletion是最大的类别(1098个跨度),超出所有其他Disfluency Error类别(Extra Disfluencies + Type Mismatches合计446个跨度)的总和。

🔬 细节详述

  • 训练数据:本论文不涉及模型训练,所有评估的模型均为预训练模型或商业API。基准构建使用Switchboard语料库(英语电话对话语音,含词汇级不流畅标注)。
  • 损失函数:未涉及(无训练)。
  • 训练策略:未涉及。
  • 关键超参数
    • 解码策略:greedy baseline, beam search(n=5/10/20),temperature sampling(τ=0.2/0.4/0.6/0.8/1.0),beam sampling,typical-p sampling
    • ICL:k=2 demonstrations,留一法采样,从参考池中均匀随机选取
    • LLM judge:GPT-5.2-2025-12-11,温度等API调用参数未说明
    • 情感分析流水线:NRC EmoLex(三遍级联:直接匹配→Snowball词干→WordNet词元),OpenAI text-embedding-3-small
    • 翻译质量验证嵌入模型:text-embedding-3-large(也测试了text-embedding-3-small和ada-002)
    • 句法解析器:Stanza
  • 训练硬件:未涉及。
  • 推理细节:级联系统ASR使用Whisper large-v3和Canary(1B参数),机器翻译使用Tower(13B)和Llama(8B);端到端模型使用OWSM和Canary;SpeechLLM使用Phi-4-MM-instruct和Qwen2.5-Omni;商业模型使用GPT-5.2-2025-12-11和Gemini-2.5-flash。提示模板在正文和附录Figure 11中完整给出。对于音频输入模型,标准提示为"Listen to the following audio and translate the speech into {target_language} text.";不流畅感知提示为"Listen to the following audio and translate the speech into {target_language} text, keeping any disfluencies (such as ‘um’, ‘uh’, repetitions, and hesitations) in the translation."。对于文本输入模型,“Listen to the following audio"替换为"Translate the transcribed speech."。
  • 评估细节:chrF使用单词级分段(中文用jieba分词),COMET-Kiwi为reference-free版本。指标与人类判断的相关性分析使用Kendall’s τ(段级)和Soft Pairwise Accuracy(系统级),在Table 1和Table 9中详细报告。人类评估中前20条话语由3名标注员独立评分以确认标注员间信度(Leave-One-Out Soft Pairwise Accuracy:风格96.1%,意义94.0%)。LLM judge的有参考译文提示提供参考译文,无参考译文提示则省略。ASR的WER分别基于disfluent和fluent参考文本计算,同时报告E-Score和Z-Score(Table 7)。

⚖️ 评分理由

  • 创新性 (1.2/2):首次通过三条件人类实验量化不流畅对情感感知的影响(SCORING_SOURCE_6/38),构建了首个多语言不流畅翻译基准Uh-Mazing,覆盖8种类型学多样语言并有细粒度不流畅标注(SCORING_SOURCE_3/38),通过EDITED类型消融揭示性能下降主因,并提出了错误分类体系和推理时策略实现风格与意义解耦,对问题认识和方法论均有明显贡献。

  • 技术严谨性 (1.0/1.5):基准构建整体方法合理,但翻译质量验证仅依赖嵌入相似度,未提供标注员间信度或不流畅标记一致性度量,使基准的标注可靠性未得到充分定量支持(A_METHOD)。其余协议设计严谨,未见明显逻辑错误。

  • 实验充分性 (1.0/1.5):实验覆盖面较广,但存在多项削弱结论支撑的不足:基准规模仅80条话语,覆盖面有限(A_LIMITS自认局限1);情感标注实验采用between-subject设计,因果推断受标注员个体差异潜在混淆(A_LIMITS审稿人发现1);未讨论Switchboard数据泄漏风险,可能高估商业模型表现(A_LIMITS审稿人发现2);LLM judge的效度未经针对不流畅翻译偏向的消融验证(A_LIMITS审稿人发现3);错误分类的跨语言异常(如印地语)未深入分析(A_LIMITS审稿人发现4);情感标签两条流水线未交叉验证Kappa一致性(A_LIMITS审稿人发现6)。这些导致声明的实验支撑有可见局限。

  • 清晰度 (0.9/1):论文整体结构清晰,问题定义明确,实验设计与分析步骤交代有序,图表助益理解,附录提供了完整的提示模板和标注指南,可读性良好。

  • 影响力 (1.0/1.5):为语音翻译领域提供了首个系统分析不流畅情感信息损失及其翻译影响的基准,对助听可穿戴设备、多语言会议等应用中系统评估与改进有指导意义,但受众主要限于语音翻译及对话系统研究群体。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):附录提供了提示模板、标注指南和界面截图,有助于人类实验部分复现,但系统评估部分缺少模型推理的精确配置(版本号、随机种子),影响完全复现(A_OPEN)。

  • 工程/实践价值 (1.0/1.5):提出的推理时策略(ICL、束搜索)可在不重新训练下提升不流畅保留,基准与错误分类体系为实际部署评估和调试提供了低成本方案;但ICL增加推理计算开销且改善幅度有限,部分限制了实践采纳的直接性。

🚨 局限与问题

论文明确承认的局限

  1. 基准规模有限(80条话语),可能不足以覆盖口语不流畅的全部多样性类型和上下文变化。
  2. 推理时策略的改进不足以完全弥合风格-意义差距,需要训练层面的改进(如将不流畅保留作为显式训练目标)。
  3. 未验证保留的不流畅在目标语言中是否对听者传达相同的语用和情感含义(跨语言、跨文化的情感等价性未验证)。
  4. 中文、阿拉伯语等非拉丁语系的表现显著低于欧洲语言,跨语言泛化性有待研究。

审稿人发现的潜在问题

  1. 因果推断需更谨慎:论文在Section 2声称"去除不流畅放大负面情绪”,但实验设计是不同标注员评价不同条件(between-subject design),而非让同一标注员对比同一话语的不同版本(within-subject design)。观察到的效应可能部分归因于标注员个体差异或对特定条件的选择偏差,而非纯粹的条件效应。虽然留一法验证提供了稳健性证据,但无法完全排除这一混淆因素。使用更直接的对比式实验设计(如同一标注员评价Fluent/Disfluent对)可获得更强的因果证据。

  2. 基准的数据泄漏风险:80条话语均选自Switchboard,而Switchboard是公开语料库,很可能被部分预训练模型(尤其是SpeechLLM和商业模型)的训练数据所包含。论文未讨论这种潜在的训练数据污染问题,也未采取措施(如canary strings或近邻检索)来检测或缓解数据泄漏。考虑到商业模型(ChatGPT、Gemini)可能已将Switchboard纳入训练,其在基准上的领先表现可能部分得益于数据记忆而非泛化能力。

  3. LLM法官的效度疑云:Table 1显示LLM judge(有参考译文)与人类判断的相关性最高,但论文的核心主张是当前的翻译系统和评估指标都偏向"流利"输出。LLM本身也是训练用于生成流利文本的模型,其作为裁判时可能继承同样的偏见——即系统性高估流利译文的Style Preservation或低估了保留不流畅的价值。论文未对此进行消融或验证,构成了方法论的潜在循环。建议补充LLM judge在Fluent文本基线(应得低Style分)和Disfluent文本基线(应得高Style分)上的评分分布,以验证其能正确区分。

  4. 错误分类的跨语言一致性:论文发现Deletion是主导失败模式,但在印地语上,Incorrect Language、Missing Content和Deletion三类别仅占65%错误(其他语言为70-84%),且Disfluency Type Mismatch比例较高。这可能指示:a)印地语的翻译质量较低,标注员难以区分删除和误译;b)不流畅在印地语中的语言实现方式与英语差异较大,导致type mismatch增多。论文未深入分析此异常是否由标注质量、语言特性还是模型行为导致,影响了结论的跨语言普适性。

  5. ICL改善的实践意义存疑:ICL的+3至+5 chrF点提升在统计上有意义,但从感知角度看可能微小(特别是对于不流畅这种局部现象,整体chrF提升可能来自少数几个不流畅token的正确保留)。更重要的是,ICL显著增加了推理延迟和存储成本(每个测试样例需附加k=2个完整示范对,且需要在参考池中进行检索或采样),论文未对这种性能提升与计算开销之间的trade-off进行讨论。

  6. 情感标签流水线的效度未交叉验证:NRC EmoLex和embedding两条流水线虽降低了对单一方法的依赖,但论文未报告两者的一致性(如Kappa系数)。如果两条流水线对同一批自由标签给出的效价分类高度一致,则结果更可信;如果不一致,则需分析分歧原因。论文仅分别展示两条流水线的结论方向一致,但缺乏定量的一致性分析。

  7. 与下游任务的断连:论文成功论证了不流畅携带情感信息,且当前系统无法保留它,但最关键的问题仍未回答:保留不流畅的翻译是否真的改善了终端用户的情感理解或交互体验? 例如,如果一位德语听众听到保留"ähm"的翻译,其感知的犹豫程度是否与英语原听众听到"um"时一致?音韵、时长、频率的跨语言差异都会影响感知等价性。这一task-based evaluation的缺失使得论文的最终主张"不流畅应在翻译中保留"缺少面向用户的终端证据。

  8. 不流畅翻译的"过度保留"风险:论文主张保留不流畅,但部分不流畅类型(如英语中的"you know"、“I mean”)在不同语言中可能有惯用的对应表达(如法语的"tu sais"、“enfin”),直接字面翻译可能生成目标语言中不自然的文本。论文未讨论"保留"与"本地化"之间的张力,也未在人类评估或LLM judge中纳入"译文自然度"这一维度。


← 返回 2026-08-04 语音/音乐/音频论文速递