英文题目:Multilingual Long-Form Speech Instruction Following: KIT’s Submission to IWSLT 2026
会议身份:
conference:iwslt:2026:conference-paper-id:2026.iwslt-1.16
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#指令微调 #长音频处理 #多语言 #音频问答
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Enes Yavuz Ugan:机构信息未能从会议 PDF 纯文本可靠映射
- Maike Züfle:机构信息未能从会议 PDF 纯文本可靠映射
- Yuka Ko:机构信息未能从会议 PDF 纯文本可靠映射
- Supriti Sinhamahapatra:机构信息未能从会议 PDF 纯文本可靠映射
- Fabian Retkowski:机构信息未能从会议 PDF 纯文本可靠映射
- Seymanur Akti:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Niehues:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Waibel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为最长15分钟英语演讲长音频加自然语言指令,输出需按指令完成转写、翻译、问答、摘要与章节划分等多类结果,难点是仅见短音频的模型向长音频泛化退化严重且推理时任务身份未知。先将短语料片段拼接成15分钟长音频并用大语言模型合成问答、摘要与章节标签,职责是补齐长音频覆盖,输出带标注长音频训练集并送入混合训练。再以温度平滑采样按平方根比例混合多任务数据来训练端到端与级联系统,职责是平衡多任务分布,输出的17个候选转写与答案直接进入重排序。最后对候选做无任务先验的似然加最小贝叶斯风险重排序,职责是以最小贝叶斯风险为正则抑制似然偏置,输出兼顾转写与语义的最终结果。与短音频指令跟随相比,关键差异是将长音频覆盖成本转嫁给数据拼接与合成标注,并以重排序作为统一多任务的正则器,其意义是在未知任务条件下同时保住转写精度与语义质量。在MCIF-long固定指令评测下,重排序系统的WER为21.39,低于贪婪基线系统的WER37.65。该结论适用边界受限于学术演讲类英语长音频,德语与意大利语重排序无稳定增益,惊喜任务与真实噪声多说话人场景尚未验证,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/retkowski/chunkseg — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么长语音更难?
这篇论文研究的是多语言长语音指令跟随。输入是一段最长 15 分钟的英语语音,外加一条自然语言指令,指令会隐含任务和目标语言。输出可能是英文转写,也可能是德语、意大利语或中文的翻译,还可能是简短问答、摘要、章节结构或选择题答案。目标语言覆盖德语、英语、意大利语和中文,任务覆盖语音识别、语音翻译、口语问答、语音摘要、音频章节化和一个事先未知的惊喜任务。
对刚入门的读者,关键是理解长与短的区别。短评测通常是 30 秒以内的一句话,模型 1 次就能听全。长评测是讲座式连续语音,包含换气、停顿、背景噪声、幻灯片翻页和多人提问,信息密度沿时间展开。论文指出,多数模型依赖的编码器单次只能处理约 30 秒,即使新模型放宽结构限制,训练时也没有见过长音频,因此在基础转写上也会明显退化。这就是本工作的起点:没有长训练数据,就要先造长训练数据,再解决任务不平衡和推理质量问题。
开场需要保留的信息是:事实只来自论文原文证据,不引入外部评价;资源状态方面,论文提到的数据增强代码链接本次未能确认可达,因此不能写已公开可用;输出是 1 篇可复述方法的中文解读,重点是具体动作、实验条件和可核对数字。
同输入同目标的已有路线在比什么?
同输入同目标的工作是语音大模型。典型做法是在大语言模型外接预训练音频编码器,把语音特征映射成语言模型能读的表示,再用指令微调让模型按提示完成转写、翻译或问答。另一条路线是把音频和视觉编码器与语言模型一起训练,做成多模态基座模型。论文把自己放在指令型多任务一侧,区别于过去单任务或固定标记多任务的做法:任务和目标语言不再用专用标记硬切换,而是从自然语言提示中推断。
同运行阶段的对照是短指令跟随与长指令跟随。短指令跟随已有较多语料和评测,长指令跟随要求处理 15 分钟音频,现有短语料格式不匹配。论文引用的评测显示,即使基础转写也会因长度而退化,因此不能把短模型直接搬到长评测上用。相关工作的教训是:结构上支持长输入不等于训练中见过长输入,缺的是长监督。
同监督的对照是级联与端到端。级联先做语音识别再做文本推理,文本侧大模型强,转写准时翻译和问答都稳,但会丢失声学信息并受转写错误连累。端到端直接听音频作答,保留更多信息,对问答和摘要更有利,但长音频声学建模难,转写和翻译容易差。论文同时做两条线,正是为了在同一数据和同一指令模板下比较这种取舍。
要解决的三个具体困难是什么?
第一个困难是数据格式错位。现有语料多为 30 秒以下的短句,而长赛道要求最长 15 分钟。直接用短数据训练,模型学不到跨分钟的指代、主题延续和章节边界,评测时会因长度外推而失败。
第二个困难是任务与语言覆盖不全。6 个任务中除语音识别外都要支持 4 个语言对,但很多标注只有英文。学术讲座域的问答和摘要尤其缺非英语参考。如果只训英文,德语、意大利语和中文的指令跟随就无从学起。
第三个困难是推理时任务身份未知。重排阶段不能针对每个任务换策略,必须用同一种方法处理转写、问答、摘要和翻译。论文发现,单纯按模型概率选候选会系统性损害语义任务,而保守的共识方法又对转写没有帮助。如何在不知道任务的情况下兼顾两者,是方法设计的核心矛盾。
举例说明:假设输入是一段 12 分钟的英语学术报告,指令是请用中文简要回答某个问题。模型需要先听懂长上下文定位答案,再用中文简短作答。这个例子只是帮助理解输入输出形态,不代表论文报告过该样本的效果数值。
整体方法分哪几步,先走通一个样本?
整体分 3 段:先做数据增强把短语料变成长指令数据,再用两种结构做指令微调,最后在推理时生成多个候选并重排。训练语料总量超过 1,000,000 条,覆盖六任务和 4 个语言。
沿一个样本走一遍:取一段学术报告的长音频和一条中文问答指令,端到端模型把音频特征与指令文本一起送入语言模型,直接生成中文简短答案;级联模型先用识别模型把音频转成英文文本,再把转写文本与指令一起送入文本大模型生成答案。训练时每个样本随机搭配一种同任务同语言的指令表述,系统提示固定,以减少对固定模板的记忆。
端到端模型 × 级联模型: 端到端模型负责直接从长音频和文字指令生成答案,保留声学和韵律信息;级联模型负责先用语音识别转写再用文本大模型作答,依赖高质量中间文本。两者搭配的原因是转写敏感任务与语义推理任务对信息通路要求不同,组合意义在于用对照揭示误差传播与信息丢失的取舍,而不是认定其一全胜。
论文的主提交是端到端,对比系统是级联。两者用相同或可比的训练数据和超参数,以便把差异归因于结构而非数据。后续的重排都在主模型候选上做,级联只用于分析转写敏感任务的上限。
长音频和任务标签是怎么造出来的?
数据增强分 3 步。第一步是段拼接加说话人感知分组。做法是把同一会话、同一说话人的短段按时间连起来,只拼接有转写的部分,跳过无转写空隙,拼成 5 到 10 分钟的长音频。图书馆有声书按章节分组并在章节内保序,章节间打乱以混合声学条件;议会演讲按会话和说话人分组,人不够再补其他说话人。这样不用重新录音,就得到长音频与长文本对。
第二步是大模型标签生成。对没有摘要的视频,用参考转写加 3 篇同域摘要作示例,提示大模型生成长度相近、风格相近的类摘要,目标长度约 145 词;对缺学术问答的部分,用转写提示生成每段 5 个问题,4 个可答一个不可答;章节标注则用已有推理设置生成并过滤时长和质量。第 3 步是跨语言参考翻译,把英文参考译成缺失的德语、意大利语和中文,保证各语言都有监督。
段拼接 × 大模型标签生成: 段拼接负责把同一说话人或同一会话的短音频连成 5 到 10 分钟的长音频,解决长评测无长训练的问题;大模型标签生成负责为只有转写或无标注的长音频补写问答、摘要和章节标题。两者搭配的原因是只有音频没有任务监督无法训练,组合意义在于先造长输入再造长监督,使问答与摘要等任务获得可训练实例。
论文还说明了清洗动作:保留最长 15 分钟视频,过滤识别词错率过高的噪声样本,去掉括号中的音乐掌声等非词元标记但保留数字,图书馆转写做大小写和标点恢复,学术视频用识别模型补转写。这些动作的目的是让长训练更贴近评测的讲座域。
指令模板和章节化输出如何规定?
指令设计强调严格跟随。系统提示固定为只按指令办事、不加解释和追问,任务指令则每个任务每种语言准备多种表述,训练和验证时随机分配。论文的假设是:固定系统提示保证全局行为一致,多样任务提示减少模板记忆,提高对新表述的鲁棒性。附录列出每任务每语言的模板数量和示例,摘要模板还包含词数变量,训练时替换为目标长度。
章节化被定义为结构化转写,要求同时完成转写、分段和标题生成。输出用 Markdown 格式,每章一个 1 级标题,前后各有两个换行,再跟该章转写。这种格式约束使评测可以同时算分段质量和标题质量。选择题则用于增强泛化和准备惊喜任务,包含图书馆问答的选择子集和大规模口语理解选择题,并把问题译成缺失语言。
通用指令数据来自多任务翻译相关语料的子集,用语音合成把上下文转成音频,使模型在指令跟随微调时能引用语音。这部分被当作辅助任务,采样比例会被主动压低,避免挤占主任务。
采样、优化和链式思考标记是怎么训的?
训练数据极不平衡,问答和选择题占大头,语音识别只占约 2%。论文比较两种交织策略:手工固定概率和温度平滑采样。手工策略给语音识别 10%,问答 31%,选择题 9%,摘要 14%,翻译 13%,章节化 14%,通用指令 9%,依据是数据量和任务重要性。温度采样按数据集大小的幂次分配概率,温度为 1 时按比例,趋于无穷时趋于均匀,论文采用温度为 2,即按平方根分配。
温度采样 × 固定概率采样: 固定概率采样负责人为指定各任务抽样比例以补偿不平衡;温度采样负责按数据集大小的幂次自动分配概率,温度越高越接近均匀。两者搭配比较的原因是手工比例依赖经验而温度方法有原则可调,组合意义在于论文用对照说明平方根采样在多模态指令跟随中是更稳的默认选择。
优化方面,论文报告有效批量为 4、学习率为 1.0e-4 效果最好,优于更大批量和 1.0e-5 到 2.0e-4 范围内的其他学习率。为防显存溢出,截断长度设为 28000 个词元,因为 15 分钟音频约需 22500 个词元,留出生成余量。预热比例 0.1,总更新 60000 步,用秩为 32 的低秩适配。推理用贪心解码,最大长度 4096。论文未报告哪些参数冻结、梯度具体路径和重置时机,这些缺项不能从模型名推定。
链式思考式任务标记是负结果。做法是在目标前加任务标记、语言标记和可答性标记,顺序固定,标记向量加噪初始化,其他设置不变。结果是任务判别崩溃,语音识别输入几乎都被判成摘要,显式语音识别预测极少且只出现在真值为问答时。论文解释为前缀路由 grounding 弱,在任务相似且频率相近时易走捷径,需要更强的平衡或监督才能有效。
用什么数据选模型,每任务怎么算分?
模型选择用多模态跨语言指令跟随基准的长赛道,加上章节化视频集和图书馆选择题,还从每个验证切分抽小子集监控损失。语音识别、翻译、问答和摘要沿用基准的自动评测协议;章节化用领宽容差正负 3 秒的分段 F1 和全局拼接下的标题相似度,底层实现指向论文给出的代码链接,但该链接本次未能确认可达,因此只保留信息不写可用;选择题算准确率,要求去空格后与选项完全匹配;惊喜任务未知,训练时让模型判最相似已知任务并套用对应行为。
比较公平性方面,基线包括未微调的端到端和级联,微调后比较固定概率与温度采样,再做域内继续训练和检查点平均。提示分固定与混合两种,以检验模板鲁棒性。重排阶段每段生成 17 个候选:一个贪心、一个分段后贪心、15 个温度 0.8 采样,重排模型用基座多模态模型直接听音频,级联重排则先转写再用文本模型比较。任务身份在重排时未知,重排器只能看到音频、原指令和候选。
下表先回答数据规模问题:在不录新音频的前提下,拼接与过滤能留下多少长样本,总量如何分布。表前已说明比较问题是长训练是否可用旧资源拼出来,公平条件是同一 15 分钟上限和同一清洗规则,指标方向是样本数越多且越贴近讲座域越好。
| 条件 | 指标 | 视频过滤前 | 视频过滤后 | 总训练量 |
|---|---|---|---|---|
| 章节视频集长音频筛选 | 样本数 | 16,404 | 10,729 | 1,048,158 |
| 噪声过滤后保留 | 样本数 | 10,729 | 10,638 | 1,048,158 |
| 全任务四语言汇总 | 占比归一 | 100.00 | 100.00 | 1,048,158 |
| 文本清洗 | 非词元标记处理 | [music] | (applause) | 保留数字 |
| 摘要长度目标 | 词数 | 145 | 145 | 145 |
上述整理显示过滤分两步大幅缩减再小幅去噪,总量仍超百万,清洗保留数字而去掉噪声标记,摘要长度有明确目标。代价是过滤阈值和域筛选会丢掉部分样本,未胜出项是被滤掉的长视频和非学术话题视频,它们未进入训练,边界是超过 15 分钟的视频直接舍去。
主结果:谁在转写强,谁在语义强?
主结果在长赛道固定与混合提示下比较。未微调时,级联在转写和翻译上明显占优,端到端在问答和摘要上占优,这支持结构取舍的判断:专用长识别模型保转写,直接听音频保语义。微调后两者都提升,温度采样优于手工固定概率,域内继续训练再提升,检查点平均对部分任务继续增益,意大利域内微调主要改善该语言。分段评测显示主模型的差转写更多来自长度而非任务本身,分段后转写和翻译大幅回升,但问答和摘要预期内下降。
下表把可运行策略放在同一条件下比较,指标方向是词错率越低越好,问答摘要翻译分数越高越好,比较对象是未微调基线与微调后系统。表前问题是微调与结构谁解决什么,公平条件是同一长评测和同一自动协议。
| 条件 | 指标 | 端到端基线 | 级联基线 | 微调后级联 |
|---|---|---|---|---|
| 长语音识别 | 词错率 | 53.40% | 5.88% | 5.90% |
| 长语音翻译 | COMET | 68.65% | 80.81% | 83.72% |
表后解释是:级联保住了转写下限并把翻译推到最高,微调把问答和摘要从约 27% 和 13% 拉到 33% 和 28% 左右,但语义仍落后端到端主模型。未胜出项是端到端基线的转写,它在长音频下词错率超过 50%,说明结构支持不等于长训练充分。限制是这些是自动指标,不是人工评价,不能当成人评结论。
重排为什么能提转写却伤语义?
重排比较 6 种策略:似然、同时比较、顺序两两、循环赛、淘汰括号赛和最小贝叶斯风险,以及似然加风险的组合。候选多样性上限显示转写和问答有较大提升空间,摘要和翻译方差小、提升空间小。实际中没有单一方法全任务通吃:似然对转写提升最大,但大幅损害问答和摘要;风险方法保守,能保住问答但对转写无益;组合方法保留大部分转写增益并明显减轻语义损害,综合最好。
似然重排 × 最小贝叶斯风险解码: 似然重排负责用模型条件概率给每个候选打分,倾向选择模型认为最可能的文本;最小贝叶斯风险解码负责选与其他候选平均相似度最高的文本,倾向选择共识而保守。两者搭配的原因是前者太激进会误选切分候选,后者太保守对语音识别无增益,组合意义在于用共识约束似然,保留转写增益同时压低语义任务的误选。
机制分析指向两点。第一是位置偏置:顺序两两因贪心恒为擂主且恒在首位,表现出强首位偏好,循环赛因每对比较 2 次顺序而几乎消除偏置,括号赛引入轻微末位偏好且跨语言方差大。第二是误选分段候选:似然在问答和摘要中频繁选中分段候选,而分段对语义无益;风险方法因分段输出不流畅、相似度低而完全不选,但也错过转写中有益的分段;组合把问答和摘要的误选率降到个位数,同时在转写和翻译保留 20% 以上的选中率。
分段解码 × 整体长推理: 分段解码负责先切分长音频再逐段识别,声学上更稳但丢失跨段语义;整体长推理负责 1 次读入长音频并结合指令生成答案,保留全局上下文但声学难度大。两者搭配讨论的原因是重排时候选池同时包含两种来源,组合意义在于解释为何似然会偏爱分段候选,以及为何语义任务需要抑制这种偏好。
下表聚焦重排的得失,基线是贪心解码,数值是相对贪心的变化,转写用词错率下降为好,其余用分数上升为好。表前问题是在任务未知时哪种重排可部署,公平条件是同一 17 候选池和同一重排模型。
| 条件 | 指标 | 似然 | 最小贝叶斯风险 | 似然加风险 |
|---|---|---|---|---|
| 转写 | 词错率变化 | -24.93 | +3.09 | -19.28 |
| 问答 | 分数变化 | -11.06 | +0.22 | -3.33 |
| 摘要 | 分数变化 | -8.60 | -0.79 | -2.19 |
| 翻译 | 分数变化 | +0.93 | +0.27 | +1.09 |
表后解释是:似然最激进,转写大赚但语义大亏;风险最保守,语义不亏但转写不赚;组合用 1 次两两比较解决分歧,转写保留约 19 个点的增益,语义损害收窄到 3 个点以内。未胜出项是同时比较和各类两两变体,它们平均为负且受位置偏置影响。边界是德语和意大利语上没有方法稳定超过贪心,最终提交只在英语和中文用组合重排。
哪些结论有边界,哪些不能推广?
论文直接报告的是:在所用讲座域长评测和自动指标下,平方根采样更稳,域内继续训练有益,组合重排是任务未知时的默认好折中。这些是有限解释,支持的是该数据和该评测下的趋势,不等于所有语音任务都成立。总体趋势不等于每组每步都成立,例如德语和意大利语的重排就无稳定增益。
未验证的推测需要谨慎措辞。任务标记崩溃被解释为 grounding 弱和任务相似导致的捷径,这可能是合理的,但论文没有给出充分的因果对照,因此只能说可能或待验证。级联语义落后被归因于误差传播和音频信息丢失,这也是可能机制之一,不能当成已证明的唯一原因。
缺失证据不是技术错误,但要明确。论文未测量误判率、延迟、推理开销和训练硬件预算,也未报告参数冻结细节,因此不能承诺这些量得到改善。训练资源、推理开销与实际延迟要分开讨论:候选数 17 和两两比较次数直接决定重排调用量,循环赛开销最大,组合方法只在分歧时加 1 次比较,相对更省,但原文未给出 wall-clock 数字,所以不写具体加速比。
要复现先做什么,需要哪些具体设置?
先复现数据管线。按会话和说话人分组拼接短段,只拼有转写部分,目标 5 到 10 分钟,上限 15 分钟;章节视频先筛时长再按词错率阈值去噪,做括号噪声标记清洗和空白归一;有声书按章节保序拼接,议会数据按会话说话人拼接;缺失语言用翻译模型补齐,摘要用转写加示例生成并控制长度,问答按四可答一不可答生成。核对总量是否达到百万量级,再检查各任务语言是否都有覆盖。
再复现训练。系统提示固定,任务指令每任务每语言多模板随机分配;先比较手工固定概率与温度为 2 的采样,确认平方根采样是否在你的数据上更稳;用有效批量 4、学习率 1.0e-4、截断 28000、预热 0.1、60,000 步、低秩秩 32 起步,贪心解码最大 4096。域内数据继续训练和两检查点平均要单独做消融,因为多平均反而变差。
重排复现要保留可运行策略:贪心、分段贪心加采样共 17 候选,似然、风险和组合都要跑,不能只报上限。位置偏置要按公式算首位与次位误选差,误选率要按任务统计分段候选占比。代码方面,论文给出增强数据与检查点的发布名,但正文证据中的代码链接本次未能确认可达,因此复现前需先验证链接可达性,不能默认已公开可用。
何时值得尝试这套做法?
当你的评测是分钟级讲座而训练只有短句时,值得尝试拼接加标签生成加翻译的 3 段增强,因为它不用新录音就能造出长监督。采样上可直接从温度为 2 开始,它在本文中把不平衡的百万数据调得更均衡,且优于手工比例。结构上如果转写和翻译是硬指标,优先保级联或分段解码;如果问答和摘要更重要,优先保端到端整体推理。
当推理时任务未知且有多候选预算时,值得尝试似然加风险组合:先用似然提转写上限,再用共识压住语义误选。但要记住它在德语和意大利语上未稳定增益,上线前必须按语言分别验证。链式任务标记在任务相似且不平衡时可能崩溃,不建议直接照搬前缀路由。
还需补的验证是人工评价、跨域长音频、分段与整体的混合调度,以及重排开销与延迟的实测。只有补齐这些,才能把自动指标上的增益转成可部署的结论。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
另有 38 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

