英文题目:FBK’s Long-form SpeechLLMs for IWSLT 2026 Instruction Following
会议身份:
conference:iwslt:2026:conference-paper-id:2026.iwslt-1.29
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#指令微调 #长音频处理 #语音识别 #音频问答 #语音翻译
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Zhihang Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Marco Gaido:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Papi:机构信息未能从会议 PDF 纯文本可靠映射
- Matteo Negri:机构信息未能从会议 PDF 纯文本可靠映射
- Luisa Bentivogli:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为6秒至10分钟多语言语音加自然语言指令,输出需完成识别翻译问答摘要与章节切分,实际难点是长音频声学token过长、跨章上下文建模与重复幻觉扭曲评测。编码器先用SEAMLESSM4T-V2-LARGE将语音转为50Hz表征,适配器再以步长8卷积压缩至约6.25Hz并映射到2560维后前置拼接到指令模型输入。解码器由QWEN3-4B-INSTRUCT统一自回归生成多任务答案,长音频则先经固定窗或语音活动检测或混合分治分段再逐段推理并做正则去重后评价。与已有SpeechLLM的差异在于同一模型下受控比较三种分段策略,并引入幻觉惩罚分数HIFS对任务分加权求和以抑制插入型幻觉带来的虚高。在MCIF长轨评测下,含幻觉输出的CRDNN分段的WER为1.0161,高于去除幻觉输出的WER 0.1580。该结论适用边界受限于10分钟内演讲类语音与受限数据训练,长摘要与章节切分仍低分且噪声音乐等场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文解读的对象是语音大模型在指令跟随任务上的短长两轨实践。输入是语音加自然语言指令,目标是让同一个模型完成自动语音识别、语音翻译、语音问答、语音摘要和音频章节划分。短轨处理数秒的语音,长轨要处理数分钟甚至 10 分钟的语音。读者读完应当能复述三件事:模型由哪三部分组成并如何连接,短模型如何被扩展到长语音,以及为什么评估时要单独统计幻觉。
论文在受限条件下工作,只允许基于两个预训练模型构建系统,并用指定的语料加自制合成数据训练。短轨训练数据总量大但每条很短,长轨训练数据条数少但每条很长。验证主要在多语言跨任务的指令跟随基准上进行,短轨看识别准确率、翻译质量和问答质量,长轨还要看摘要并统计幻觉比例。
需要保留的关键信息是实验条件而非修辞判断。后文按学习依赖展开:先讲任务与相关路线,再讲方法全景,然后拆开编码器、适配器和解码器,接着讲数据构造与训练设置,再讲评估指标与切分策略,最后讲结果、幻觉分析和复现要点。教学用的例子会明确标为例子,不引入原文没有的数值。
同类路线在解决什么,本文与它们有何不同?
语音大模型的常见做法是用语音编码器接大语言模型,中间加一个模态适配器做压缩与对齐。这样做的好处是可以用语言模型的生成能力统一处理识别、翻译和问答等语音到文本任务,接口是自然语言指令。任务专用系统往往在单个指标上更专,但换任务就要换模型或换头。
长语音是这类工作的难点。长音频带来更长的声学标记序列、更大的上下文压力和更高的幻觉风险。原文提到上一年只有一支队伍参加长轨,说明把短语音模型直接搬到长语音并不平滑。已有的长语音识别语料工作和混合切分工作提供了思路,但指令跟随场景下哪种切分更有效仍需实测。
本文的不同在于受限条件下的完整对照。它固定模型架构,用同一套短模型直接扩展到长轨,比较固定窗口、基于神经网络的语音活动检测和混合 3 种切分,并引入幻觉惩罚分数重新排序。这不是提出全新编码器,而是回答 3 个可验证问题:长扩展能否保留短能力,切分影响多大,评估是否需要考虑幻觉。
为什么长语音不是把短模型直接拿来用?
可以打一个比方:短语音像听一句话并复述,长语音像听完一整节课再做笔记。后者不仅输入更长,而且需要跨句记忆、筛选重点并长时间保持生成不跑偏。比喻对应到真实系统就是三处压力:编码后序列变长导致显存与上下文紧张,话语级依赖要求模型记住前文人物与主题,解码变长后更容易出现重复或编造。
论文用一个样本流程说明问题。假设输入是一段 5 分钟的英语讲座,要求先转写再回答问题。理想路径是音频先变成帧级特征,再经编码器得到高层表示,经适配器压缩成少量语音标记,与问题指令一起送入解码器生成答案。如果直接把 5 分钟音频送入只见过 6 秒样本的模型,压缩后的标记数仍远超训练所见范围,解码器容易丢失位置感并开始重复。
因此研究问题被拆成 3 条假设:长扩展能否提升长任务同时保留短能力,切分是否显著影响指令跟随,以及是否需要幻觉感知的评估。举例来说,切分就是先把 5 分钟音频切成多段再分别处理,这会减少每段长度但也切断上下文,所以切分策略本身就是实验变量。
整体方法是如何把声音变成可执行指令的?
整体链路分为 3 段。第一段是声学前端与编码,把 16 千赫波形变成对数梅尔特征,再经卷积前端降采样并送入深层编码器。第二段是模态适配,先做约 8 倍的时间压缩,再用线性层把维度对齐到语言模型。第 3 段是指令解码,把语音标记前置拼接到指令文本嵌入之前,由大语言模型自回归生成输出标记。短轨与长轨共用同一架构,长轨只是在输入前增加语音切分。
下图展示了模型结构与两条训练流水线,左侧是通用架构,中间是短轨任务配置,右侧是长轨新增切分与更多任务。阅读时注意冻结与更新标记的含义,雪花表示冻结,火焰表示训练。
看图路径: 1. 先从底部波形向上追踪语音编码器到模态适配器再到大语言模型的主路径;2. 对比中间短轨与右侧长轨在底部任务框数量上的差异;3. 观察大语言模型旁低秩适配器与模态适配器上火焰与雪花标记的分工;4. 确认右侧长轨新增语音切分模块的位置与作用
论文图 1。原论文 Figure 1:“Model architecture and training pipeline of the SpeechLLMs for the short and long tracks.”。
从像素可见,3 个面板自下而上都是从音频或任务框出发,经过语音编码器、模态适配器、提示与大语言模型到达输出标记。中间面板底部只有 3 类短任务框,右侧面板底部扩展为 5 类任务框并在编码器下方多出语音切分堆叠框。右侧低秩适配器画成两层结构,左侧与中间画成单层加旁路,说明长轨训练配置与短轨略有差异。模态适配器在 3 个面板中都位于编码器与语言模型之间,确认它是唯一的跨模态瓶颈。
编码器、适配器和解码器各自算什么?
先说白话。语音编码器好比听力系统,负责把声音波形听成有意义的声学表征。模态适配器好比翻译官,负责把很密的声学帧压缩变稀并换成语言模型能懂的维度。解码器就是大语言模型本身,负责按指令说话。英文名分别是 Speech Encoder、Modality Adapter 和 LLM Decoder,后文用这 3 个简称。
语音编码器 × 模态适配器: 语音编码器负责把 16 千赫波形变成保留时间结构的高维声学表示,模态适配器负责把 50 赫兹左右的高帧率表示压缩约 8 倍并投影到大语言模型的 2560 维文本空间,二者搭配的原因是编码器保住局部声学细节而适配器解决长度与维度对齐,组合后语音才能以前缀方式直接拼到指令嵌入后面参与生成。
具体计算上,前端以 10 毫秒跳长提取 80 维对数梅尔特征,原始帧率约为 100 赫兹,经步长为 2 的前端合并为 160 维表示,帧率降到 50 赫兹。编码器把 160 维映射到 1024 维,再经 24 层卷积增强的 Transformer 结构建模长短依赖,输出仍保持约 50 赫兹的时间分辨率。适配器先用 1024 维前馈变换,再经核为 8 步长为 8 的卷积加门控线性单元压缩,帧率降到约 6.25 赫兹,随后用自注意力精炼,最后用线性层从 1024 维投影到 2560 维,与文本标记维度 1 致。
前置拼接 × 低秩适配: 前置拼接指把压缩后的语音表征放在指令文本嵌入之前送入解码器,分工是保留完整语音上下文而不改注意力结构,低秩适配指只在查询、键和输出投影上加小秩旁路进行参数高效微调,分工是用很少参数让大模型学会听语音,搭配理由是主干冻结保住指令能力而旁路学习跨模态对齐,组合意义是短长两轨可用同一架构延续训练。
沿一个样本走完全程:一段英语短语音进入编码器得到每秒约 50 帧的 1024 维序列,进入适配器后变成每秒约 6 帧的 2560 维语音标记,这些标记拼到例如请转写这段语音的指令嵌入之前,一起送入解码器逐词生成转写文本。训练时解码器主干冻结,只更新适配器与低秩旁路,因此梯度主要流经压缩与投影路径,这也是长语音扩展时容易保留短能力但难学长依赖的原因。
数据如何构造,模型如何训练与扩展到长语音?
短轨训练用 4 个来源的语料并做大量合成。当目标语言缺翻译时,用大翻译模型生成德语、意大利语或中文翻译,再用质量估计分数过滤低质样本。当问答监督不足时,用指令模型生成问答对,并抽取 5% 改成不可回答样本以提高稳健性。不同语料还做了文本归一化与大小写修复,保证指令格式统一。
固定窗口切分 × 语音活动检测切分: 固定窗口切分按 15 秒、30 秒、45 秒或 60 秒等长截断,分工是提供可控基线并限制每段上下文长度,语音活动检测切分基于 SpeechBrain CRDNN 模型的起止阈值找语音段,分工是尽量沿静音边界切以保留自然语句,搭配比较的原因是前者稳定但可能切断语义而后者自然但阈值敏感,组合评估才能判断长推理时上下文完整性与生成稳定性的折中。
长轨训练面临长监督不足。原文明确指出科学演讲摘要只有摘要文本而无可靠转写,视频章节数据噪声大且含音乐背景,因此识别与翻译的长监督不能直接用这两者。解决办法是对朗读语料按章节拼接短句,句间插入 0.5 秒静音,构成数分钟的长样本。由于部分语言的低质翻译已被过滤,拼接后的非英语章节可能不完整,这是复现时必须接受的数据缺陷。摘要与章节任务则分别用演讲摘要与视频章节数据,并限制最长时长以控制计算量。
优化设置上,短模型总参数为 4.73B 量级,可训练部分约 112M,低秩作用于查询、键与输出投影,秩为 8。批量为 128 并做速度扰动与频谱掩码增强,在 4 卡上训练约 2 天。长扩展沿用同架构与超参数,但关闭速度扰动,改用按时长分桶的动态采样以减少填充,并只完成计划两轮中的一轮训练,这是理解长结果时的重要条件。
在什么数据、指标和切分条件下比较?
评估分为开发性质的基准验证与正式提交评测。短验证覆盖英语识别、英德英意英中翻译与多语言问答,长验证覆盖识别、翻译、问答与摘要。短分数是各任务平均之和,长分数则要先扣减幻觉比例再求和。识别用错误率转化后的准确率,翻译用平均质量估计分数,问答与摘要用语义相似度分数,幻觉以出现幻觉的样本数除以总数表示。
短指令跟随分数 × 幻觉惩罚指令跟随分数: 短指令跟随分数是对语音识别、语音翻译和语音问答按任务平均后再求和,分工是衡量短语音多任务能力,幻觉惩罚指令跟随分数是在每个任务分数上乘以去幻觉比例后再平均求和,分工是防止重复生成虚增长度却拉高自动指标,搭配原因是长语音更容易出现插入型幻觉,组合后才能同时看到能力与可靠性。
切分是长推理的核心变量。固定窗口取 15 秒、30 秒、45 秒或 60 秒等长切分。语音活动检测用三元组阈值控制语音起止判断,默认较严格,更宽松的阈值会保留更连续的长段。混合策略先按静音找最长停顿切分,再用分治递归处理超长段,若找不到有效停顿则保持原段。正式提交时固定 30 秒作为主系统,另两种作为对比系统。
硬件与预算按原文交代为 4 卡训练,短轨约 2 天,长轨约 3 天且只完成一轮。资源状态方面,本次未发现来源绑定且完成验证的公开代码与模型链接,因此不能声称代码、模型或数据已公开,复现应按论文描述自行组织数据与训练流程。
主结果显示了什么,代价是什么?
短轨主系统整体最强,长扩展后的对比系统略低但问答仍接近。主系统的识别准确率高,翻译与问答平均分也更高。对比系统在部分翻译方向上接近,但在未见任务上更不均衡。这支持长扩展能大体保留短能力的判断,但也显示只用部分短数据做长扩展会带来小幅回落。正式短评测中主系统在多数任务上占优,对比系统在格式相关的问答评估上明显更低。
下表整理了短轨两个系统的总体分数与任务平均,比较问题是同一架构下长扩展是否显著损害短能力,公平条件是同基准同指标,指标方向均为越高越好。表后解释会指出收益与代价。
| 系统 | 任务平均 | 主分数 | 对比分数 | 结论 |
|---|---|---|---|---|
| 短轨主系统 | 识别准确率 | 0.8877 | 2.0708 | 整体最优 |
| 短轨主系统 | 翻译质量分 | 0.7550 | 2.0708 | 整体最优 |
| 短轨主系统 | 问答语义分 | 0.4281 | 2.0708 | 整体最优 |
| 长扩展对比系统 | 短轨总分 | 2.0291 | 2.0708 | 略低但可用 |
上表显示主系统以 2.0708 领先,长扩展后为 2.0291,差距主要来自识别与翻译平均的回落,而问答平均相对稳定。代价是长扩展只用朗读类短数据而非全部短数据,且长训练未跑满,这可能是回落的原因之一。未胜出项是对比系统在短评测的格式准确率上明显偏低,说明长训练改变了指令格式遵循行为。
长轨方面固定 30 秒窗口总体最优,雷达图直观展示了这种差异。导读:左侧看短轨两系统是否接近,右侧看长轨三切分在 4 个维度上的包络大小。
看图路径: 1. 先看左侧短轨雷达图中主系统与对比系统的三角形重合程度;2. 再看右侧长轨四个维度上固定切分是否在识别与翻译角上略向外;3. 对比摘要角上三条曲线是否都明显内缩;4. 结合图注确认长轨分数已做幻觉惩罚
论文图 2。原论文 Figure 2:“Radar charts of short-form and long-form capabilities, with ASR measured by accuracy, ST by mean COMET score, SQA and SSUM by BERTScore, and long-form scores penalized by…”。
从像素可见,左侧短轨只有 3 个角,两个系统的填充区域几乎重合,仅在翻译角有细微差异。右侧长轨有 4 个角,固定切分在识别与翻译角略向外,语音活动检测与混合切分在问答角略有起伏,但三者在摘要角都明显内缩,说明摘要是共同短板。图注明确长轨分数已做幻觉惩罚,因此包络差异反映的是可靠性加权后的能力。
切分与幻觉的对照证明了什么,反例是什么?
固定窗口对照显示 30 秒最好,15 秒上下文不足,45 秒与 60 秒则幻觉与删除错误上升。语音活动检测对照显示默认阈值总体最好,但更宽松阈值在问答与摘要上更好而在翻译上更差,说明为 1 个任务调优阈值不等于整体最优。混合切分在宽松阈值下达到次优,但仍低于固定 30 秒,说明自适应切分有潜力但需要仔细调参。
语音翻译 × 语音摘要: 语音翻译要求逐句忠实转换源语言内容,分工是检验局部理解与对齐,语音摘要要求从十几分钟讲话中压缩出要点,分工是检验长程话语建模与信息筛选,搭配原因是二者对切分错误的敏感度不同,组合观察显示翻译随 30 秒窗口最稳而摘要受幻觉拖累更大,说明生成越长越需要幻觉感知评估。
下表比较 3 种切分的长轨总体分数,比较问题是哪种切分在惩罚幻觉后仍最稳,条件是同一长模型与同一基准,指标方向是越高越好。
| 切分策略 | 代表配置 | 总体分数 | 优势任务 | 总体结论 |
|---|---|---|---|---|
| 固定窗口 | 30 秒窗口 | 2.0663 | 识别与翻译 | 最稳 |
| 语音活动检测 | 默认阈值 | 1.9591 | 翻译相对好 | 阈值敏感 |
| 混合切分 | 宽松阈值 | 2.0139 | 相对均衡 | 次优 |
表后解释:固定 30 秒以 2.0663 居首,混合以 2.0139 居中,语音活动检测默认设置为 1.9591。主要收益是固定切分实现简单且幻觉率较低,代价是 15 秒与 45 秒在问答或摘要上的单项更好但总体不敌 30 秒。反例是混合切分在识别错误率上有时更低,但在正式评测的摘要与章节任务上仍低或退化,说明切分不能解决长生成本身的建模不足。
幻觉分析进一步显示生成越长越脆弱。下表比较是否计入幻觉输出时的识别效果。
| 任务 | 条件 | 识别错误率 | 插入错误数 | 影响判断 |
|---|---|---|---|---|
| 英语识别 | 去除幻觉 | 0.1580 | 271 | 基线 |
| 英语识别 | 计入幻觉 | 1.0161 | 13,969 | 严重恶化 |
表后解释:计入幻觉后错误率从 0.1580 升到 1.0161,插入数从 271 暴涨到 13,969,人工检查为大量重复。问答受影响较小,翻译与摘要介于中间。这支持幻觉主要表现为重复插入并重创识别与摘要的判断。论文用正则表达式去除重复后再评估,但这只能处理表层重复,不能解决语义编造。
哪些结论有限,哪些验证还没有做?
论文明确报告了四点局限。第一,长训练只完成一轮,可能限制对长语音的适配。第二,长扩展只用部分短数据,可能造成短能力回落。第三,语音活动检测只试了 3 组阈值,更广的超参数与话语感知切分未探索。第四,正则后处理只能去重复,对更隐蔽的幻觉与语义不一致无效。这些是原文直接承认的边界,复述时应保留。
从证据强度看,固定 30 秒最稳的结论有多个窗口与两种自适应方法的对照支持,属于报告级别。幻觉以插入为主的结论有错误分解与人工检查支持,也属于报告级别。但把回落归因于数据子集与训练不足属于有限解释,因为没有补做全量数据或两轮训练的对照,属于可能而待验证。
未测量的量不能承诺。原文没有系统报告延迟、实时率与推理成本的完整曲线,也没有给出误判率的人工评估,因此不能说该方法更快或更省。总体趋势不等于每组语言对都成立,例如中文摘要与英文摘要的行为差异较大,复现时应分语言单独看指标与幻觉率。
要复现先做什么,需要哪些关键设置?
复现应先做数据流水线而非直接调模型。短轨需要把 4 个来源的语料统一成指令格式,缺翻译时生成翻译并用质量分数过滤,缺问答时生成问答并保留不可回答样本。长轨需要按章节拼接朗读数据并插入短静音,摘要数据限制最长时长,章节数据先做语音占比过滤再生成多语言标题翻译。划分与采样要记录时长分桶边界与每桶批量,否则长短混合时填充开销会很大。
下表给出原文明确的模型与优化设置,比较问题是复现时哪些必须对齐,公平条件是同架构同批量,数值保留原文精度。
| 模块 | 设置项 | 取值 | 作用 | 备注 |
|---|---|---|---|---|
| 整体模型 | 总参数 | 4.73B | 容量 | 含新增线性层 |
| 高效微调 | 可训练参数 | 112.2M | 成本 | 低秩旁路 |
| 低秩配置 | 秩与系数 | 8 and 16 | 适配强度 | 作用于三处投影 |
| 优化 | 批量与裁剪 | 128 and 1.0 | 稳定性 | 余弦调度 |
表后解释:总参数 4.73B 与可训练 112.2M 决定了显存与训练时间量级,秩 8 与系数 16 决定了适配容量,批量 128 与裁剪 1.0 是稳定训练的关键。代价是原文未报告学习率预热之外的全部随机种子与数据顺序细节,长轨又只跑一轮,因此复现时应先跑通短模型并在小规模长验证上确认切分逻辑,再决定是否延长训练。未胜出项是更大窗口与更宽松检测阈值,复现时可作为负对照保留。
评估复现要同时跑原始分数与幻觉惩罚分数,并分别记录每个语言对的幻觉样本数。只看平均会掩盖中文与意大利语摘要上的差异。正则去重应作为独立步骤记录前后变化,避免把后处理收益误认为模型本身的提升。
何时值得尝试,还需补哪项验证?
当任务是数分钟的讲座转写、翻译与问答,且计算预算只允许维护一个模型时,这套先短后长的路线值得尝试。固定 30 秒切分可作为首个可运行基线,因为它实现简单且在惩罚幻觉后仍最稳。语音活动检测与混合切分适合作为第二组对照,但要为每个任务单独记录阈值敏感性,不要期待一组阈值通吃所有任务。
还需补的验证有三项。第一,补做全量短数据参与长扩展的对照,以确认回落是否来自数据子集。第二,补做两轮完整训练与不同随机种子的重复,以确认 30 秒优势是否稳定。第三,对摘要与章节任务补做人工抽查,区分重复型幻觉与语义编造,因为自动语义分对长生成的区分度有限。
常见的误解是把切分当成模型能力的全部。切分只改变每段输入长度与边界完整性,不改变模型对长依赖的建模上限。另一个误解是把去重后处理当成幻觉已解决,它只删掉表层重复,真正的可靠性仍需幻觉惩罚评估与人工核查共同确认。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 5 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

