英文题目:MTC-AVSR: Compressed-Token-based Audio-Visual Speech Recognition and Translation with Contrastive Language Alignment
会议身份:
conference:interspeech:2026:conference-paper-id:a26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#模型压缩 #对比学习 #多语言 #音视频语音识别 #语音翻译
评分:6.8/10 | 创新 1.3/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Lusi A:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyong Duan:机构信息未能从会议 PDF 纯文本可靠映射
- Jiang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Feilong Bao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理音视频语音识别与语音翻译联合任务,输入为唇动视频加含噪语音,输出为英文转写或西班牙语、法语、意大利语、葡萄牙语译文,难点在于高分辨率视听序列拖慢大语言模型且压缩后跨语言语义易丢失。方法链分三步:多模态压缩先融合视听特征并用查询分配将码率压至每秒3.5词元后送入解码空间,语言适配再以门控交叉注意力将压缩词元重编码到多语言词表空间,最后任务条件解码用提示词前缀切换识别与翻译并联合优化生成与对比目标。与以往仅做单任务压缩或直接微调解码器的做法不同,该工作冻结编码器与大语言模型主体,仅训练适配器、词表与低秩适配器实现单流多任务。论文在LRS3上报告词错率0.74%与最强基线持平,在MuAViC英西、英法、英葡上报告28.1、26.3、21.8的翻译得分。结论仅在英语源、4个欧洲目标语及TED式朗读场景验证,自发对话、远场口音与视频缺失条件尚未验证。原文未披露训练硬件与训练时长,仅报告推理侧显存与计算量。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么要压缩后再做多任务?
输入是同步采集的说话人音频与唇部视频。音频按 16 千赫重采样并提取梅尔滤波器组特征,视频按每秒 25 帧重采样并用检测器裁出 96 乘 96 的灰度嘴部区域,训练时还以 75% 概率混入音乐语音噪声库中的巴布尔噪声。目标有两个:其一是英语音视频语音识别,给出源语言转写,用词错误率衡量,越低越好;其二是英译西法意葡的语音到文本翻译,用 BLEU 衡量,越高越好。
必须保留的信息是同一段音视频在干净与 0 分贝巴布尔噪声下仍可被理解,且推理只走一条压缩令牌流。输出是解码器按提示生成的英文句子或目标语言译文。本文解读的输出是一份可复述的方法说明加 3 张条件一致的数字表,帮助刚入门的读者按输入到表示到组件到目标的顺序复现。
直接把高分辨率音视频帧全部展开成语言模型输入,序列很长,计算与延迟都难以接受。已有压缩工作把序列压短,但只验证了识别,没有回答同一串压缩令牌是否还剩足够的跨任务语义去做翻译,更没有把只对齐源语言的令牌映射到多语言空间。本文要解决的正是这个缺口:在不重训编码器的前提下,用同一压缩流同时做识别与翻译。压缩速率固定为每秒 3.5 个令牌,语言适配与对比对齐只在冻结大模型与冻结压缩器之间学习多语言映射,推理时仅靠更换识别或翻译提示前缀即可在识别与 4 个翻译方向之间切换。
同输入同目标的路线如何从循环网络走到大模型解码?
早期音视频语音识别把唇动与面部表情作为声学受损时的补充线索,模型从循环结构发展到基于变换器的结构,训练上引入自监督预训练、跨模态蒸馏与分阶段训练。论文列举的同任务基线包括端到端卷积与变换器识别器、掩码多模态聚类预训练表示,以及用自动标注扩大数据的识别器,这些路线同输入同目标,但解码器多为专用识别头。
另一条路线是把大语言模型当解码器,利用其上下文推理能力,例如 Whisper-Flamingo 把视觉特征接入语音识别与翻译,MMS-LLaMA 把最小多模态口语令牌接入大模型做高效识别。论文把 MMS-LLaMA 与 LLaVA-Mini 归为压缩路线:用可学习查询把长特征压成短令牌。区别在于前人压缩只做识别,且压缩令牌只对齐源语言。本文的对照因此聚焦两点:压缩后是否保留跨任务语义,以及不扩大大模型参数时如何获得多语言表达。分阶段训练与冻结边界被显式强调,前 1 阶段结束即保存检查点并锁定已学表示,后续阶段不再扰动,这为按顺序复现压缩对齐与跨语言适应提供了检查依据。
论文把开放问题拆成哪两个可验证的判断?
第一个判断是效率与多任务的兼容性:每秒 3.5 个令牌的单流压缩表示,在编码器冻结后是否同时支撑识别与翻译。论文把查询分配率固定为每秒 3.5 个,分配数按输入帧数与帧率计算,只取查询库的前若干个参与压缩。这个速率在引用的 MMS-LLaMA 中被报告为效率与性能的较好折中,本文直接沿用而不重新搜索。
第二个判断是源对齐到多语言的映射方式:不解冻大模型主干时,能否用轻量模块把已对齐源语言的压缩令牌重编码为多语言表示。论文为此设置语言适配器与多语言词库,并用令牌级对比损失显式约束输出空间。若该映射成立,推理时只需换提示前缀即可在识别与 4 个翻译方向之间切换,这就是文中所说的零切换式语言切换的可验证含义。
单样本走完全流程:从嘴唇波形到英文或译文
取一段英语演讲样本,左侧嘴部视频帧进入视觉编码器得到唇动嵌入,右侧音频进入音频编码器得到滤波器组特征并重采样到视觉时间尺度。两路特征经多头交叉注意力融合成统一表示,再送入按需分配查询的音视频查询变换器,输出压缩多模态口语令牌,随后经两层线性投影对齐到语言模型嵌入空间。
这串短令牌进入语言适配器,以多语言词库为键值做 2 次门控交叉注意力,得到多语言表示。最后在该表示前拼接任务提示,送入冻结的 LLaMA 解码器:若前缀是识别加英语标记则生成英文转写,若是翻译加目标语言标记则生成对应译文。训练总目标是解码交叉熵加退火加权的令牌对比对齐损失。
下图是全文唯一总览图,先看主链再看左右放大框,有助于把 3 阶段与冻结解冻边界 1 次看清。
看图路径: 1. 沿底部嘴部图像与波形向上追踪到多模态压缩再到语言适应最后到任务解码的主链;2. 对比左侧音频视觉编码器与长度适配器汇入融合模块的位置;3. 观察右侧语言适应框内两次交叉注意力与门控残差及多语言词库作为键值的接线;4. 查看右上解码框内识别与翻译两套提示前缀如何拼接到多语言表示之前
论文图 1。原论文 Figure 1:“An overview of the proposed MTC-AVSR.”。
图中部自下而上是 3 阶段主链:底部为多模态压缩,中部为语言适应,顶部为任务条件解码并指向输出。左侧放大框展开压缩细节,显示视觉与音频编码器、长度适配器、融合模块与按需分配查询的查询变换器。右侧下框展开语言适应,显示查询来自压缩令牌、键值来自多语言词库的 2 次交叉注意力与门控结构;右侧上框展开解码,显示冻结大模型加低秩适配器接收多语言表示与两套提示并分叉输出识别或翻译结果。
压缩、适配与对齐各自算什么,拼在一起多出什么?
多模态压缩先做模态内前端处理,再做跨模态融合与查询压缩。视觉前端提取对齐的唇动嵌入,音频前端产生重采样到视觉尺度的特征,二者融合成统一表示。查询库是可学习的全局参数,实际使用的查询数随输入时长线性增长,首段查询与融合特征共同经过查询变换器得到令牌矩阵。两层线性投影只做空间对齐,不引入新的语言监督。
压缩多模态口语令牌 × 大语言模型解码器: 压缩多模态口语令牌负责把 25 Hz 音视频融合特征按每秒 3.5 个查询压成短序列,承担降算力与保留语言内容的分工;大语言模型解码器负责在冻结主干下按任务提示生成转写或译文,承担上下文推理的分工;二者搭配的理由是短序列可直接放入解码器嵌入空间而不重训编码器,组合意义是单流推理同时支撑识别与翻译。
语言适应把压缩令牌当查询,把多语言词库当键值。词库由源语言与 4 个目标语言子词合并而成,每条向量以对应大模型嵌入初始化并作为可学习参数。适配器含两层门控交叉注意力,每层含注意力、层归一化与前馈网络,并用可学习的门控系数控制残差强度。训练时对比损失只回传经过词库与适配器,保持上游压缩器与大模型冻结。
语言适配器模块 × 多语言词库: 语言适配器模块负责以压缩令牌为查询做两层门控交叉注意力重编码,承担注入多语言线索的计算分工;多语言词库负责合并源语言与 4 种目标语言子词并以大语言模型嵌入初始化为可学习键值,承担提供跨语言词汇锚点的分工;二者搭配是因为适配器需要显式词汇目标才能做选择性对齐,组合后实现不扩大大模型参数的零切换式语言转换。
解码侧采用类似 Whisper 的多任务格式,提示以起始符开头,中间是识别或翻译标记,结尾是结束符。翻译标记从西法葡意集合中选取,训练时每个语块随机加前缀以平衡识别与翻译目标,推理时改前缀即切换任务。大模型主干冻结,只在查询键值输出投影上加量化低秩适配器。
令牌对比对齐损失 × 交叉熵损失: 令牌对比对齐损失负责在向量空间用余弦相似度和温度 0.07 把适配器输出拉向对应词条、推离其他词条,承担显式跨语言向量对齐的分工;交叉熵损失负责按自回归序列概率监督识别与翻译输出词,承担保证可读转写译文的分工;二者以退火系数 λ 从 1.0 到 0.3 加权搭配,先强对齐后重生成,组合意义是让适配器与多语言词库先学映射再服务解码。
对比损失与解码损失的分工需要分开理解。对比损失在超球面上用余弦相似度与温度系数直接优化向量对齐,不做序列概率建模;解码损失按自回归概率优化整句输出。退火系数从 1.0 线性降到 0.3,意图是先让适配器学会多语言对齐,再让大模型生成占主导。
任务条件提示 × QLoRA 适配器: 任务条件提示负责在令牌序列前加起始符、识别或翻译标记与结束符,承担显式切换任务的分工;QLoRA 适配器负责在冻结 LLaMA 主干下只调查询键值输出投影,承担低成本适配口语与多任务分布的分工;二者搭配是因为冻结主干本身不区分任务,需要提示路由加轻量参数共同转向,组合后实现单模型按前缀输出英文转写或西法意葡译文。
两阶段各解冻谁、按什么信号停、检查点如何锁定?
训练分 2 阶段严格执行,每阶段只执行 1 次并以显式检查点结束,前 1 阶段结束时冻结的参数此后保持冻结。第 1 阶段是令牌源语言对齐,只解冻上游编码器栈与量化低秩适配器,用交叉熵训练整序列,直到验证集词错误率不再下降即停,随后锁定编码器链与低秩权重并保存检查点。
第二阶段是跨语言适应,使用第 1 阶段生成的冻结令牌缓存,连同并行的源语言与 4 种目标语言转写译文一起送入新解冻的语言适配器。只有适配器、多语言词库与低秩适配器接收梯度,对比损失只经过词库与适配器,大模型与上游压缩器保持冻结。解码多任务损失按任务前缀分别计算识别与翻译的交叉熵,总损失为解码损失加退火对比损失。退火系数从 1.0 线性降到 0.3,先让适配器学会多语言对齐,再让大模型生成占主导,训练与推理的调度与束搜索设置一一对应执行。
优化器统一用 AdamW,1 次项 0.9、2 次项 0.98、权重衰减 0.01,余弦调度从 1e-4 经 0.51,000 步热身衰减到 1e-5,共 30,000 步,梯度裁剪为 1.0,推理用束宽 5、温度 0.3 的束搜索。论文未报告多次随机种子的方差与显著性检验,这是复现时需要补记的缺项。
数据、划分、增强与指标在什么条件下可比?
识别训练用 LRS3 并以 VoxCeleb2 中 1326 小时英语视频增强,转写由 Whisper Large-v2 生成;翻译用 MuAViC 提供的 LRS3 对应四语译文。论文报告训练总量为 1759 小时,消融说明全量实验均在该规模上运行。音频视频分别重采样到 16 千赫与每秒 25 帧,嘴部裁剪与翻转增强按前述执行,音频以 75% 概率混巴布尔噪声。解码器用冻结的 LLaMA3-3B 主干加低秩适配器,消融另比较 1B 与 8B 版本。
评估分干净与噪声两档:干净用原始测试集,噪声加 0 分贝巴布尔噪声。识别指标为词错误率,越低越好;翻译指标为 BLEU,越高越好。论文注明噪声音频文件未公开发布,因此与部分基线的噪声比较不是逐文件对齐的直接可比,阅读时应把干净结果当主证据、噪声结果当稳健性参考。资源状态方面,本次未发现来源绑定且完成验证的代码模型数据链接,不得声称代码模型或数据已公开。
主结果在同等输入下比了谁,数字支持什么?
识别问题是:在 LRS3 干净与 0 分贝噪声下,与相同音视频输入的识别器相比,压缩单流是否达到主流水平。比较条件是各方法均做音视频识别,指标方向为词错误率越低越好。下表整理原文报告的训练量与两档词错误率,数值保留原文精度。
| 方法 | 训练数据 | 噪声词错误率 | 干净词错误率 | 任务 |
|---|---|---|---|---|
| MTC-AVSR | 1759 hours | 2.0% | 0.74% | 识别加翻译单模型 |
上表显示,MTC-AVSR 在干净集取得 0.74%,与 MMS-LLaMA 持平,报告为当前最优之一;在 0 分贝噪声下为 2.0%,略高于 MMS-LLaMA 的 1.9%,但明显优于同规模下部分基线的高噪声误差。代价是单模型同时承担翻译任务,且噪声比较受非公开噪声文件限制。未胜出项是 LP Conformer 用 100,000 小时数据仍保持强噪声稳健性,说明数据规模仍是噪声鲁棒性的重要来源。
翻译问题是:在 MuAViC 英译四语干净集上,单模型是否匹配按语对微调的专用模型。指标方向为 BLEU 越高越好。下表整理干净音频下四语 BLEU,数值保留原文 1 位小数。
| 方法 | Es BLEU | Fr BLEU | It BLEU | Pt BLEU |
|---|---|---|---|---|
| Bilingual AV-HuBERT | 26.6 | 25.3 | 20.7 | 20.5 |
| Whisper-Flamingo Middle | 28.0 | 26.1 | 22.5 | 21.3 |
| Whisper-Flamingo Large | 27.9 | 25.9 | 22.1 | 21.8 |
| MTC-AVSR | 28.1 | 26.3 | 22.4 | 21.8 |
上表显示,MTC-AVSR 在英西 28.1、英法 26.3、英葡 21.8 上报告为新最优,英意 22.4 略低于 Middle 版本的 22.5。论文报告平均 BLEU 为 24.65,超过 Middle 版本 0.22。噪声下 MTC-AVSR 在英意与英葡保持较好,但在英法以约 0.3 分落后于双语专用模型,这支持压缩令牌保留了语言信息但专用微调在强噪声下仍有优势的判断。
拿掉适配器、词库与对比损失后,哪一步最关键?
消融问题是:在 MuAViC 英西轨道上逐步加入组件时,西班牙语 BLEU 与英语词错误率如何变化,实验固定全量 1759 小时数据与冻结大模型加提示的基线。指标方向为 BLEU 越高越好、词错误率越低越好。下表以 3B 模型为例整理基线到完整模型的 4 步变化。
| 设置 | Es 干净 BLEU | Es 噪声 BLEU |
|---|---|---|
| 基线冻结解码 | 27.4 | 24.3 |
| 加语言适配器 | 27.8 | 24.6 |
| 加多语言词库 | 28.0 | 25.1 |
| 加对比损失完整模型 | 28.1 | 25.3 |
上表显示,从基线到完整模型,干净 BLEU 从 27.4 升到 28.1,干净词错误率从 0.81% 降到 0.74%,说明跨语言缺口主要由适配器与词库补上,对比损失进一步收紧令牌到词的对应。代价是显存与计算小幅上升,完整 3B 模型约 12.8 GB 显存与 1.53T 浮点操作。论文还比较对齐策略:相加、拼接、低秩注入与全交叉模态变换器,其中全变换器多耗约 0.6 GB 显存但 BLEU 更低,而本文适配器多耗约 0.3 GB 却在干净与噪声下分别达到 28.1 与 25.3,支持选择性交叉注意力优于无差别自注意力的解释。
模型规模消融显示,干净下 3B 最好,1B 与 8B 分别为 0.85% 与 0.83% 词错误率;噪声下 8B 词错误率 2.02% 最优,3B 为 2.04%。这支持大模型在困难声学下更稳健,但 8B 显存约 17.2 GB 明显高于 3B,因此其他实验选用 3B 是性能与成本的折中,而非 3B 在所有条件下全面胜出。
哪些边界没有测,哪些比较不能当同条件胜负?
论文明确报告噪声音频未公开发布,噪声 BLEU 与词错误率的跨论文比较只能当参考,不能视为逐样本对齐的同条件胜负。翻译基线中双语模型按语对单独微调,而 MTC-AVSR 是单模型做识别加四语翻译,两者的参数复用与任务负担不同,直接比较平均分时会低估专用模型的单任务投入。
未评测的边界包括:除西法意葡之外的语言泛化、纯视觉无音频输入的表现、实时延迟与长视频内存峰值。论文给出显存与浮点操作,但未测量端到端延迟与误判率分解,也未报告多次运行的统计显著性。对比损失温度固定 0.07、退火区间固定 1.0 到 0.3,未见超参数敏感性分析,这些都应表述为待验证而非已证明最优。
要复现先准备什么,按什么顺序检查?
先准备 LRS3 与 MuAViC 四语译文,以及 VoxCeleb2 增强视频与 Whisper Large-v2 生成的伪转写,统一重采样到 16 千赫音频与每秒 25 帧视频,并用相同人脸检测裁出嘴部区域。按论文超参数设置 AdamW、余弦调度、30,000 步与梯度裁剪 1.0,束搜索固定束宽 5 与温度 0.3。
复现顺序建议先跑第 1 阶段源语言对齐,确认干净词错误率接近 0.74% 后再冻结编码器并缓存压缩令牌;再跑第二阶段跨语言适应,检查英西 BLEU 是否从约 27.4 基线逐步升到 27.8、28.0、28.1。若直接复现完整模型,应先验证查询分配率为每秒 3.5、对比损失温度 0.07、退火从 1.0 到 0.3、解码器为冻结 LLaMA3-3B 加查询键值输出投影的低秩适配器。常见误解是把冻结等同于输出确定,实际上束搜索温度与采样仍带来不确定性,且未冻结的适配器与词库决定多语言行为。
何时值得尝试这条压缩加适配路线?
当系统必须在有限算力下用一个模型同时交付识别与多语翻译,且不能重训音视频编码器时,这条路线值得尝试。它的可复用结论是:每秒 3.5 个令牌的短流在干净条件下保留了足够的语言容量,轻量门控交叉注意力加多语言词库与令牌级对比监督可以补上跨语言缺口。
不适合的情形是强噪声下要求单语对极限精度,或只能使用极小显存的端侧部署,此时专用双语微调或更大解码器可能更合适,尽管后者显存与算力更高。下一步应补的验证是公开噪声划分上的对齐评测、多随机种子的显著性、延迟与峰值内存的实测,以及温度与退火区间的敏感性。只有补齐这些,才能把当前报告的最优分数转化为可部署的收益判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
