英文题目:Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

会议身份:conference:interspeech:2026:conference-paper-id:chen26l_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据清洗 #音频大模型 #语音 #语音翻译

评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Qixu Chen:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理挖掘语音到语音翻译数据噪声大、错位多且双侧均为语音无可靠标签时如何筛选可训练语音对的问题,输入为源语音与目标语音组成的挖掘对,输出为保留或丢弃决策。方法先以声学信噪比、感知平均意见分与跨语言语义一致性多视角信号按严格阈值筛选高置信清洁对并施加分级可控退化生成负例,为排序学习提供弱监督。接着以轻量排序模型学习清洁优于噪声的相对顺序,对大规模无标注池打分并取首尾两端生成伪标签,将成对语音包装为指令跟随样本。最后微调音频大模型使其直接从原始双语音预测决策,把声学保真度与跨语言语义一致性统一到端到端听觉判断,避免先转写再用文本大模型打分时丢失失真、合成伪影与错位证据。在CVSS-C加20% SpeechMatrix语料的评测设置下,过滤后训练的语音到单元系统的BLEU为22.72,高于614265对未过滤基线的BLEU 21.32。结论限于合成目标语音、法语到英语为主与离散单元架构,德语到英语仅用简化信号验证,真实自发语音与多元架构泛化尚未验证,原文未披露过滤训练与推理成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/chin-alt/S2S-Filtering — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为什么挖来的语音对不能直接拿来训练?

这篇论文的输入是已经挖好或自动对齐的大规模成对语音,目标是从中选出一个更小的子集,让端到端语音到语音翻译模型在这个子集上训练后翻译分数更高。输出不是翻译本身,而是一个过滤器:给定 1 对源语音和目标语音,直接回答保留还是丢弃。必须保留的信息是实验条件和可复述动作:用什么数据、过滤只动哪部分、翻译模型如何从头训练、评估用什么识别器和指标。

端到端语音到语音翻译的意思是直接把法语声音变成英语声音,中间不经过显式文本。用白话说,就是耳朵听法语、嘴巴直接说英语。论文研究的是这种直接路线,因为它延迟更低,也不会把识别错误一层层传下去。但代价是对数据很敏感:如果训练对里混入底噪、混响、切错边界、压缩失真,或者两边说的根本不是同一件事,监督信号就歪了。

端到端语音到语音翻译 × 级联语音翻译: 端到端语音到语音翻译负责把源语音直接映射到目标语音,省掉中间文本环节以降低延迟和误差传递;级联语音翻译负责先做语音识别再做机器翻译再做语音合成,每一步都可能放大错误。二者搭配的原因是论文要说明为什么直接翻译更依赖成对语音质量:级联可以用文本过滤器,而端到端两端都是声音,文本转写看不到底噪和错位,所以需要能直接听声学和跨语言一致性的过滤器。

大规模挖数据的典型做法是从网上或多语料里自动找疑似互译的语音对,例如 SpeechMatrix 覆盖广、声学多样,但天然带有噪声和错位。CVSS-C 则相对干净,论文里法语到英语部分是真实人声做法语源、合成语音做英语目标。初学者容易误以为数据越多越好,但这里的矛盾是量大但质差,错误监督会让模型学到错误的发音对应和语义对应。所以论文把问题定义为在保留 CVSS-C 不动、只对挖来部分做筛选的前提下,找到声学可靠且语义一致的子集。

相关路线怎么走:文本过滤、启发式和语音质量估计各缺什么?

文本机器翻译的过滤已经有很多成熟路线。按同输入同目标来对照,第一类是可信数据去噪和课程选择,做法是先相信一小部分干净文本,再按难度或噪声程度逐步选数据;第二类是多语嵌入挖矿和过滤,用双语句向量找互译对。这些路线在文本上有效,但输入是文本对,不能直接搬到两端都是声音的任务上。

语音翻译里已有的过滤大多是启发式:源目标时长比、识别后文本长度比、模型似然。这类规则便宜直观,但只能抓住粗粒度错位,对合成痕迹、轻微时间错乱和语义翻错不敏感。另一条线是语音条件质量估计,例如 BLASER 2.0-QE,它在共享语音表征空间里估计跨语言语义对齐,已经被证明对过滤有用。论文的判断是这类信号以语义为主,对声学退化和语音对错位不够敏感。

还有一条自然想法是先做语音识别再用文本大模型过滤。论文明确指出转写文本不能完整反映声学质量和语音对错位,例如录音很糊但转写碰巧对了,或者转写对了但两段语音时间上根本没对上。音频语言模型的进展提示可以直接从原声感知质量,有工作让它生成描述性质量评价,说明它同时具备声学和语义意识。但现成的音频大模型往往跟随细粒度过滤指令不可靠,而且大规模语音对很少有可靠标签。这就引出论文的 2 阶段做法:先学排序,再蒸馏决策。

要解决的问题是什么:没有标签时如何得到可靠的保留或丢弃?

论文把过滤形式化为直接在成对语音上的二分类决策。记大规模挖来语料为源目标语音对集合,目标是选出子集,使得在其上训练的语音到语音翻译模型 BLEU 更高,保留的对子要同时声学可靠和语义一致。难点在于没有人工标注,传统做法是手设阈值组合多个信号,但阈值难调且不同信号量纲不同。

论文的观察是当可靠标签不可得时,学一个稳定的排序往往比直接学绝对决策更容易。这句话对初学者很关键:判断某 1 对到底该打 70 分还是 80 分很难,但判断干净对应该排在噪声对前面相对容易。于是第一阶段只学顺序,第二阶段把排序两端最确信的例子当作伪标签,训练能直接听声音的模型。这样即使中间地带很模糊,两端的高置信样本仍能撑起决策边界。

需要区分的是质量信号在这里的角色。信噪比、平均意见分、大模型充分性分数等自动信号不直接用于最终过滤,而是用来找出高置信训练样例。最终部署的过滤器只听原声,不依赖转写。这样做的好处是推理时不受识别错误影响,坏处是训练链条变长,需要仔细核对每一步的条件是否一致。

方法全景是什么:排序加蒸馏两步如何分工?

整个框架分两步。第一步训练一个轻量排序器,用弱监督信号给每个语音对打连续质量分;第二步用排序器给大池打分,取分数最高的前 K 和最低的后 K 作为伪保留和伪丢弃,再微调音频语言模型,让它直接从原始成对语音预测保留或丢弃。图 2 展示的正是这个从打分到取两端再到指令微调的闭环。

排序器 × 音频大模型过滤器: 排序器负责用信噪比、平均意见分和语义分等特征学一个连续质量分,把相对顺序排稳定;音频大模型过滤器负责直接听成对原声输出保留或丢弃。搭配理由是可靠绝对标签没有,但干净对应该排在噪声对前面这个偏序更容易学到;组合意义是先用排序器在全池上取高低两端做高置信伪标签,再把特征层面的弱监督蒸馏成能听原声的二分类能力。

沿一个样本走一遍有助于建立直觉。假设有 1 对法语源语音和英语目标语音,第一步先算它的特征向量,包括源目标各自的信噪比和平均意见分,以及可选的语义分;排序器输出一个连续分,例如相对较高。第二步把全池按分数排序,如果这对落在顶部区域,它就被当作伪保留样本,连同原始两段音频一起拼成指令样本,目标回答是保留这个词;如果落在底部区域,目标回答就是丢弃。学生模型训练时看到的是声音加指令,学到的是声音到决策的映射,而不是特征到决策的映射。

论文强调教师加学生的自训练思想来自伪标签文献,以及语音领域高质量伪标签能支撑大规模训练的证据。设计上刻意只用两端高置信样本,避免用全部排序结果,因为中间分数的标签噪声更大。默认取 K 等于 15000,这个数值决定了伪标签规模,也影响后续微调的数据量。

监督从哪里来:干净对、噪声对和质量特征如何构造?

构造监督是第一步的关键。论文先用严格阈值从 SpeechMatrix 中选高置信正例,再用受控退化生成等量负例,然后训练排序器。图 1 把这条从多维特征提取到干净选择再到噪声增强最后到偏好监督的路径画得很清楚,初学者应先看懂这张图再看公式。

看图路径: 1. 先从左侧源和目标语音框沿箭头走到成对语音表示,再走到多维质量特征提取器;2. 再看下方可选转写虚线如何汇入特征向量说明框;3. 再对比上方受控退化分支和下方严格阈值干净分支如何生成噪声对和干净对;4. 最后看偏好监督如何把干净大于噪声的顺序训练成教师排序器

原论文 Figure 1:Construction of supervised training pairs and ranker training pipeline.

论文图 1。原论文 Figure 1:“Construction of supervised training pairs and ranker training pipeline.”。

这张图左侧是 SpeechMatrix 源和目标语音,先汇成成对语音表示,再进入多维质量特征提取器。提取器下方有一个可选转写虚线框,说明部分语义特征需要语音识别文本。中间绿色框是严格阈值干净选择,红色框是受控退化,分别引出干净语音对和噪声语音对,两路各自提取特征向量后进入黄色偏好监督框,要求干净大于噪声,最后训练出教师排序器。下方蓝色说明框列出特征向量内容,包括源目标信噪比、源目标平均意见分,以及可选的大模型相似度和 BLASER 等语义特征。

像素上可以执行的观察是确认退化类型标注为噪声或混响、裁剪或重排、压缩,确认排序器标注为 LambdaMART,确认偏好监督符号为干净大于噪声。

声学保真度 × 跨语言语义一致性: 声学保真度负责判断录音本身是否干净可用,分工是信噪比看物理底噪、平均意见分看听感失真和不自然韵律;跨语言语义一致性负责判断源目标是否讲同一件事,分工是大模型打分看翻译充分性、机器翻译加 BLEURT 看文本语义接近度。搭配原因是只看声音会留下发音清楚但翻错的内容,只看语义会留下对齐错或合成痕迹重的内容;组合后过滤器要同时满足听得清和翻得对。

具体阈值和退化在实验部分有明确数字。论文报告用信噪比不低于 35、平均意见分不低于 2.0、大模型充分性不低于 90、BLEURT 不低于 0.8 选出 15902 个高置信正例,并生成等量负例。退化分三档轻中重,按 3 比 6 比 1 采样,覆盖挖来数据中真实退化水平,包括声学噪声混响、裁剪或局部重排带来的轻微时间不一致、压缩伪影。为了避免正负太好分,还故意轻微扰动一小部分干净对但仍当正例,并加入声学尚可但语义不可靠的挖来难负例。排序目标是标准的成对排序损失,要求干净对得分高于噪声对,优化的是相对顺序而非绝对分数。

排序器学到什么:轻量模型如何输出连续质量分?

排序器本身不听原声,它听的是特征向量。论文用 LambdaMART 实现,工具是 LightGBM,输出每个样本对的连续质量分。实现细节给了可复现的超参数:300 棵树,学习率 0.05,最大深度 6,每片最小样本 20,采样比例 0.7,并把数据分成 10% 验证和 10% 测试。这种树模型适合异构特征,因为信噪比、平均意见分和语义分的量纲和分布都不同,树不需要归一化就能处理。

训练时从构造集里取干净对和噪声对组成偏好对,假设任何干净对都应排在任何噪声对前面,用成对排序目标优化打分函数。训练完成后对全部候选池打分,取最高和最低子集作为高置信伪标签,分别对应保留和丢弃。论文默认 K 为 15000,这个选择决定了伪标签的纯度和数量:K 越小两端越纯但数据越少,K 越大覆盖越广但混入模糊样本的风险越高。

初学者要注意排序器和最终过滤器的区别。排序器是特征到分数的映射,依赖预先算好的信号;最终音频大模型是声音到决策的映射,不依赖这些信号。排序器的作用只是在没有人工标签时提供一个相对可靠的顺序,把最确定的两端蒸馏出去。论文的消融显示只用排序器选前 47 万多对也能明显超过规则基线,说明顺序本身已经学到了有用信息,但完整 2 阶段在同样数据预算下更好。

两阶段如何训练:伪标签怎样变成听声决策?

第二阶段把伪标签变成指令样本。每个训练样本包含成对源目标音频和离散目标决策,拼成对话式提示,指令要求只回答一个词即保留或丢弃,模型用因果语言模型损失预测这个回答。图 2 展示了从已排序池取两端到拼指令再到微调的完整动作,是复现时最值得对照的一张图。

这段导读帮你按顺序看图:左侧圆柱是语音对池,经共享特征和教师排序器打分变成中间已排序池;已排序池顶部绿色框和底部红色框分别引出伪保留和伪丢弃语音对;中间白色框是指令模板,右侧蓝色框是带监督微调或低秩适配的音频大模型,顶部是丢弃或保留决策。

看图路径: 1. 先看左侧语音对池经特征向量和教师排序器打分变成已排序池;2. 再看已排序池顶部和底部分别引出伪保留和伪丢弃两条彩色分支;3. 再看中间指令模板要求只回答一个词并与两路语音编码一起进入过滤模型;4. 最后看模型顶部输出保留或丢弃决策箭头

原论文 Figure 2:Overview of the proposed two-stage filtering framework.

论文图 2。原论文 Figure 2:“Overview of the proposed two-stage filtering framework.”。

从像素看,绿色箭头代表高分流向伪保留,红色箭头代表低分流向伪丢弃,紫色粗箭头代表指令模板进入过滤模型,两条斜向蓝色语音编码条代表源和目标两路音频输入。解释是训练时模型同时看到两段声音和文字指令,输出只有一个词;推理时同样只听两段声音就做决策,不再需要信噪比或转写。这种双音频条件是关键,论文发现只接受单音频输入的模型需要把源目标拼接加静音,效果明显更差。

伪标签 × 指令微调: 伪标签负责在没有人工标注时提供可训练的保留或丢弃目标,分工是排序器对大池打分后取前 K 和后 K 两端;指令微调负责把这种监督装进音频大模型,分工是把成对语音加保留或丢弃指令拼成对话样本并用因果语言模型损失学习。搭配原因是伪标签两端置信度高、中间模糊样本被暂时丢掉;组合意义是学生模型只从最可靠的两端学决策边界,避免直接拟合全部噪声分布。

默认用 Qwen2-Audio 做学生,4 比特量化加低秩适配,秩 16,缩放 32,丢弃 0.05,训练 2 轮,学习率 2 乘 10 的负 4 次方,批量 8,梯度累积 4,训练验证按 90 比 10 划分。论文也试了 Audio Flamingo 3 作为替代结构。翻译主模型本身采用语音到单元结构,目标语音编码成离散声学单元并在单元层面翻译,且为简化去掉了源目标连接主义时间分类和自编码等辅助任务。理解这点很重要:过滤改进的是训练数据,翻译结构本身没有为过滤做特殊修改。

实验条件是什么:在什么数据和评估下比较?

实验在 CVSS-C 法语到英语上进行,源侧是真实人声,目标侧是高质量合成语音。为了引入大规模监督,混入自动挖掘的 SpeechMatrix 法语到英语。除非特别说明,过滤实验用 CVSS-C 加 20% 的 SpeechMatrix,过滤只作用于挖来部分,CVSS-C 始终保留。这种设定保证了干净基础数据不动,比较的是挖来部分的不同选法。

翻译训练对每种过滤方法都从头训练,配置和进度相同:4 块 A100,最多 300,000 步更新,半精度,早停耐心 5,用官方 CVSS-C 验证集早停,在测试集上报告 ASR-BLEU,用 sacreBLEU 计算,转写用 Fairseq 语音到单元配方中固定的 wav2vec 2.0 识别器。这意味着分数差异主要来自数据选择,而不是训练步数或解码器的差别。质量信号实现也给了明确工具:信噪比用 Brouhaha 估计,平均意见分用 UTMOS 估计,语义一侧用 whisper-large-v2 转写后请 Qwen3.1-Instruct 7B 打 0 到 100 的翻译充分性分,另一侧用基于 LLaMA-X 的机器翻译系统翻译源转写再与目标转写算 BLEURT。消融中还评估了不需要识别、直接在语音嵌入上工作的 BLASER 2.0-QE。

基线包括质量规则过滤、语义过滤和排序器本身。声学侧试了信噪比不低于 25 和 30 分贝、平均意见分不低于 2.0 和 2.2;语义侧试了 LLaMA 8B 和 70B 阈值 80、BLEURT 阈值 0.7,以及随机保留。匹配预算比较固定在约 470,000 对,目的是在同样保留量下看谁选得更好。德语到英语的泛化实验用简化信号集,只用信噪比、平均意见分和 BLASER 2.0-QE,训练用 127822 对 CVSS-C 加 482446 对 SpeechMatrix。代码状态需要如实说明:论文给出仓库链接,本次收到的资源状态显示代码可用,状态码 200,可以写当前可用,但权重和完整可运行环境仍需按仓库实际内容核对。

主结果说明什么:在同样预算下谁选得更好?

要回答的问题是挖来数据是否值得过滤,以及在同样保留量下直接听声音的模型是否超过强语义基线。公平条件是翻译模型都从头训练、配置相同,评估都是固定识别器下的 ASR-BLEU,分数越高越好。下表把未过滤、随机保留和本方法放在一起,保留对数和分数都来自原文,比较对象是实际可运行的过滤策略。

训练数据与过滤条件保留对数评估指标本方法分数比较对象分数
CVSS-C 加 20% SpeechMatrix 不过滤614,265ASR-BLEU21.32未过滤基线 21.32
CVSS-C 加过滤后挖来数据477,773ASR-BLEU22.72随机保留 21.27
同预算语义基线对照477,773ASR-BLEU22.72BLEURT 约 22.09,70B 大模型约 22.32

表后解释需要同时讲收益和代价。本方法微调后的 Qwen2-Audio 分类器约丢掉 477,000 对,保留 477773 对,达到 22.72 分,比未过滤基线高约 1.4 分。声学和听感规则只有温和提升且对阈值敏感,说明声学有用但手设规则难用好;语义过滤更有效,70B 大模型和 BLEURT 都更强,证实语义对齐是挖来数据的主要瓶颈。但 70B 文本大模型要保留更多数据才达到相近性能,且不显式建模语音条件。

在约 470,000 对的匹配预算下,随机保留 21.27 分,BLEURT 约 22.09 分,BLASER 2.0-QE 约 21.71 分,70B 大模型约 22.32 分,本方法 22.72 分最好。论文据此报告直接听声音的 8B 音频模型超过了 70B 纯文本大模型,支持语音条件语义建模对过滤很关键。代价是需要先算多种信号、训练排序器再微调音频模型,链条比单阈值规则长得多。

BLASER 2.0-QE × 文本语义过滤: BLASER 2.0-QE 负责直接在语音表征空间估计跨语言语义对齐,不依赖语音识别;文本语义过滤负责先转写再用大模型或 BLEURT 在文本上判断翻译好坏。搭配比较的原因是二者都主攻语义,但前者保留了语音条件,后者完全丢掉声学;组合对照的意义是论文证明只做语义还不够,直接听原声的音频大模型能在同样数据预算下再往上走。

未胜出项也要说明。信噪比和平均意见分过滤在多个阈值下都没有追上语义方法,随机保留明显最低,说明同样预算下选什么比留多少更重要。BLASER 虽然带有限语音建模且对过滤有效,但在该预算下仍低于本方法。这些对照的支持范围限于法语到英语和当前翻译配方,不能直接推广到所有语言和所有翻译结构。

拿掉哪一步会怎样:排序、蒸馏、信号和模型选择的反证

消融按去掉第一阶段、去掉第二阶段、只用部分信号、换模型和换语言来组织,测的是每一步是否必要。先看去掉第一阶段:直接在干净与噪声对上训练音频大模型而不经过排序器,结果只去掉约 1.9% 的挖来数据,保留 602593 对中的 614265 对,过滤几乎可以忽略。论文的解释是合成退化 alone 不能刻画真实噪声分布,没有排序器提供的真实池顺序,模型学不到可用的决策边界。

去掉第二阶段就是只用排序器选分最高的前 47 万多对,得到 21.91 分,已经明显超过规则和声学基线;把保留放宽到 57 万多对以匹配 70B 大模型的数据规模,可进一步到 22.49 分,略超 70B 过滤。但完整 2 阶段在同样 47 万多对预算下达到 22.72 分仍最好,支持排序学到了可靠顺序,而蒸馏把特征层线索转成听原声的能力还有额外增益。信号消融显示只用 BLASER 或只用 BLEURT 加大模型 7B 充分性分,都超过未过滤但低于完整多信号排序器,说明声学和听感信号提供了互补信息。换模型时 Audio Flamingo 3 只有 21.53 分,论文认为与其只接受单音频输入、需要源目标拼接加静音有关,双音频条件更适合这种过滤。

德语到英语的泛化用简化信号重复同样流程,结果是另一张值得单独看的表,因为它同时给出数据规模、过滤量和前后分数,适合核对聚合口径。

语言方向CVSS-C 对数SpeechMatrix 对数未过滤分数过滤后分数
德语到英语127,822482,44613.2715.14
德语过滤量与增益157,071482,44613.27加 1.87
排序器与微调配置300 棵树学习率 0.05训练 2 轮批量 8

表后解释要讲清支持的判断和限制。德语实验在 127822 对 CVSS-C 和 482446 对挖来数据上从 13.27 分涨到 15.14 分,增益 1.87 分,代价是去掉 157071 对挖来数据,说明方法不只在法语上有效。但该实验用的是简化信号集,不能与法语完整信号结果直接比大小。排序器用 300 棵树等固定超参数,微调训练 2 轮等固定配置,说明结果是在预算受限的默认配置下得到的,没有对每个语言重新搜索最优阈值。未评测的边界包括误判率、延迟和推理成本,论文没有报告这些量,不能承诺过滤同时改善了速度或成本。

边界在哪里:二分类、预算控制和未测量的量

论文自己指出的局限是当前二分类形式不能在固定预算下灵活控制保留量。实际部署常有明确预算,例如只能留 500,000 对或只能丢 20%,但保留或丢弃的硬决策不输出概率,无法按分数从高到低截断。未来工作提出探索基于概率和预算感知的选择,这正是初学者复现时要注意的:论文的最优保留量是在实验中试出来的,不是模型自动给出的。

另一个局限是监督链依赖自动信号的质量。信噪比、平均意见分、转写、机器翻译和 BLEURT 每一步都可能出错,严格阈值虽然提高了正例纯度,但也可能系统性丢掉某些口音或领域。难负例的加入缓解了平凡可分,但没有给出误判率的直接测量。相关性不等于因果:过滤后分数提高支持所选子集更好,但不能证明每一个被丢掉的对子都是错的,也不能证明每一个保留的对子都是对的。

训练资源和推理开销要分开讨论。翻译训练用了 4 块 A100、最多 300,000 步、半精度和早停,这是训练成本;过滤本身还要算信号、训练排序器和微调音频大模型,这是额外成本;推理开销是过滤器对每个候选对做 1 次前向判断的成本,论文没有报告延迟和吞吐。总体趋势不等于每组都成立:法语和德语都涨了,但不同阈值、不同 K 和不同音频模型的结果有高有低,不能把末步最好结果推广为全程都好。

复现先做什么:按依赖顺序重放关键动作

复现的第一步是准备数据和评估。拿到 CVSS-C 法语到英语和 SpeechMatrix 法语到英语,固定 CVSS-C 全部保留、只过滤挖来 20% 的划分;按 Fairseq 语音到单元配方搭翻译模型,去掉辅助任务以简化;固定 wav2vec 2.0 识别器和 sacreBLEU 评估,避免评估漂移。先跑通不过滤基线,确认能复现约 21.32 分附近的水平,再谈过滤增益。

第二步是重放质量信号和构造集。用 Brouhaha 算信噪比,用 UTMOS 算平均意见分,用 whisper-large-v2 转写后请大模型打充分性分并用机器翻译加 BLEURT 算语义分;按信噪比不低于 35、平均意见分不低于 2.0、充分性不低于 90、BLEURT 不低于 0.8 选正例,生成等量三档退化负例并加入难负例。然后用 LightGBM 训练 LambdaMART 排序器,超参数从 300 棵树、学习率 0.05、最大深度 6 等默认值起步,用 10% 验证和 10% 测试监控排序质量。

第三步是伪标签和微调。用排序器给全池打分,取前 K 和后 K 默认 15000 作为伪保留和伪丢弃,拼成只回答保留或丢弃的指令样本,用 Qwen2-Audio 加 4 比特量化和低秩适配微调 2 轮。推理时对挖来池逐对预测,保留预测为保留的子集并与 CVSS-C 合并从头训练翻译模型。需要补的验证是不同 K 下的保留量曲线、排序器分数与最终分数的关系,以及在新语言上简化信号是否足够。代码当前可用,但要区分代码开源、权重下载和系统可运行:仓库能下不等于权重和环境 1 次跑通,缺的超参数和划分细节要以原文为准,不要从模型名字推定实现。

何时值得尝试:给刚入门同学的收束判断

当你的语音翻译训练数据主要来自挖掘或自动对齐,且错误既有底噪失真又有翻错错位时,这套方法值得尝试。它的适用条件很具体:你能算出声学和语义信号,能接受先训练排序器再微调音频模型的额外成本,且最终只用听原声的过滤器做决策。如果你只有纯文本翻译数据或已经有高质量人工标注,直接用文本过滤或人工规则可能更省。

记住 3 个易错点。第一,转写后用文本大模型过滤不等于听声过滤,前者看不到声学退化和语音错位;第二,排序好不等于分类好,排序器高分截断已经很强,但要达到同样预算下的最好分数仍需要第二阶段蒸馏;第三,单音频拼接加静音不等于双音频条件,模型输入形态会直接影响效果。

一句话收束:用严格阈值加受控退化学会排序,再把排序两端蒸馏成能直接听声的保留或丢弃判断,是在没有人工标签时提纯挖来语音对的一条可复述路线;在论文的法英和德英条件下它带来了 1 分以上的 ASR-BLEU 提升,但预算控制、误判率和延迟仍待补测。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总