英文题目:Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

会议身份:conference:interspeech:2026:conference-paper-id:nguyen26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#偏好优化 #音频大模型 #多语言 #语音识别

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Trung Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
  • Cheng Yi Lewis Won:机构信息未能从会议 PDF 纯文本可靠映射
  • Minh Duc Pham:机构信息未能从会议 PDF 纯文本可靠映射
  • Yingxu He:机构信息未能从会议 PDF 纯文本可靠映射
  • Shuo Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Ai Ti Aw:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为英汉混杂语音并要求输出逐字转写,难点在于多语言音频大模型虽能单语识别,却常将混杂内容整体翻译、丢弃一侧语言或产生重复幻觉。方法链分三步:先以真实语码切换转写为偏好正样本,再用文本大模型对同一转写做全局与局部翻译以合成模仿失败的负样本,最后以直接偏好优化拉大正负样本似然差来约束转写行为。训练基于约十万偏好对并在中英文多种转写指令提示下随机采样,以避免过拟合单一模板并稳定混合语言生成。与以往扩充语码切换监督数据或改进编码解码结构不同,该方法不增加新声学知识,而是唤醒模型已有的多语言能力并强化保留语言构成的指令遵循。分布内评测中Phi-4-multimodal-instruct在EMILIA-test上混合错误率由70.98%降至7.38%,分布外评测中Qwen2-Audio-7B-Instruct在SEAME dev man上相对降低20.0%。结论目前仅限于英汉语码切换转写,未验证其他语言对、其他音频理解任务及长期记忆保持。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,什么信息不能丢?

这篇论文研究的输入是一段英-普通话混说的音频,再加一句要求转写的文字提示,目标输出是逐字转写文本。必须保留的信息是说话人原来用了哪种语言说哪个词:英文部分保持英文词形,中文部分保持中文字符,不能把英文翻成中文,也不能把中文翻成英文,更不能只留一种语言或编造重复内容。评价时统一转小写并去掉标点,再按中文按字、英文按词计算混合错误率,数值越低越好。

论文的起点是观察到一类矛盾:多个音频大语言模型在纯英文或纯普通话上表现很强,在通用多语评测上也有竞争力,但遇到一句话里中英交替时仍会出现系统性错误。作者把这种现象框定为行为对齐问题,而不是听不懂某种语言的问题。也就是说,模型 latent 具备两种单语能力,却在被要求转写混说时不可靠地表达出保持语言组成的行为。

音频大语言模型 × 语码切换转写: 音频大语言模型负责把音频和文字提示一起编码并生成文本,语码切换转写要求它在同一句话里原样保留英文和普通话的组成;前者提供多语识别能力,后者要求不翻译、不丢语言,两者搭配的难点在于多语能力不自动等于混说时的语言组成保持能力。

对刚入门的读者,关键是把任务与翻译区分开。翻译允许改变语言组成,只要意思相同就算对;转写不允许改变语言组成,必须保留原样。论文后文所有偏好构造、指标选择和定性检查都围绕这一条:提示明明说请转写,模型是否仍然做了翻译、丢弃或幻觉。

同输入同目标的前人路线走到哪里了?

在同输入同目标的语码切换识别路线上,早期系统依赖混合流水线,例如音素合并和因子化语言模型,思路是在声学和语言模型层面显式处理两种语言的拼接。近期路线分为三支:一是用音频拼接减少对天然混说数据的依赖,把单语片段拼成混说音频;二是对 Whisper 这类基座做编码精修加语言感知的解码,例如 token 级语言区分或交互式语言偏置;三是用混合专家结构做语言专用处理。

这些工作都直接改数据、编码或结构,但原文指出它们都没有显式针对音频大语言模型的转写行为做对齐。 在同监督不同阶段的偏好优化路线上,SpeechAlign 首次把直接偏好优化用于对齐编解码语言模型的语音生成,Qwen2-Audio 也在训练流程中纳入直接偏好优化。但据作者所知,此前没有工作把直接偏好优化专门用于解决音频大语言模型的语码切换转写能力。本文的位置就是补上这一块:模型已经有多语能力,问的是偏好优化能否把正确的混说转写行为激发出来。

这种对照的意义在于公平性。不能把本文的偏好对齐方法与只做单语增强或只改解码器的系统直接比谁的错误率更低,因为输入分布、监督信号和运行阶段都不同。本文的对照是同一模型做偏好训练前后的行为变化,外加分布内和分布外两类评测,而不是跨架构的榜单竞争。

三种失败长什么样,为什么值得单独命名?

作者把失败归纳为 3 种,并给了转写实例。第一种是语言遗漏:真值是英文和中文混排,模型输出只剩中文,把英文成分整个丢掉,例如真值包含地点英文名而输出只剩中文框架。第二种是翻代转写:真值是中文加英文短语追求健康生活方式的混说,模型输出把英文短语翻成中文,意思相近但违反转写要求。第 3 种是幻觉:真值是二月多有情人节的混说,模型输出一长串重复的无意义音节,长度可达数百次重复。 命名这 3 种失败的作用是构造监督。

后续拒答生成并不试图复刻全部细节,而是抓住最可控的翻译类错误做合成,同时在评估时检查是否连带改善了丢弃和幻觉。论文明确说没有显式生成代表内容丢弃或幻觉的拒答对,但第 4 节显示 3 类失败都有所减少,作者的解释是学会保持语言组成后生成模式也更稳定。这一解释在原文中属于可能性的讨论,而不是已证明的因果链。 对初学者要记住一个判断标准:只要输出改变了原语言组成,即使语义正确,在转写任务下也是错。

论文的定性表正是按这个标准展示修正:翻代转写被改回混排,幻觉的重复串被改回短转写,遗漏或音译英文被改回接近原词的英文保留。

方法全景:一个样本如何走完输入到对齐输出?

沿一个样本走一遍最清楚。输入是一段混说音频和一句转写提示,记为 x。系统先有该音频的人工真值转写,例如中文加英文地点名的混排句,它将作为选中回答。同一份真值被送给一个文本大模型拒答生成器,生成一个模仿失败的错误版本,例如把英文全部翻成中文,它将作为拒绝回答。两者与输入一起组成偏好三元组,送入直接偏好优化训练,更新音频大语言模型,使其更可能生成选中回答、更不可能生成拒绝回答。

下面这张流程图把上述分叉和汇合画了出来,左边是音频与真值,中间是生成器分出的上下两路,右边是偏好对与训练。请先看主路径再看分支含义。

看图路径: 1. 从左侧音频输入框沿箭头走到真值转写框,确认主干是同一份真值分叉;2. 看上方绿色分支如何直达选中回答,下方橙色经拒答生成器再到拒绝回答;3. 核对偏好三元组框内是否同时汇入选中与拒绝两条箭头;4. 跟踪偏好对到直接偏好优化训练再到对齐后模型的单向箭头

原论文 Figure 1:Overview of DPO training for code-switching alignment.

论文图 1。原论文 Figure 1:“Overview of DPO training for code-switching alignment.”。

这张图要这样读:绿色上路是从真值直接到选中回答,不经过改写;橙色中间框是文本生成器,下分红色全局翻译和局部翻译两类策略到达拒绝回答;紫色框把选中与拒绝汇成一个偏好对,蓝色框是优化步骤,粉色框是对齐后的模型。教学价值在于它明确了监督来源:音频只提供条件,文本真值提供选中,合成文本提供拒绝,没有用模型自己的采样输出做拒答,这既带来可控性和可扩展性,也带来与真实失败分布可能不一致的风险。

偏好对与优化目标各自负责什么?

偏好对的分工是给出同一条件下的好坏对比。选中是人工真值混说转写,拒绝是合成的翻错版本。优化目标的分工是调整策略分布:记主动策略为正在训练的模型,参考策略为冻结的基座模型,目标是增大选中回答相对参考模型的似然优势,同时减小拒绝回答的相对似然优势,强度由超参数控制。原文用文字把这一目标讲清楚,给出了含 sigmoid 和偏好强度的损失形式,但本次可核对的公式抽取清单为空,因此这里不展开符号级公式,只保留行为描述。

直接偏好优化 × 偏好对: 直接偏好优化负责在没有显式奖励模型的情况下直接拉开选优与拒答的似然差距,偏好对负责提供同一音频加提示下正确的混说真值与模仿失败的错误版本;前者是优化机制,后者是监督信号,两者组合把保持语言组成这一行为目标变成可训练的对比目标。

组合的理由是轻量。作者假设多语模型已具备产生正确混说的潜在能力,不需要重训声学编码,只需要用对比信号把转写时保留原语言这一行为激发出来。训练时提示多样性也很重要:训练用 20 句英文加 20 句中文转写提示随机采样,评测用固定的一句英文提示且该句不在训练池中,目的是防止模型只记住某种提示模板。

需要补一个缺项说明:原文没有报告梯度是否流经音频编码器还是只更新语言侧,也没有给出奖励建模或采样细节,因为方法本来就是无显式奖励的直接优化。对 MERaLiON 和 Phi-4 报告的是全量更新,对 Qwen2-Audio 报告的是低秩适配,原因是全量微调在预实验中出现重复与严重幻觉,改用低秩适配后生成更稳定。

拒答怎么造,训练数据从哪里来?

拒答生成器用的是 Qwen3-32B,输入是真值转写,输出是翻错版本。两种策略都针对翻译类失败。全局翻译占 80%,把一句话中一种语言全部翻成另一种语言,模仿整句被翻;局部翻译占 20%,只翻其中短片段,模仿孤立片段被错写。作者说选 80 比 20 是因为基线中整句被翻更常见。

论文给了两组例子:一组把英文问句整句翻成中文,只剩中文;另一组只把无聊一词翻成中文,其余英文保留。

全局翻译 × 局部翻译: 全局翻译负责把一句话中一种语言全部翻成另一种语言以模仿翻代转写,局部翻译只翻其中短片段以模仿局部错语言;前者占比 80% 对应基线中更常见整句被翻,后者占比 20% 对应孤立片段被错写,两者共同构成拒答生成器的两种合成策略。

句内切换 × 句间切换: 句内切换指同一句子内部中英文交替,句间切换指相邻话语一段英文一段中文拼接而成;前者来自 CS-Dialogue 中天然的混合标注段,后者通过同会话内英文话语与中文话语拼接或 EMILIA 中英片段随机拼接构造,两者组合同时覆盖自然混说与可规模化的拼接混说。

数据源有两块,互补自然与规模。下表比较的问题是:训练规模是否足以支撑偏好学习,分布是否同时覆盖自然混说与拼接混说。公平条件是两块数据都只用于构造偏好对,选中都是真值或拼接真值,拒绝都是合成翻译。

数据源小时数偏好对数构造方式切换类型
CS-Dialogue77.3 小时13795 对同会话分组与拼接句内加句间
EMILIA489.5 小时86971 对中英片段随机拼接句间
全部合计566.8 小时100766 对自然加合成混合

该表显示总量约 100,000 对、约 570 小时,其中 EMILIA 占大头提供规模,CS-Dialogue 提供 200 人自发对话的真实感。

构造细节是:CS-Dialogue 先按混合标注分组连续混合话语得到句内切换,再把同会话英文话语与中文话语拼接得到句间切换;EMILIA 则随机采样中英文片段拼接得到句间切换。代价是合成拼接的韵律和话题连贯性与自然混说仍有差距,这也是后文需要在未见过的 SEAME 上检验泛化的原因。训练执行层面是 8 卡 H100 上训练一个轮次,具体学习率与偏好强度见下一节配置表。

用什么模型、什么提示、什么指标来测?

模型选了三座已经具备英文和普通话能力的多语音频大语言模型:面向东南亚多语的 MERaLiON-2-3B,通用多模态的 Phi-4-multimodal-instruct,以及基础音频大模型的 Qwen2-Audio-7B-Instruct。下表要回答的比较问题是:在不同参数量和更新方式下,偏好强度与优化步长如何设置才稳定。指标方向是混合错误率越低越好,公平条件是训练与评测提示分离、评测用固定提示。

模型参数量更新方式偏好强度学习率批量
MERaLiON-2-3B3B全量0.51e-6256
Phi-4-MM6B全量0.055e-6256
Qwen2-Audio-7B-IT7B低秩适配0.33e-564

该表说明超参数是按架构敏感度在训练数据的留出验证集上调优的:偏好强度越低更新越强,越高越保守。Qwen2-Audio 用秩 256 作用于全部注意力和前馈模块的低秩适配,是因为全量微调在预实验中持续产生退化输出。所有模型都只训一个轮次,硬件预算为 8 卡 H100。

混合错误率 × 分布外评测: 混合错误率负责按中文按字、英文按词分别计错以尊重两种语言结构,分布外评测负责用训练未见过的 SEAME 检验泛化;前者是度量方式,后者是数据划分条件,两者搭配才能判断偏好对齐是只记住了拼接分布还是真正改变了转写行为。

评测集有 4 个,下表比较的问题是:哪些是分布内、哪些是分布外,样本量和时长是否可比。

评测集样本数时长分布属性构造来源
SEAME dev man2610 条2.0 小时分布外新加坡马来西亚会话
SEAME dev sge3222 条2.5 小时分布外新加坡马来西亚会话
EMILIA-test1000 条5.6 小时分布内训练源留出
CS-Dialogue-test359 条2.1 小时分布内训练源留出

该表显示 SEAME 两个划分共约 4.5 小时、5800 余条,且训练集未出现 SEAME 数据,因此是检验泛化的关键;另两个是训练源的留出部分,用于检验是否学会拼接分布。指标计算前统一小写并去标点,还对模型特有输出做归一化,例如过滤 Qwen2-Audio 常带的前缀句式只保留转写内容,以保证公平。

主结果:多大改善,在哪里大,在哪里小?

主结果要回答的是:在保持评测提示固定、指标方向一致的条件下,同一模型做偏好训练前后混合错误率如何变化。下表保留了原文实际可运行的基线与偏好训练后策略,不引入事后最优或人工修正作为对比。

模型评测集基线混合错误率偏好训练后相对变化
Phi-4-multimodal-instructEMILIA70.98%7.38%-89.6%

表后解释需要同时讲收益与代价。收益是一致性:3 个模型在 4 个评测集上全部下降,没有出现训练后变差的格子。

幅度差异很大:Phi-4 在分布内 EMILIA 从 70.98% 降到 7.38%,相对降低 89.6%,在 CS-Dialogue 上相对降低 78.5%,作者归因于其基线很少接触混说,常整句翻译或严重重复,因此一个轮次的偏好训练就能激发行为;Qwen2-Audio 在分布外 SEAME dev man 从 72.89% 降到 58.30%,相对降低 20.0%,是分布外最强证据;MERaLiON 因监督微调阶段已含大量混说数据,基线已强,SEAME 上仅改善 0.7% 到 2.0%,在 CS-Dialogue 上改善 11.1%。必须同时指出的未胜出项是 MERaLiON 的分布外增益很小,说明当模型已见过大量混说时,翻译类合成偏好对的边际收益有限。

此外 Qwen2-Audio 即使改善后在 SEAME dev sge 上仍有 85.52%,绝对错误率依然很高,不能把相对改善误读为已可用。

定性修正支持行为变化吗,反例是什么?

除总错误率外,论文把行为对齐本身当作主要目标:被要求转写时是否保留混排、输出是否稳定。作者通过人工检查报告说,偏好训练后模型更可能保留混合语言模式。3 个代表性例子分别是:Qwen2-Audio 把翻成中文的健康生活方式改回英文原短语,错误率从 100% 降到 0%;Phi-4 把长达数百次重复的幻觉串改回短转写,错误率从 56.89% 降到 0.33%;MERaLiON 把被音译成中文的地点英文名改回接近原词的英文保留,错误率从 100% 降到 17%。

这些例子支持偏好训练纠正了全部 3 类失败,尽管拒答只显式覆盖翻译类。 反证和边界同样重要。第一,例子是挑选的代表性修正,不是随机抽样的错误率分解,不能据此估计 3 类失败各自下降多少。第二,MERaLiON 的例子仍有 17% 残留错误,说明英文专有名词的拼写仍不稳定。第三,原文没有做去掉全局翻译或局部翻译的消融,也没有比较只用自然混说与只用拼接混说的效果,因此无法判断 80 比 20 的比例是否最优。

第四,幻觉改善的机制只是作者的推测,即保持语言组成带来更稳定的生成,尚未用生成长度分布或重复率等中间指标验证。

哪些结论还不能下,缺了哪项验证?

论文第 5 节明确列了五点局限,复述时要区分已报告与待验证。已报告的是范围局限:只做英-普通话,其他语言对的泛化未经测试;拒答是合成变换而非模型真实采样,可控可扩展但可能与真实失败分布有偏移;用的是原生直接偏好优化,未试 SimPO、mDPO 或迭代精修等变体;拒绝策略主要覆盖翻译类失败,未显式生成幻觉与内容丢弃例子。

未研究偏好训练对其他音频理解能力的影响,是否存在灾难性遗忘未知。 这些局限对应缺失的验证:没有其他语言对的评测,没有真实失败采样与合成拒答的对比,没有不同偏好算法的对照,没有幻觉与丢弃专用拒答的补充实验,也没有通用音频问答或单语识别的保持性评测。因此能说的是在给定数据和算法下行为向保持语言组成移动,不能承诺延迟、成本、误判率或通用能力同时改善。总体趋势不等于每组都成立,例如 MERaLiON 的分布外增益就很小。

对初学者的提醒是:相关性不是因果。分布内大幅下降可能部分来自记住了拼接分布,只有分布外的 SEAME 改善才能支持泛化判断,而 SEAME 上的改善幅度远小于分布内,这正是需要同时看两类评测的原因。

要复现,先准备什么,按什么顺序做?

复现的第一步是准备数据与划分。需要 CS-Dialogue 的自发对话标注,按混合标注分组得到句内段,再按同会话拼接得到句间段;需要 EMILIA 的中英文片段随机拼接得到句间段。总量目标是约 100,000 对、约 567 小时。留出 EMILIA-test 1000 条约 5.6 小时和 CS-Dialogue-test 359 条约 2.1 小时做分布内评测,另用 SEAME 的两个开发划分做分布外评测,且训练中不得混入 SEAME。

第二步是生成拒答。用文本大模型把每条真值改写为翻错版本,全局翻译占 80%,局部翻译占 20%,选中为原真值,拒绝为改写版。提示池准备 20 句英文加 20 句中文转写提示,训练时随机采样,评测时固定用训练池外的一句英文提示。指标实现要先转小写、去标点,再按中文按字、英文按词计错,并按模型过滤固定前缀。 第三步是训练。

MERaLiON-2-3B 用全量、偏好强度 0.5、学习率 1e-6、批量 256;Phi-4 用全量、偏好强度 0.05、学习率 5e-6、批量 256;Qwen2-Audio-7B 用秩 256 作用于注意力和前馈的低秩适配、偏好强度 0.3、学习率 3e-5、批量 64;都训一个轮次,原文预算为 8 卡 H100。超参数需在训练源的留出验证集上调优,不建议直接照搬到其他语言对。

关于可用性必须如实写:本次收到的证据中没有发现来源绑定且完成网络状态验证的资源,因此不得声称代码、模型或数据已公开。复现前需自行确认各数据集许可与下载链路,本次未能确认可达。

何时值得尝试这种做法,如何一句话记住它?

当你的音频大模型单语能力已够、但被要求转写混说时仍翻代转写或丢语言,且你能拿到混说真值并用文本大模型批量造翻错版时,这种做法值得尝试。它的本质是用真值对翻错版的对比信号,把保留原语言组成这一行为压进模型,而不动声学结构的大学习。Phi-4 的例子说明基线越爱翻译或重复,收益可能越大;MERaLiON 的例子说明已见过大量混说时边际收益会变小。 一句话记住:真值做选中、翻错做拒绝,对比训练逼模型转写时不再翻译。

后续还需补的验证是其他语言对、真实采样拒答、幻觉专用拒答、其他偏好算法,以及通用能力的保持性评测。只有这些补齐后,才能判断这是 1 次通用的行为对齐,还是只对英-普通话拼接分布有效的专项修正。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总