英文题目:Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech
会议身份:
conference:interspeech:2026:conference-paper-id:heng26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据增强 #偏好优化 #多语言 #语音识别 #文本到语音
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Yeo Yue Heng:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
- Shreyas Gopal:机构信息未能从会议 PDF 纯文本可靠映射
- Hexin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Leibny Paola Garcia-Perera:机构信息未能从会议 PDF 纯文本可靠映射
- Sailor Hardik:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy H. M. Wong:机构信息未能从会议 PDF 纯文本可靠映射
- Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
代码切换(Code-Switching,CS)自动语音识别(Automatic Speech Recognition,ASR)需转写中英混杂的自发对话,难点在于语言交替频繁、跨语言音系干扰强且高质量标注语料稀缺。本文提出代码混合引导的偏好学习框架:先在新加坡马来西亚普通话英语对话语料 SEAME 上微调多语言合成模型 CosyVoice 2得到基线,再对同一文本随机采样多个候选,用混合错误率(Mixed Error Rate,MER)、感知质量 UTMOS 与声学混合度差值排序,最后用直接偏好优化(Direct Preference Optimization,DPO)放大最优与最差样本的似然间隔。与只优化可懂度或自然度的已有合成偏好方法不同,该框架引入基于帧级语言伪标签的声学混合度,显式约束合成语音的语言比例与边界结构。在SEAME语料DevMAN和DevSGE评测设置下,100小时真实加100小时合成微调的Whisper Large v3的混合错误率为8.9%与14.2%,分别低于100小时纯真实基线的混合错误率12.1%与17.8%。该结论仅在 SEAME 单一语料验证,未证明对其他语言对或朗读式切换的适用性。原文未披露训练推理部署成本与开源产物。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
这篇解读的输入是标题为 Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech 的 Interspeech 2026 论文正文,以及本次收到的官方原图像素图 1。目标读者是刚进入语音、音乐与音频领域的研究生,需要能按步骤复述方法、核对实验条件、理解数字含义。必须保留的信息包括任务定义、语音级混合指数的构造方式、3 阶段流水线、3 个评价器的分工、SEAME 语料与模型配置、主结果与消融数字。输出是 1 篇中文技术解读,不做营销式判断,不引入证据之外的公开代码或数据断言。
当前资源状态为未发现来源绑定且完成验证的资源,因此不能声称代码、模型或数据已公开。 全文先讲语码切换识别为什么难,再讲已有合成增强路线缺了什么,然后沿着一个样本走完文本到合成候选再到偏好对再到识别训练的全过程,接着交代实验条件与结果,最后给出复现清单与适用边界。教学中出现的举例会明确标为例子,不添加无来源的数值或效果承诺。
已有路线解决了什么,还缺哪一块语言边界?
语码切换指一句话内出现两种以上语言交替,例如中文句子中嵌入英文短语。论文指出会话级语码识别难在语言交替、跨语言音系干扰和随意口语风格,而 SEAME 这类高质量转写语码语料规模有限,数据密集型模型难以稳健泛化。Whisper 这类大规模预训练模型在自发会话语码上仍表现不稳,这是本工作的起点。 已有路线之一是用多语多说话人语音合成系统做数据增强。
论文回顾说,这类方法能规模化生成带标注语音并引入说话人与声学多样性,在低资源与领域失配下改善了识别鲁棒性,在语码场景也有生成双语或短语混合数据的工作。但原文明确判断,这些方法主要强调声学多样性或文本覆盖,优化目标是重建保真度,没有显式约束语言边界一致性。也就是说,合成出来听起来像两种语言,但中英比例与切换位置是否像真值,没有被直接衡量。 已有路线之二是偏好学习。
论文介绍直接偏好优化把对齐写成偏好与非偏好样本对上的监督分类损失,避免先训奖励模型再做强化学习,训练更稳定。近期语音合成工作用它控制情感或提升质量,但主要关注感知质量、自然度或可懂度,没有把细粒度语言属性作为声学级对齐目标。更没有工作评估这种语言学引导的合成对下游语码识别的影响。这就留下缺口:需要一个能从合成语音直接度量语言混合结构、并能指导合成优化的信号。
为什么文本混合度不能直接用在波形上?
文本上的语码混合指数概念直观,它度量一串带语言标签的词符中有多少不属于主导语言,用来刻画一句话混得多厉害。白话说,就是数一数少数语言占了多大比例。但语音是连续声学信号,波形本身没有词边界,也没有自带的语言标签,不能直接数词。 论文指出的根本错位正在这里:混合指数定义在离散符号加显式语言标签上,而语音是无语言切分的连续信号。从波形可靠地给出帧级或段级语言身份并不容易。
如果用强制对齐或人工标注,又会失去可扩展性。因此问题被拆成两步:第一步是如何不依赖人工标注得到可信的帧级伪语言标签,第二步是如何基于这些标签定义语音版混合度,并用它比较合成与真值的语码结构是否一致。 举例来说,例子:同一句他 spend too long 去做 olympiad,如果合成把英文读得像中文拼音,或者把中文读成英文口音,人耳可能仍能听懂大意,但帧级语言分布已经偏离真值。只看可懂度可能放过这类样本,而混合比例差值能抓住它。这正是后文引入新指标的动机。
三阶段流水线如何把语言信号送进声学优化?
论文提出的 3 阶段安排理由很直接:先让合成模型学会语码会话的声学,再用偏好学习纠正语言结构,最后用更好的合成数据训练识别模型。第一阶段是基础微调,把参考合成模型适配到语码任务。第二阶段是偏好对齐,用多评价器构造对比对并做直接偏好优化。第 3 阶段是识别训练,把优化后合成模型的合成语音与原始真值训练数据混合,去微调语码识别系统。 下面这张官方原图是理解全流程的关键,它把左侧 3 阶段与右侧偏好框架展开画在一起,建议按输入到输出的主路径阅读,再看评价分支在哪里汇合。
看图路径: 1. 先从左侧自上而下看三个阶段的输入输出:SEAME 训练数据进入 TTS,TTS 进入偏好框架,优化后 TTS 与 SEAME 数据共同进入 ASR;2. 再看右侧绿色偏好框架内候选生成与真值音频如何并行进入三个评价器;3. 核对三个评价器名称与括号内指标:Whisper 对应混合错误率、UTMOS 对应平均意见分、WhisperLAL 对应语音级混合指数;4. 最后看偏好选择如何收束为正例与负例两路输出,用于回送左侧第二阶段的偏好损失
论文图 1。原论文 Figure 1:“Overview of the proposed DPO-based TTS alignment framework.”。
图 1 左侧自上而下是 3 个阶段。第一阶段 SEAME 训练数据进入 TTS 方块,表示在语码数据上微调合成模型。第二阶段 TTS 方块指向偏好框架方块并标出偏好损失,表示用对比对做对齐。第 3 阶段是冻结或固定后的 TTS 与 SEAME 训练数据共同指向识别模型方块,表示混合数据微调。
右侧绿色虚线框是偏好框架内部:上方并排的候选生成与真值音频各产生多个波形表示,向下进入蓝色评价区 3 个白色方块,分别是 Whisper 识别对应混合错误率、UTMOS 对应平均意见分、WhisperLAL 对应语音级混合指数,再向下收束到偏好选择并分出正例与负例。火焰与雪花小图标在原文图中区分更新与冻结,但具体哪个模块冻结以正文文字为准,读图时不要只靠图标猜训练状态。
帧级伪标签与语音级混合度是如何算出来的?
这一节先沿一个样本走完从输入到度量的过程。输入是一条转写文本与对应的真值录音。合成模型对同一文本随机采样出多个候选波形,它们文本相同但声学实现与韵律不同。评价时需要知道每个波形每 1 帧更像哪种语言。论文沿用已有语言对齐策略,不做强制对齐,而是用带语言对齐损失训练的 Whisper 解码器最后一层平均交叉注意力,提供帧到词符的对齐,再把词符级语言身份投影到编码器帧上,得到伪帧级语言标签。
这样每帧都有一个语言归属,可以做帧级语言辨识。 有了帧标签,语音级混合指数的计算目标是度量整句语音的语言混合程度。做法是把每帧看成一个带语言标签的单位,统计总帧数与每种语言各占多少帧,用总帧数减去主导语言帧数再除以总帧数。数值越高表示语言在帧层面分布越均衡,声学语码混合越强。与传统文本混合指数的区别只在单位不同:原来数词符,现在数帧。
语码切换 × 混合错误率: 语码切换负责描述一句话内中英交替出现的语言现象,它决定了识别时语言边界在哪里切换;混合错误率负责把中文按字、英文按词统一计错,给这种交替语音一个可比较的识别指标,二者搭配的原因是只有先定义切换才是错误来源,才能用统一错误率衡量合成语音是否保留了真实切换结构,组合后偏好学习可以直接拿错误率高低来判断合成样本是否有用。
进一步,论文用差值度量合成是否保留了真值的语码特征。对同一文本,分别算合成语音与真值语音的语音级混合指数并相减,得到差值。差值越小表示合成与真值在整体语码比例上越接近,语言边界合成更保真。这个差值后文直接作为第 3 个评价器,专门惩罚语言比例失真。
三个评价器各自看什么,为什么要组合?
候选生成之后,每个候选要过 3 个自动评价。第一个是可懂度,用识别模型转写候选再与参考文本比较得到混合错误率,越低表示下游识别兼容性越好。第二个是感知自然度,用预训练 UTMOS 预测器给出非侵入式质量分,不需要人工听音,分越高越自然。第 3 个是语码保真度,用上述语音级混合指数差值衡量合成与真值语言混合结构的偏离,越小越好。 组合的理由是单一信号会漏掉问题。
只用可懂度可能选出单词对但语言口音错位的样本,只用自然度可能选出流畅但切换位置不对的样本。论文把三者先各自归一化到 0 到 1 区间,再加权求和得到排序分,其中自然度取正向,可懂度与混合差值取负向。权重为非负系数,原文未报告具体数值,这是复现时需要留意的缺项。排序后取最高分与最低分组成最大对比对,并做阈值过滤:若偏好候选的混合错误率大于 20%,或 UTMOS 低于 2.5,或混合指数差值超过 20%,则丢弃该对,避免不稳定监督。
语音级语码混合指数 × 帧级伪语言标签: 帧级伪语言标签负责把连续波形每 1 帧映射到中文或英文,它由带语言对齐损失的 Whisper 解码器交叉注意力得到;语音级语码混合指数负责把这些帧标签统计成非主导语言帧占比,用来度量整句语音混得多厉害,二者搭配的原因是文本 CMI 无法直接用在波形上,必须先有帧标签才能计算语音版混合度,组合后差值比较合成与真值的混合比例是否一致,成为显式的语码保真评价。
需要强调的是,这里的偏好标签完全来自自动评价,没有人工标注。混合错误率来自在 SEAME 上微调过的 Whisper-large-v3,混合指数来自带语言对齐损失的 SEAME 微调 Whisper,UTMOS 是现成预测器。因此偏好质量上限受这 3 个模型自身偏差影响,这是后文讨论局限的基础。
偏好对如何训练合成模型,哪些参数在更新?
训练的真实计算过程分两类。合成侧先用 AdamW 优化器、学习率 2 乘 10 的负 4 次方、线性 warm-up,在 SEAME 会话中英语码语音上微调 CosyVoice2 约 50,000 步,批量为 4 句,并按验证损失早停防止过拟合。这个微调后的模型既作为候选生成器,也作为偏好优化的参考模型。偏好优化时目标模型从参考模型初始化,参考模型冻结以稳定优化,目标模型接收相同文本并计算序列概率,通过直接偏好优化损失增大偏好样本相对边际。
原文给出损失形式包含可训练策略与冻结参考策略的对数概率差、温度系数与 Sigmoid,但未报告温度系数、采样温度与候选数 N 的具体取值,也未给出偏好训练步数与批量,这些是复现缺项,不从模型名称推定。 识别侧用 Whisper-large-v3 作为下游系统,输入为对数梅尔谱,用 Transformer 联合建模声学与语言信息。微调用 Adam 优化器、学习率 1 乘 10 的负 5 次方,批量为每块 A40 显卡 1 句,训练至收敛。另一套验证架构是 ESPNet 的基于 CTC 的 Conformer,用于检验增益是否跨架构成立。
论文强调不同增强策略下训练与解码配置相同,并保证真实加合成总时长一致,这是公平比较的关键。
直接偏好优化 × 多评价打分: 多评价打分负责对同一文本的多个合成候选分别算可懂度、自然度和语码差值并加权排序,挑出最好与最差组成对比对;直接偏好优化负责在冻结参考模型约束下增大偏好样本相对概率,用分类损失代替显式奖励模型与强化学习,二者搭配的原因是 TTS 需要稳定且可定制目标的对齐方式,组合后模型被推向可懂、自然且语言比例更接近真值的方向。
梯度路径按原文交代:偏好损失只更新目标合成模型,不更新评价器与参考模型;识别训练只更新识别模型,不再回传到合成模型。监督来源分别是自动评价排序与带标注的混合语音。重置时机方面,原文只明确目标模型从参考模型初始化,未报告多轮迭代是否重置,同样不猜测。
数据、划分与指标条件是否一致?
实验只用 SEAME 语料,按原文描述约 192 小时自发会话语音,来自新加坡与马来西亚 150 多位双语说话人,句内与句间切换并存,口语随意。这是中英会话语码识别的常用基准。合成训练文本与提示音频只取自 SEAME,没有外部文本数据,避免引入外部文本红利。 评估用 DevMAN 与 DevSGE 两个测试集。指标方面,合成侧看 UTMOS 越高越好、混合错误率越低越好、混合指数差值越低越好。
识别侧看混合错误率越低越好。需要区分百分点与相对百分比:后文所有下降都指百分点差值,不是相对比例。数值相近不代表同一指标,例如合成侧混合错误率与识别侧混合错误率对象不同,前者评价合成候选可懂度,后者评价最终识别模型,不能混放一列。
CosyVoice2 × Whisper: CosyVoice2 负责作为多语自回归合成基座,先在 SEAME 上微调适应会话混语声学,再接受偏好对齐;Whisper 负责两用,一是用带语言对齐损失的版本从交叉注意力产生帧级伪语言标签以计算语音混合度,二是作为下游识别模型被微调评测,二者搭配的原因是合成与评价需要同一语码体系下的声学与语言判断,组合后形成合成生成、混合度打分、识别验证的闭环。
硬件与预算按原文交代:合成微调批量 4 句,识别微调批量每卡 1 句并训练至收敛,但未报告总 GPU 小时、推理开销与合成耗时。统计方法如多次随机种子方差也未报告,因此不能把单次最优推广为稳定区间。比较公平性上,论文明确真实加合成总时长一致,基线是 100 小时真实数据,增强是 100 小时真实加 100 小时合成,这是解读增益时必须同时核对的条件。
合成变好了吗,识别错误降了多少?
先看合成侧的渐进评价问题:在相同文本复刻 DevMAN 与 DevSGE 条件下,逐步加入评价信号是否同时改善可懂度、自然度与语码结构。公平条件是同一 CosyVoice2 基座经 SEAME 微调后,只改变偏好优化用的奖励组合。指标方向为 UTMOS 向上、混合错误率与混合差值向下。下表整理了原文报告的合成性能,数值保留原文写法与精度。
| TTS 配置 | 奖励信号 | UTMOS 越高越好 | MER 越低越好 | ΔCMI 越低越好 |
|---|---|---|---|---|
| CosyVoice 微调基线 | 无偏好优化 | 3.1 | 16.2% | 28.1% |
| 加偏好优化 | MER | 3.2 | 14.9% | 25.7% |
| 加偏好优化 | MER 加 UTMOS | 3.8 | 13.2% | 21.9% |
| 加偏好优化 | MER 加 UTMOS 加 ΔCMI | 3.8 | 10.3% | 16.1% |
表后解释需要同时看到收益与代价。
仅用混合错误率做偏好,可懂度从 16.2% 降到 14.9%,但混合差值只从 28.1% 降到 25.7%,改善有限。加入 UTMOS 后自然度从 3.1 升到 3.8,混合错误率降到 13.2%,说明整体合成质量提升。再加入语音级混合差值后,混合差异降到 16.1%,混合错误率进一步降到 10.3%,自然度保持 3.8 不下降。这是原文支持的核心判断:显式对齐声学感知到的语言比例,能同时提升结构保真与可懂度,而不牺牲自然度。未胜出项是仅用混合错误率的配置,它在三项中都不是最好,说明识别与感知奖励 alone 不足以约束语码结构。
合成语音数据增强 × 真实语音微调: 合成语音数据增强负责用优化后 TTS 按 SEAME 文本生成带标注的新语音,补充稀缺会话语码数据;真实语音微调负责提供原始口音、口语风格与录音条件的锚点,防止合成偏差主导模型,二者搭配的原因是纯合成会偏离真实分布、纯真实则量不够,组合后以 100 小时真实加 100 小时合成混合训练,让识别模型既见过更多语言交替写法,又不丢失真实声学特征。
再看识别侧主结果。比较问题是:在 100 小时真实基线上,加 100 小时合成是否有增益,偏好优化是否比直接合成更好。条件一致性已由总时长一致与相同训练解码配置保证。下表为原文报告的混合错误率,单位为百分比。
| 识别模型 | 训练数据配置 | DevMAN 混合错误率 | DevSGE 混合错误率 | 合成来源 |
|---|---|---|---|---|
| Whisper | 100 小时真实 | 12.1% | 17.8% | 无合成 |
| Whisper | 100 小时真实加 100 小时合成 | 10.1% | 16.0% | 微调 CosyVoice |
| Whisper | 加偏好 UTMOS 与 MER 与 ΔCMI | 8.9% | 14.2% | 偏好优化 TTS |
| Conformer | 100 小时真实加 100 小时合成偏好全量 | 15.4% | 21.9% | 偏好优化 TTS |
表后解释:直接加微调合成已把 Whisper 从 12.1%/17.8% 降到 10.1%/16.0%,Conformer 从 16.8%/23.6% 降到 16.1%/22.8%,报告显示高质量合成可提升会话语码鲁棒性。偏好优化再带来一致增益,全量评价组合达到 Whisper 8.9%/14.2% 与 Conformer 15.4%/21.9%。跨架构一致改善支持了方法泛化性,但绝对值上 Conformer 仍高于 Whisper,说明基座能力差异未被抹平,不能把合成增益理解为架构替代。
拿掉混合约束会怎样,定性例子说明了什么?
消融围绕混合差值评价的作用展开。合成侧数字已显示去掉该项后混合差值停在 21.9%,混合错误率停在 13.2%,而加入后分别到 16.1% 与 10.3%,差距明显。识别侧同样,去掉该项时 Whisper 为 9.6%/15.1%,加入后为 8.9%/14.2%,Conformer 从 15.8%/22.3% 到 15.4%/21.9%,方向一致但幅度在 Conformer 上更小。这支持混合约束是主要增量来源,同时提示增益大小与下游架构有关。 论文还给了一个定性转写对比。
真值包含他 spend too long spend too long 去做 o hall olympiad 是另外一个也是什么 science 的等中英交替。基础微调把 long 误作龙、olympiad 误作奥林匹克,出现跨语言替换与边界不稳。加可懂度与自然度偏好后整体可懂度提升,但仍有 math science 的等替换残留。加入混合差值后输出恢复 spend too long 与 olympiad 是另外一个也是等英文段,语言分布更接近真值。原文用此说明识别与感知奖励 alone 不充分约束语码结构,而混合引导能保留预期语言边界与发音。
需要指出边界:该例子是单样本展示,不是分布统计,不能推广为每句都如此。阈值过滤也可能丢弃难样本,使偏好对偏向易样本,这是未评测的偏差来源。原文未报告去掉 UTMOS 只留混合差值的组合,也未报告不同权重下的敏感性,因此不能断言当前权重最优。
哪些量没有测,哪些推论还不能做?
首先区分报告与推测。论文直接报告的是合成三指标与识别混合错误率在两个测试集上的下降,这是可核对的。有限解释是混合结构保真提升带来了识别增益,这有消融支持但仍是相关性解释,因为偏好同时改变了可懂度与自然度,不能严格归因到单一因素。未验证推测是把自然度保持理解为整体体验无损,原文没有人工听音与误判率分析,不能把自动指标当成人评。 缺失证据不是技术错误,但复现与选型时要明确。
原文未测量延迟、实时因子、合成与识别训练总成本、输出帧率与实际延迟的关系,因此不能承诺这些量得到改善。未报告多次种子方差与显著性检验,总体趋势不等于每组每步都成立。伪标签依赖带语言对齐损失的 Whisper 自身质量,若该模型在某些口音或噪声下语言判断偏差,混合指数会继承偏差。阈值 20%、2.5 等过滤超参数只给出去值,未给消融,换语料时可能需要重调。 另外,合成文本与提示均来自 SEAME,方法在无语码文本或跨地域口音上的表现未评测。
把末步结果推广到全程训练曲线,或把 DevMAN 与 DevSGE 的增益推广到其他语码对,都属于待验证。
要复现先做什么,需要保留哪些信息条件?
复现的第一步是准备 SEAME 并按原文划分出训练与 DevMAN、DevSGE,保持 100 小时真实基线与 100 小时合成的时长配比,文本与提示只用 SEAME 内部数据。第二步是用 AdamW、学习率 2 乘 10 的负 4 次方、线性 warm-up、批量 4 句、约 50,000 步并按验证损失早停的配置微调 CosyVoice2,得到参考合成模型。第三步是对每条文本随机采样多个候选,用 SEAME 微调 Whisper-large-v3 算混合错误率、用 UTMOS 算质量分、用带语言对齐损失的 Whisper 算帧伪标签与混合差值,归一化加权排序后取最高与最低组成对比对,并按混合错误率大于 20%、UTMOS 低于 2.5、混合差值超过 20% 丢弃不可靠对。
第四步是从参考模型初始化目标模型并做直接偏好优化,冻结参考模型。第五步是用优化后 TTS 生成 100 小时合成,与 100 小时真实混合后,用 Adam、学习率 1 乘 10 的负 5 次方、每卡批量 1 句训练至收敛的配置微调 Whisper-large-v3,并在相同解码下评测。 必须保留的关键超参数与信息条件包括上述学习率、批量、步数、早停依据、总时长一致与相同解码配置。缺项清单要记下:偏好权重、温度系数、采样温度、候选数 N、偏好训练步数与批量、随机种子。
代码、权重与数据方面,本次未收到可用资源声明,只能说链接当前不可用或本次未能确认可达,不能写已公开。建议先补权重敏感性与小规模流水线联调,再跑全量 200 小时配置,以控制成本。
何时值得尝试,一句话如何记住它?
当手头有有限会话语码数据、文本覆盖尚可但录音量不够,且已有可微调的多语合成基座与可用的识别与质量评价模型时,这条路线值得尝试。它的本质不是让合成更像人耳中的好听,而是让合成在帧级语言比例上更像真值,再用这种更像的合成去教识别模型。适用条件是语码以可统计的语言比例呈现,若任务主要是口音、噪声或说话风格问题,混合约束的收益可能有限。 常见误解需要澄清。
第一,混合指数差值小不等于每处切换位置都对,它只比较整体比例,位置级保真仍需靠可懂度与后续识别验证。第二,自然度分高不等于人工偏好高,它是非侵入预测,可能与人评偏离。第三,合成增益跨架构成立不等于小模型能追平大模型,Conformer 与 Whisper 的绝对差距依然存在。第四,没有外部文本不等于方法不依赖文本多样性,它仍受 SEAME 文本分布限制。
记住它可以用一句话:先给波形每帧贴伪语言标签并算混合比例,再用可懂、好听、混合像 3 个标准挑出好坏合成对来纠正 TTS,最后用纠正后的 TTS 造数据与真数据一起训练识别模型。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
