英文题目:AlignDPO: Preference-Gated Alignment for Reducing Hallucination in Decoder-Only TTS

标签:#文本到语音 | #偏好优化 | #CTC | #后训练 | #语音

评分:8.4/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

👥 作者与机构

  • Xiao Zhou:机构信息未在 arXiv HTML 中可靠披露
  • Oisín Turbitt:机构信息未在 arXiv HTML 中可靠披露
  • Kit Bower-Morris:机构信息未在 arXiv HTML 中可靠披露
  • Jonathan Carlton:机构信息未在 arXiv HTML 中可靠披露
  • Jamie Stacey:机构信息未在 arXiv HTML 中可靠披露
  • Kris Y. Hong:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

解码器自回归文本到语音合成以语音提示与目标文本拼接序列为输入,输出单码本声学词元序列,弱文本语音对齐导致漏读复读与虚构等内容幻觉是主要难点。先以长度归一化联接时序分类负对数似然扫描全部注意力头并选出单调对齐头,其输出的头集合直接作为后续正则目标进入下一步。再以全自动管线多采样生成候选并经词错误率、说话人相似度与外部对齐信号帕累托排序构造偏好对,选出的正负样本对为偏好优化提供训练数据。最后从原始主干单次优化得到目标模型,在直接偏好优化目标上叠加仅作用于正样本的轻量联接时序分类对齐项且不改架构与解码路径。相对已有方法,关键差异是将单一对齐准则门控于偏好内而非均匀施加或在解码时外部约束,使适度锐化得以保持而避免过锐失稳。在Seed-TTS-Eval英语706句评测设置下,DPO+M的WER为0.052,低于DPO的WER 0.070。该结论适用边界为仅在530M自训主干、WavTokenizer单码本与英语语料上验证,过锐初始化无法挽回且在硬集上二值检测饱和仍依赖词错误率判断,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么解码器 TTS 容易读错内容?

这篇论文研究的输入是目标文本加一段提示语音,输出是延续提示音色的目标语音。模型是解码器结构,把语音切成单码本声学词元后做自回归预测,文本经过音素化后与提示文本和提示语音一起排成上下文。

目标不是把声音变得更好听而已,而是保证说出的内容词与文本一致。作者把研究对象限定为内容幻觉,也就是漏读、重复或编造内容词,与语气词或功能词的自然变化区分开,因为前者直接破坏语义保真度。

解码器没有显式的文本到语音对齐,生成时靠注意力自行决定现在该读哪一个文本位置。一旦注意力发散或漂移,模型就会跳行、卡住或自由发挥。论文的起点是观察到从零训练的基座里只有少数注意力头自然出现近单调的语音到文本映射。

于是问题被收窄为如何加强这少数原生对齐头,而不是重写整个架构。这种收窄决定了后文只动对齐头、不动整体解码路径的选择。

内容幻觉 × 字错率: 内容幻觉分工是标记语义保真度是否受损,关注漏读、重复、编造的内容词;字错率分工是用识别转写给出可计算的可懂度代理。两者搭配的理由是幻觉检测器会过检生僻词,字错率可以交叉印证排序是否成立,组合意义是避免把单一检测器的假阳性当成模型真实差距。

本解读的输入是论文原文证据与本次收到的官方原图像素,目标是让研究生能核对并复述方法。必须保留的信息包括数据规模与构造方式、评价集与指标定义、基线与对照的训练起点、关键超参数与选择规则。

输出按学习依赖展开,先讲任务与路线,再讲全景与组件,然后是训练构造与实验条件,最后是结果、反证与复现。凡是教学举例都会标为例子,不把例子里的数字当论文证据。

同输入同目标的已有路线差在哪里?

第一条路线是编解码器语言模型类的解码器合成,例如论文提到的 VALL-E 风格与后续零样本系统。这类方法输入输出与本文相同,都是零样本提示合成,优势是扩展性好。

但共同弱点是注意力无约束,容易出现跳过、重复与拖尾。它们没有给出对齐结构的可控位置,因此幻觉更多靠数据与偏好优化间接改善。

第二条路线是显式施加单调对齐,包括编码器解码器加对齐结构、外部强制对齐器、传感器式建模、固定教师引导与重复感知解码等。它们的输入输出也相同,但监督或运行阶段不同。

有的在训练时依赖外部对齐器,有的改结构,有的在解码时加机器。这类方法的代价是部署变重或灵活性下降。论文把注意力约束推理作为同运行阶段的外部基线,它与本文共享基座参数,区别是只在推理时重塑注意力。

第三条路线是偏好优化,包括直接偏好优化及其在语音上的细粒度与组相对扩展。它们的监督是偏好对,运行阶段是后训练,与本文最接近。

但原文指出它们没有显式对齐约束来针对幻觉,有的还依赖人工标注。AlignDPO 的差异是把对齐项放进偏好优化内部,并且偏好构造全自动,同时用同一教师强制标准识别对齐头。

要回答的两个问题是什么,什么算成功?

论文把中心设计问题写成约束应该放在哪里。候选位置有 3 个:在有监督精调里均匀加、在偏好优化里按偏好加、在推理时外部加。

成功不是注意力越锐越好,而是幻觉率与字错率下降,同时说话人相似度与感知质量不下降。严重幻觉被单独定义为至少 4 个内容词出错的语句占比,用固定闭类词表排除功能词。

因此它比二值幻觉更能反映长句崩坏。第二个问题是应该锐到什么程度。论文用注意力熵度量锐度,用自由生成下的 CTC 度量是否真对齐。

比如例子:读书时手指指到哪一行,手指很稳不代表指对了行,稳是对熵,对行才是 CTC。论文要验证的关系正是适度最稳,过锐反而与未对齐一样差,并且在同样的推理约束下更脆弱。

这个判断必须同时看域内短句与域外长难句,因为门控的作用在短句上几乎不可见,在长句上才显现。

AlignDPO 全景:沿一个样本走完输入到输出

先沿一个样本走完全程。输入是一条提示语音与其文本,加上要合成的目标文本。文本经音素化,语音经每秒 40 词元的纯声学切分器切分,不含语义监督。

模型把提示文本、目标文本、起始声学符、提示语音、目标语音、结束符排成一个序列,训练时对目标语音部分算交叉熵,推理时自回归生成目标语音词元。基座用优化内核训练,部署也走优化内核。

只在需要读出内部注意力图做对齐识别与正则时才切换到 eager 注意力实现。全景分 3 步。第一步识别对齐头,对基座做 1 次教师强制前向,用长度归一化 CTC 分数给每个层头打分。

低于阈值的头进入对齐头集合。第二步构造偏好数据,用基座对每个提示与目标文本生成多个随机候选,按字错率分组后再做帕累托排序,选出优选与劣选并组成偏好对。

第 3 步做偏好门控优化,从基座出发优化直接偏好优化目标,同时只在优选样本的对齐头上加 CTC 项,得到最终模型。分析用的对照包括均匀加 CTC 的有监督精调、不加 CTC 的普通偏好优化,以及训练无关的推理时约束。

对齐头如何识别,CTC 项在算什么?

识别阶段的输入是真值文本语音对,做法是教师强制前向,避免模型在识别阶段自己幻觉污染注意力图。每个头的语音到文本注意力先按行归一化,再追加一列空白并重归一化。

然后用长度归一化 CTC 负对数似然打分。分数越低表示从左到右的单调映射越清晰。论文对基座所有层头打分,只选出 3 个低于 2 的头,分别位于较浅与中间层。

\[L_{\text{CTC}}=-\frac{1}{L}\log\sum_{\boldsymbol{\pi}\in\mathcal{B}^{-1}(\boldsymbol{z})}\prod_{t=1}^{T}\tilde{A}_{t,\pi_{t}},\]

上式中 T 与 L 是声学与文本长度,增广映射的每个元素是某语音帧对某文本位置加空白的权重。CTC 求和遍历所有可坍缩到单调序列的路径,再除以文本长度归一化。

符号输入是注意力图而不是声学特征,计算目标是单调性,原文明确的实现是单次教师强制前向加阈值筛选。这不需要外部强制对齐器,也不依赖教师模型。

对齐涌现头 × CTC 对齐损失: 对齐涌现头分工是指出约束该加在哪里,即基座中少数语音到文本近单调的注意力头;CTC 对齐损失分工是给出同一把尺子,既识别这些头又监督它们,做法是对行归一化映射加空白列后求单调路径的负对数似然。搭配理由是识别与优化共用一个目标不需要外部强制对齐器,组合意义是把结构约束限定在原生已出现的头上而不是全模型平均用力。

一个值得注意的现象是约束只加在基座原来的 3 个头上,但训练后第 4 个头也被拉近对齐集合。有监督强约束下它明显低于阈值,偏好门控下它正好压在阈值边缘。

这说明该项不仅锐化目标头,还招募了邻近头。案例上偏好门控模型的对角线比普通偏好优化更干净,教师强制下每个对齐头的 CTC 从约 1.4 到 1.5 降到约 1.0。

偏好门控如何把对齐与偏好放在同一目标里?

偏好数据的构造是全自动的。提示池是经过双识别一致性过滤的语音片段,其中八成做带宽扩展以模拟真实增强提示。目标文本池包括 500,000 条普通句与 3000 条大模型生成的难句。

难句覆盖生僻词、电话号码与绕口令,普通与难文本分别配不同数量提示。每个配对生成 20 到 30 个候选,先按字错率分成两组,再按多个标量做非支配排序并按到理想点的距离打破平局。

保留条件还要求优选在相似度上超过劣选,且两个独立识别系统对两者一致。最终偏好集约 156,000 对,对应 1600 小时。优化时每个样本切成提示段与完成段,直接偏好优化的概率只算在完成词元上。

参考模型冻结为基座。对齐项只对优选样本的对齐头集合计算,劣选样本的注意力图不进入对齐梯度。

\[L=L_{\text{DPO}}(\theta;\theta_{\text{base}})+\lambda L_{\text{CTC}}(S^{+};\mathcal{H})\,.\]

上式中第一项是相对基座的偏好目标,第二项是优选样本上的 CTC 项。偏好门控的含义是只在可靠生成上加强单调性,避免在已错位的劣选上编码虚假对齐。

论文强调排序用的外部对齐信号、头识别用的模型自身注意力 CTC、评价用的检测器是 3 个独立信号。因此不存在用同一信号既训练又评价的循环。

直接偏好优化 × 偏好门控 CTC 项: 直接偏好优化分工是让模型更偏向自动偏好中的优选续写,同时用 KL 约束不远离基座;偏好门控 CTC 项分工是只在优选样本上加强单调对齐,不让劣选样本的错位图进入对齐梯度。搭配理由是偏好梯度管听感和可懂度,对齐梯度管单调结构,两者在可靠样本上同向,组合意义是在不改结构和解码的前提下得到既偏好又对齐的模型。

训练如何组织,哪些参数更新,梯度从哪里来?

有监督基座从零训练,最多 20 轮,只优化交叉熵。数据是经过滤的衍生数据,规模 980 小时。模型是 530,000,000 参数的解码器,14 层,文本用音素化,语音用 24 kHz 切分。

有监督放置的对照从基座继续训练,CTC 权重线性退火到 1,对全部语句均匀施加。偏好优化的两个主系统都从原始基座出发,最多 10 轮,各自按验证目标早停。

论文还研究了 CTC 权重扫描、去掉门控、以及从过锐基座出发的变体。原文没有报告逐层冻结细节,因此不能从模型名推定哪些层被冻结。

下表把可复述的规模与优化条件收拢在一处。比较问题是复现时先对齐哪些预算与超参数,公平条件是同一起点与同一切分,指标方向是这些为配置量而非效果量。

条件指标基线本方法比较对象
监督规模训练量980 h530M1600 h
偏好优化轮数与批量10 epochs64200 steps
优化器学习率与约束6×10−7β=0.05annealed to 0.1

表后需要说明代价与边界。偏好数据构造依赖双识别一致性与外部对齐排序,1600 小时的候选生成与筛选成本不可忽略。对齐正则需要切到 eager 注意力,训练吞吐低于优化内核。

但部署路径仍可用优化内核,因此训练代价与推理代价要分开讨论。权重扫描显示 0.1 到 0.3 为适度区间,权重 1.0 会推向过锐,复现时不应默认越大越好。

用什么数据、什么指标、与谁比,条件是否一致?

测试分两套。域内是 Seed-TTS 评测的英文子集,去掉与训练重叠后剩 706 句,以短而干净为主。域外是自建的 500 条长难句硬集,最长 50 词。

覆盖绕口令、拼读字母数字以及不流利对话语音,用来压测门控与推理约束。资源状态方面,Seed-TTS 评测链接当前可用,演示页当前可用,说话人验证与感知质量相关资源当前可用。

只有音素工具的一个旧链接当前不可用,复现音素化时需要另找可用版本并记录版本差异。指标方向要先固定。说话人相似度越高越好,感知质量越高越好。

字错率与字符错率越低越好。内容幻觉率是出现跳过、重复或编造词的语句占比,越低越好。严重幻觉率是其中至少 4 个内容词出错的子集。

论文明确检测器会过检低置信生僻词,但配对检验下共享假阳性可抵消。且人标计数单调下降,字错率也一致,因此排序不完全依赖检测器阈值。

比较对象保持可运行策略。基座、不加偏好的均匀 CTC 基座、普通偏好优化、偏好门控模型,以及给每行叠加的训练无关推理约束。主比较固定规模、数据与切分,只隔离 CTC 项是否放入偏好优化。

主结果:幻觉降了多少,听感与相似度付出什么代价?

比较问题是在解码不变的前提下,偏好门控是否胜过强偏好基线。公平条件是同基座出发、同一 706 句域内集,指标方向是幻觉与字错率越低越好。

论文报告偏好门控在幻觉上显著优于普通偏好优化,严重率降到约 0.6% 量级。相似度与感知分在各系统间大体相当。人标也独立确认排序,基座、偏好、门控的幻觉计数依次下降。

下表把域内核心差距收拢为可核对的陈述。比较问题是门控相对强基线的增量,公平条件是同解码与同评测集,指标方向是幻觉与严重率越低越好。

条件指标基线本方法比较对象
域内幻觉hallucination15.0%11.3%∼\sim0.6%
严重幻觉severe rate4.4%∼\sim0.6%∼\sim0.6% (from 4.4%)

表后解释收益与代价。收益是严重幻觉从 4.4% 量级压到 0.6% 量级,同时字错率下降,且听感没有被牺牲。代价是没有免费的锐度,适度权重才成立。

权重过大或均匀施加都会失去增益。未胜出项也要保留,普通偏好优化本身已把幻觉从基座的高位降到 15.01%,说明偏好优化是强基线,CTC 项是在强基线上的进一步下降。

域内二值检测器在硬集上饱和而不再区分系统,因此域外鲁棒性要看字错率与严重率。不能只看二值幻觉,这是后文门控对照的前提。

注意力熵 × 自由生成 CTC: 注意力熵分工是度量对齐头有多锐,行熵在语音帧和对齐头上平均,越低越集中;自由生成 CTC 分工是度量自由生成时是否真走在单调路径上,越低越对齐。搭配理由是锐度只是集中的程度,对齐才是路径是否正确,组合意义是解释为何极锐仍可高幻觉,即低熵必要但不充分,判断鲁棒性要看自由生成 CTC 而不是只看熵。

人工计数与自动指标是否一致?

比较问题是自动幻觉检测器的排序能否被人标复现。公平条件是同一盲测子集与同一系统集合,指标方向是幻觉计数越低越好,且趋势检验显著。

论文在约 53 个片段每系统的盲测集上做人标,标注一致性较高,检测器召回高而精度中等。关键是共享假阳性在配对比较中抵消,因此相对排序仍然可信。

下表把人标计数的单调下降收拢为可核对的陈述。比较问题是三系统排序是否单调,公平条件是同批片段与双盲标注,指标方向是计数越低越好。

条件指标基线本方法比较对象
人标 53 clipsBase 计数24/10/5245 of 53 clips each
人标 53 clipsDPO 计数24/10/5105 of 53 clips each
人标 53 clips趋势检验χ2\chi^{2}p<0.001p{<}0.00124/10/5 of 53 clips each

表后解释支持与限制。支持的是人标 24 到 10 到 5 的单调下降与自动指标一致,趋势检验显著,说明主结论不 hinge 于检测器阈值。限制是人标仅 160 句总量,子集更小。

且检测器精度约一半意味着绝对幻觉率含假阳性,不能把 11.33% 读成绝对真值。未胜出项是基座的高计数,它确认了任务难度,也说明后文适度对齐的起点确实很弱。

约束放在哪里,锐到什么程度,门控何时关键?

先看放在哪里。论文比较从原始基座做偏好门控、从过锐基座做偏好、以及只做均匀有监督 CTC。结论是有监督均匀精调不必要,从过锐基座出发会失去增益。

支持的判断是 CTC 项最好只在偏好优化内加 1 次,而不是先在有监督阶段加足。再看锐到什么程度。固定门控只扫权重时,注意力熵单调下降,但幻觉非单调。

欠锐的基座与过锐的均匀基座都远高于适度区间。自由生成 CTC 与幻觉同向,而熵与幻觉脱钩,过锐模型是自信但错位的极端。

下图是域内权重扫描的像素证据。导读覆盖横轴熵越往右越锐、纵轴幻觉率、中间适度最低的完整观察路径,时间范围是单次训练后在 706 句上的评价。

看图路径: 1. 先看横轴注意力熵从左到右变小即变锐,纵轴为幻觉率;2. 再看中间适度区间的蓝色门控曲线最低,两端上扬形成非单调;3. 最后对比红色未门控点与同熵附近蓝色门控点在域内接近

原论文 Figure 3:In-domain hallucination is non-monotone in attention sharpness (Seed-TTS, n=706).

论文图 2。原论文 Figure 3::“In-domain hallucination is non-monotone in attention sharpness (Seed-TTS, n=706).”。

图后解释可见内容。蓝色门控曲线从左侧欠锐下降到中间适度区最低,再向右侧过锐上扬,红色未门控点在域内与门控接近,不构成显著差异。这支持门控在域内几乎不影响幻觉,关键作用在域外。

域外硬集上未门控退回到普通偏好基线,而门控字错率更低且严重率最低。原因是劣选上的 CTC 把长句中的虚假对齐编码进去,短句看不见,长句才暴露。

有监督放置 × 推理时约束: 有监督放置分工是在预训练式有监督阶段对全部语句均匀加 CTC 项;推理时约束分工是训练不动,只在解码每一步按熵定窗重塑注意力。搭配理由是两者代表把单调约束放在训练前段还是解码末端,与放在偏好优化内的 AlignDPO 形成三处放置对照,组合意义是定位约束在何时加才不破坏偏好数据带来的可靠性筛选。

推理时约束为何同样呈 U 形?

比较问题是熵定窗的推理约束在不同锐度模型上效果是否一致。公平条件是同一熵定窗规则作用于各自对齐头,指标方向是幻觉与严重率越低越好。

规则按四舍五入的熵算半径,过锐头半径坍缩到 2,而较软模型为 5 到 10。约束帮助柔软基座,在适度门控处最低,过锐模型加约束后急剧恶化。

下表把 5 个模型的熵位置收拢为可核对的陈述。比较问题是锐度排序与对齐排序是否一致,公平条件是同 706 句与同自由生成统计,指标方向是熵越低越锐。

条件指标基线本方法比较对象
软到锐Base 熵C_{E}=1.010.840.48
软到锐DPO+M 熵C_{E}=1.010.480.08
软到锐过锐熵C_{E}=1.010.080.07

表后说明支持与边界。支持的是从软到锐的熵序列连续下降,而幻觉最低的是中间的门控,不是最锐的两端。边界是该对照是模型间相关,严格因果需要固定其他因素的干预。

权重扫描与窗宽对照只是逼近因果,不能说每一步更锐必然先好后坏。用固定宽窗 7 的对照排除了窄窗假象,过锐模型幻觉回到不加约束水平但不更好,说明坍缩是内在的。

下图是推理约束在双测试集上的像素证据。导读先确认图例中实线加约束与虚线不加约束的两组曲线,再沿横轴比较先降后升,最后观察最锐两点上跳。

看图路径: 1. 先确认图例中实线加约束与虚线不加约束的两组曲线;2. 再沿横轴从软到锐比较五个模型的幻觉率先降后升;3. 最后观察最锐两点加约束后反而明显上跳

原论文 Figure 4:ACI’s effect is non-monotone (U-shaped) in attention sharpness, on both an in-domain and a hard…

论文图 3。原论文 Figure 4::“ACI’s effect is non-monotone (U-shaped) in attention sharpness, on both an in-domain and a hard out-of-domain set: hallucination vs.”。

图后解释可见内容。蓝色域内幻觉与深色硬集严重率都随熵从软到适度下降,再到过锐处上跳,加约束实线在两端分化最明显。这支持训练与推理都应保持适度对齐,而不是最大化或在解码强加。

听感检验是否只是自动指标自嗨?

听感检验的比较问题是压住幻觉是否损害自然度。公平条件很关键,论文只选经人工确认在所有参评系统中都无幻觉的 30 条语句做测试。

15 名听众,随机顺序,可选无偏好。这样做把内容正确性固定,单独检验自然度,避免用有幻觉的样本污染听感判断。指标方向是偏好比例越高越好。

下表是原文可直接选择的听感表。比较问题是门控自然度是否优于基座与强基线,公平条件是无幻觉子集与随机呈现,指标方向是偏好占比越高越好。

BaseDPODPO+MN/Ppp
28.2–54.717.1«0.001
–33.646.020.40.004

表后解释主要收益与具体代价。门控模型对基座的偏好为 54.7% 对 28.2%,无偏好 17.1%,双侧二项显著。门控对普通偏好优化的偏好为 46.0% 对 33.6%,无偏好 20.4%,同样显著。

支持的判断是抑制幻觉没有降低自然度,反而在固定无幻觉的样本上仍被更偏好。限制是样本仅 30 条且限定无幻觉,没有评测有幻觉样本的听感,也没有测量延迟与成本。

因此不能把该表推广为全场景听感或效率结论。未胜出项是普通偏好优化,它已优于基座,但仍劣于门控,说明对齐项带来听感之外的自然度增益。

哪些还没证明,哪些数字不能直接推广?

论文直接报告的是单基座、单码本、单语料下的结果,结论明确限定在该配置。基座是 530,000,000 参数、单码本声学切分、980 小时有监督加 1600 小时自动偏好。

评测主要是 706 句英文加 500 条硬集。支持的是适度对齐最优与门控保域外增益,可能但待验证的是该规律是否适用于语义码本、更大规模或流式匹配模型。

原文没有给出这些外推证据。缺失证据不是技术错误,但要逐项点名。延迟与吞吐没有系统测量,只知道训练需 eager 注意力而部署可用优化内核。

不能承诺推理更快或更便宜。输出帧率每秒 40 词元不等于实际延迟,总体趋势不等于每组每步都成立。检测器精度约一半意味着自动幻觉率含共享假阳性。

论文用配对检验与人工计数对冲,但把具体百分比读成绝对真值仍会高估。听感只在无幻觉子集上成立,不能推广为有幻觉时仍更自然。

资源方面演示页当前可用,评测集当前可用,但音素工具旧链接当前不可用。复现必须锁定替代版本,否则音素差异会混入字错率。

复现先做什么,后做什么,如何核对每一步?

先复现基座与评价管线。按原文规模训练或获取同配置基座,固定音素化版本与切分每秒 40 词元,跑通说话人相似度、感知质量、字错率与幻觉检测。

先在 706 句去重后的英文集上复现基座、普通偏好与门控的排序,再看严重率是否从 4% 量级降到 1% 以下。核对点是数据集、模型起点、实验阶段、指标与聚合对象必须同时一致。

数值相同不是同一指标的证据。再复现识别与门控。用 1 次教师强制前向给全部层头打长度归一化 CTC,阈值取 2,确认是否得到 3 个主要头以及第 4 个边缘头。

偏好构造按双识别一致、优选相似度超过劣选、难句多配提示的规则生成约 156,000 对。排序信号用外部对齐的词后验均值与拉伸比,不要误用模型自身注意力或评价检测器。

优化从基座出发,KL 系数 0.05,批量 64,CTC 权重退火到 0.1,早停按各自验证目标。核对点是梯度只来自优选样本的对齐头,劣选图不进入对齐梯度。

后做权重扫描与推理约束对照。门控权重扫 0.05、0.1、0.3、1.0,观察熵单调下降而幻觉呈 U 形。叠加推理约束时按熵定窗,检查过锐头半径是否坍缩。

并用固定宽窗做对照以排除窄窗假象。何时值得尝试是当解码器出现漏读重复且已有偏好管线时,优先把轻量 CTC 放进偏好优化而不是先做均匀有监督对齐。

一句话收束:何时用,何时停?

当基座已出现少数单调头、偏好数据可用、解码必须保持不变时,用优选门控的 CTC 项在偏好优化内把对齐推到适度区。权重参考 0.1 到 0.3,不要推到 1.0 或提前在有监督阶段推满。

当硬集字错率不再下降、自由生成 CTC 不再下降、或推理约束开始恶化过锐模型时就停。因为此时更锐已不是更对齐。

记住判断顺序是先看自由生成是否对齐,再看熵是否适度,最后看听感是否在无幻觉子集上成立。这样才能把论文的非单调结论复述为可执行的操作,而不是一句越对齐越好。

📎 论文与评分元数据

排名:前25% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-14 语音/音乐/音频论文速递