英文题目:Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech

会议身份:conference:acl:2026:conference-paper-id:2026.acl-short.59

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#偏好优化 #大语言模型 #语音 #文本到语音

评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Rikuto Kotoge:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuichi Sasaki:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大语言模型文本到语音需由原始文本自回归生成声学词元序列再经声码器成声,难点是日语辛い等多音词读音依赖上下文且成对偏好样本稀少。方法先用原始二值标签训练对比模型π+并用翻转标签训练π−,分别刻画偏好与反偏好分布。接着将二者词元级对数似然比经上下界截断与指数映射转为重要性权重wt,使目标字符词元自动获得更大权重。最后以wt加权的词元级卡尼曼-特沃斯基价值函数优化策略模型,只放大关键读音词元奖励并抑制非关键词元干扰。在含辛い的5000句日语评测任务下,TKTO非配对版本的准确率为0.958,高于基座模型的准确率0.668。相对整句共享同一效用的KTO与依赖配对的DPO,该词元级加权实现了无需词元标注的细粒度信用分配,可利用6倍非配对数据。该结论适用边界受限于仅在日语辛い与汉语行两个多音现象及CosyVoice2单基座上验证,尚未验证对韵律音色与长文本的泛化。额外对比模型在8×A100硬件上的训练成本约为10分钟,相对数万小时预训练可忽略。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么歧义发音难?

这篇论文研究基于大语言模型的语音合成,输入是一段原始文本,输出是一段声学 token 序列,再经声码器变成波形。模型形式是自回归解码器,对每个位置预测下一个语音 token,条件是输入文本和已生成的历史语音 token。研究生复述时要抓住这个链条:文本直接决定发音选择,发音选择以序列形式展开,任何一个关键 token 读错都会被识别为整句错误。

难点在于日语等多音语言。论文用辛字举例,放在咖喱语境表示辣,放在工作语境表示艰辛,字形相同但读音和语义都随上下文改变。传统路线先用字形到音素转换器把文本切成音素,再用声学模型合成,但该转换器依赖形态分析,遇到上下文相关的一字多读容易给出唯一但错误的读音。基于大语言模型的路线希望跳过显式转换器,直接从原始文本预测带上下文的发音,但预训练并不保证每个歧义点都读对,因此需要偏好优化来纠正。

G2P × LLM-based TTS: G2P 负责把字形转写为音素序列,分工是提供确定性发音规则,但在日语一字多读且依赖上下文时形态分析会失效;LLM-based TTS 分工是直接从原始文本自回归预测声学 token,利用大规模语言预训练获得上下文感知,两者搭配的原因是前者稳定但不理解语义,后者能理解语义但需要偏好对齐来压住读错,组合意义是绕开 G2P 错误传播,把发音选择交给可优化的语言模型。

下面这张图把歧义具体化,同一红色字在两句中读音和含义完全不同,说明监督信号必须精确到字或 token,而不是整句笼统打分。初学者可以把例子记为:输入相同字形,上下文不同,目标语音 token 不同,评价时既看目标字是否读对,也看整句识别错误率是否上升。

这张图是理解任务的起点,请先看左右两栏的对应关系,再回到正文的方法动机,重点是确认红色字的位置与读音标注的对应方式。

看图路径: 1. 先读左侧两句日文中共用的红色辛字及其英文翻译;2. 再对照右侧 Reading 一列的读音标注;3. 确认同一字形因咖喱与工作不同上下文而读音语义都改变

原论文 Figure 1:Examples of ambiguity in Japanese.

论文图 1。原论文 Figure 1:“Examples of ambiguity in Japanese. Although (a) and (b) contain the same word, its meaning and reading differ depending on the context.”。

从像素可见,图分上下两行,上面一行日文对应咖喱很辣,右侧标注辣的读音和含义,下面一行对应工作艰辛,右侧标注难的读音和含义,中间共用的辛字用红色突出。这种可视化支持论文的判断:缺少上下文建模的系统难以做读音选择,而 token 级优化恰好可以把梯度集中在红色字对应的语音 token 上。后续所有权重设计都是为了解决这个定位问题。

已有偏好优化路线在语音上卡在哪里?

语音领域的偏好优化此前多沿用直接偏好优化。它要求对同一句话同时有好的合成和坏的合成,拉大两者差距,从而提升可懂度、说话人相似度和自然度。论文引用了多项把该思路用于语音的工作,说明在有配对时确实有效。但研究生要注意适用条件:该结论依赖配对存在,而语音合成的实际输出分布常是单侧的,一句话多次采样可能全对或全错,导致配对稀少。

另一条线是卡尼曼特沃斯基优化,它只要求每个样本带可取或不可取的二值标签,用前景理论的价值函数建模损失厌恶和敏感性递减,不要求同一文本成对出现。论文在附录回顾了它的序列级奖励、参考点和逻辑斯蒂价值函数,并指出自己要把它从序列级推广到 token 级。

DPO × KTO: DPO 分工是用同一文本下可取与不可取成对样本拉大偏好差距,需要严格配对;KTO 分工是用二值标签表示该输出可取或不可取,基于前景理论的价值函数分别处理增益与损失,不要求配对,搭配原因是语音合成常出现一侧全对或全错导致配对稀少,组合意义是在本研究中先用 KTO 思想构建对比模型,从而保留非配对数据的学习信号。

相关工作的对照要按同输入同目标来做。同样输入文本、同样输出语音 token、同样以人类偏好为监督时,直接偏好优化与卡尼曼特沃斯基优化的区别不在模型结构,而在数据组织和损失形态。前者是成对比较,后者是单样本效用。论文的切入点是:既然语音数据天然不成对,又需要细粒度到发音单元,就应该保留后者的数据效率,同时补上缺失的 token 级信用分配。这一定位决定了后文两步走的设计不是简单堆叠,而是先解决权重从哪里来,再解决加权损失怎么写。

论文把哪两个不匹配定义为要解决的问题?

论文明确提出两个挑战。第一是必须配对。基于成对的方法要求同一话语同时有可取和不可取输出,但现代语音合成系统倾向于稳定地全对或全错,边界上两种读音都出现的情况只占少数。结果是大量耗费人力筛选得到的单侧样本被浪费,可扩展性受限。

第二是样本级优化与发音单元不匹配。发音本质上是字符或 token 级任务,而偏好标签打在整句上,模型被迫在样本级调整所有位置,学习信号不精确。形式化上,输入记为文本,输出记为长度确定的序列,策略记为条件分布,目标是从用户反馈或偏好数据中学习 token 级偏好。

论文的贡献按 3 个维度组织:把歧义发音建模为 token 级偏好优化问题;提出不需要配对且直接针对 token 单元的方法;在大规模日语和中文多音字上验证效果与数据效率。研究生复述时应强调:问题不是合成音质不够好,而是特定 token 的读音选择错误,且纠正它的监督恰好是稀疏不成对的。

两步走的全景:先找关键 token,再加权优化

论文提出的方法简称 TKTO,流程分为两步。第一步是目标 token 权重估计,输入是样本级非配对数据,输出是每个 token 的重要性权重。第二步是 token 级优化,把这些权重乘到每个位置的价值函数上,再求和作为损失。直观理解是:先用两个对比模型投票找出哪里最能区分好坏,再让主模型在这些位置多学,在其他位置少学。

下图展示了从左到右的主路径,左侧虚线框内是深浅两色表示的可取与不可取话语,中间是两个对比模型,右侧是按 token 着色的加权数据,最终指向训练好的模型。阅读时注意颜色语义在全图一致,深绿偏向可取,橙色偏向不可取,箭头方向表示数据流向而非梯度方向。

在进入公式前先建立样本旅程:取一句含歧义字的文本,合成多个语音版本并打上整句可取标签;把这些序列送入两个对比模型得到每个位置的区分度;把区分度转为权重;再用加权损失更新主模型,使其在目标字对应位置更倾向正确读音的声学 token。

看图路径: 1. 沿左侧非配对样本条带向右追踪两条分支;2. 确认中间两个对比模型输出汇合为权重;3. 再看右侧按 token 着色的加权数据如何进入训练

原论文 Figure 2:Overview of our TKTO framework.

论文图 2。原论文 Figure 2:“Overview of our TKTO framework. Step 1: we estimate token-level importance weights, constructing two contrastive LLMs. Step 2: we optimize token-level preferences.”。

从像素可见,左框内 5 个横条代表 5 个非配对样本,箭头分别进入上方的可取模型和下方的不可取模型,下方分支明确标注标签翻转。中间输出的权重箭头指向右框,右框内每行被切成多个小格,颜色深浅表示权重大小,最终箭头指向训练好的模型,下方标注两步名称。这种布局支持论文的说法:权重估计与偏好优化解耦,前者只负责定位,后者只负责利用权重更新,避免了需要人工 token 标注。

对比模型如何构造,权重如何计算?

第一步的核心是构造两个不共享参数的对比语言模型。做法是都用卡尼曼特沃斯基目标训练,但一个用原始可取与不可取标签,另一个把标签整体翻转,即把原来可取的当作不可取来学。这样两者在大多数流畅性相关的 token 上表现接近,只在真正决定偏好的发音位置拉开差距。论文指出这种构造不需要配对数据,因此更灵活。

对比语言模型 × token 权重: 对比语言模型分工是分别拟合偏向可取和偏向不可取的分布,其中偏向不可取者通过标签翻转训练得到;token 权重分工是量化每个位置对偏好学习的贡献,搭配原因是整句标签太粗而发音错误只发生在个别字,组合意义是用 2 模型在该位置的对数似然比自动定位目标字并放大其梯度。

有了 2 个模型后,每个位置的权重用两者的对数似然比经截断和指数放缩得到。可取样本用正放缩系数,不可取样本用负放缩系数,上下截断界用于稳定优化。论文引用已有工作说明该对数比可视为 token 奖励的估计。研究生要理解符号含义:分子是可取偏向模型在该上下文给出该 token 的概率,分母是不可取偏向模型的对应概率,比值大说明该 token 更偏向可取。

\[wt = exp(µ · clamp(log π+(yt | x\]

该公式的计算目标不是直接更新主模型,而是为每个位置生成一个非负权重。截断防止个别位置比值过大主导训练,指数放缩控制加权强度。对可取序列,高奖励位置获得大权重,促使模型重点模仿;对不可取序列,配合负系数,显著偏离的位置同样获得大权重,促使模型重点避开。原文未报告截断界与放缩系数的梯度路径,因为它们属于权重估计阶段的超参数,主模型的梯度只来自第二步的加权价值函数。

加权损失如何把奖励、基线和价值拼起来?

第二步把卡尼曼特沃斯基推广到 token 级。首先定义每个 token 的奖励为当前策略相对参考策略的对数比,参考策略通常是优化前的快照或基座模型。基线是当前策略与参考策略在该前缀下的散度,用小批量估计且不传梯度,起到锚点作用。接着定义每个 token 的价值:若样本整体可取,则奖励高于基线越多价值越大;若样本不可取,则奖励低于基线越多价值越大,中间用 S 型函数和曲率参数控制形状,并用两个系数分别调节增益与损失。

token 级奖励 × 参考基线: token 级奖励分工是度量当前策略相对参考策略在该 token 上的偏离,参考基线分工是给出该上下文下期望偏离的锚点并用小批量估计且不传梯度,搭配原因是直接增大似然会同时抬高不可取 token,组合意义是只有超过基线的可取 token 才获得正价值,低于基线的不可取 token 才被有效压制。

\[rθ,t(x, y) = log πθ(yt | x, y\lt t) z0,t = KL\]

上式把符号与输入讲清后,计算目标是得到每个位置偏离参考策略的方向和幅度。研究生注意区分:这是原始逐 token 目标,还不是最终优化步骤,停止梯度的部分是基线估计,参考策略在该阶段视为固定。

最终损失是所有位置权重乘价值的负期望,即加权价值越大损失越小,优化时把权重视为已知系数,只更新主策略参数。

\[LTKTO = E(x,y)\]

该目标的组合意义是异质重要性建模:关键发音位置自动获得更大系数,非信息位置被压低,从而实现细粒度信用分配。论文强调这可以看作保留前景理论归纳偏置的 token 级泛化,而不是简单把序列损失平均到每个位置。

训练分几段跑,每段更新谁、冻结谁?

训练流程按论文实现细节可复述为 3 段。基座是已在 20,000 小时日语语音上微调的 0.5B 语音语言模型,以及同样数据训练的流匹配基线。对比模型阶段是在偏好数据上分别训练得到两个对比模型,论文报告该额外步骤在 8 卡加速器上约 10 分钟,相对数万小时预训练的数周开销可忽略。主优化阶段是对基座模型做偏好优化,学习率很小,只跑一轮,相关系数取等权与小曲率,截断范围经敏感性分析选为负 2 到 2。

参数更新方面,两个对比模型互不共享参数,各自独立优化;主模型优化时参考策略固定,基线不传梯度,只有主策略参数接收加权价值的梯度。监督来源是整句层面的可取标签加上对比模型推导的 token 权重,没有使用任何人工 token 标注。重置时机方面,论文未报告对比模型是否从同一检查点初始化后分叉,也未报告优化器状态是否重置,这两项属于缺项,复现时应固定为从同一基座出发以保证可比。

推理时与普通自回归语音合成一致:输入文本,逐 token 采样声学序列,再经声码器合成波形,不再需要对比模型和权重计算。因此额外成本只在训练侧,部署侧无持续开销。论文未将该方法扩展到在线同策略设置,明确列为未来工作,当前属于离线偏好优化,可兼容人类反馈但尚未验证在线采集的效果。

数据、基线和指标如何设置才可比?

日语文本集用生成模型构造 5000 句含目标歧义字的句子,两种读音各占一半,以覆盖两种语义。语音集对每句用男女声各合成 5 个样本,男女各约 23 小时训练语音,从中选发音正确且识别错误率最低者为可取,选发音错误且错误率最高者为不可取,识别用大词汇语音识别模型计算字符错误率。中文泛化集用同样思路构造 5000 句含多音字的句子,两种读音均衡,每句用中文说话人合成 5 个样本,用中文音素识别检查点评测。

准确率 × 字符错误率: 准确率分工是只检查目标歧义字是否读对,字符错误率分工是用语音识别转写整句后计算字符级错误并统计坏例率,搭配原因是读对目标字不等于整句鲁棒,组合意义是同时报告发音消歧能力与整体合成稳定性,避免只优化局部而破坏全局自然度。

基线条件需要仔细对齐。偏好优化类在同一基座上比较,有监督微调、直接偏好优化、卡尼曼特沃斯基优化与本方法的数据量并不相同,这正是要验证的数据效率问题。语音模型类包括流匹配模型及其加日语字形音素转换器的版本,以及工业界参考模型。论文的比较保留了实际可运行的策略,没有用事后最优代替可部署收益。

关于资源可得性,本次收到的证据中未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开。复现应以论文文字描述为准,不继承其他解读的链接或下载假设。客观指标包括目标字读音准确率、整句字符错误率和坏例率,主观指标包括自然度打分和偏好测试。

主结果显示什么,配对稀少如何限制基线?

要回答的核心问题是:在同一基座和同一歧义任务下,非配对加权方法是否同时提升准确率并降低整句错误。公平条件是基座相同、文本集相同、识别后端相同,指标方向是准确率越高越好,字符错误率和坏例率越低越好。论文报告非大语言模型基线准确率极低,说明上下文建模不可或缺;配对方法受限于边界样本,泛化不足;非配对方法可利用更多数据,显著拉开差距。

下表整理论文连续正文直接报告的数据组织差异与效果锚点,重点不是罗列所有模型小数,而是说明为什么可用量差多倍以及准确率跨度大。阅读时先看配对需求列,再看可用量列,最后看占比列,表中数值与单位保留原文写法。

训练范式是否需要配对可用样本量对应话语占比文本条件
DPO 配对是1.5K 样本10.5% 话语同一文本需同时有可取与不可取
KTO 非配对否9K 样本89.5% 话语仅有一侧也可利用
TKTO 非配对否9K 样本89.5% 话语仅有一侧也可利用
SFT 有监督否6K 可取样本单侧可取子集仅用可取样本

上表显示,配对方法只能用少量样本,而非配对方法可利用更多样本,约为 6 倍关系。原因在于仅少数话语同时含两侧输出,而多数仅含一侧。论文进一步报告准确率从 0.668 提升到 0.958,支持数据效率带来泛化的判断。但要注意这是跨数据量的比较,不是同数据量下的纯算法胜负;若要分离算法贡献,需看同为非配对的两种方法的差异,论文报告加权方法在全部指标上更优,支持 token 加权的增量作用。

下图从奖励分布验证加权是否打中目标。导读时先确认纵轴是 token 奖励,横轴是 3 组,再读黑线均值,重点比较中间组的下移幅度。

看图路径: 1. 先看纵轴奖励与三组分布的横向位置;2. 读出三条黑横线标注的均值数值;3. 对比中间不可取目标分布向下拖尾的形态与两侧差异

原论文 Figure 3:Token reward analysis. Desirable tokens have a higher reward, while undesirable tokens have a…

论文图 3。原论文 Figure 3:“Token reward analysis. Desirable tokens have a higher reward, while undesirable tokens have a much lower reward, encouraging both weights to increase.”。

从像素可见,左侧可取目标分布中心在 0.22 附近,高于右侧总体均值 0.12,中间不可取目标中心低至负 1.54 且向下拖尾呈现双峰。论文解释当 2 对比模型出现明显分歧时奖励急剧下降,否则接近总体,这种形态支持目标 token 被自动赋予更大权重。结合摘要中更强奖励的表述,可理解为目标位置的区分度远高于平均,但该倍数是汇总统计,不等于每个 token 每步都成立。

权重是否真的落在目标字上,超参数敏感吗?

要验证的反证问题是:如果权重是均匀的,那么改进可能只是数据量红利;如果权重集中在目标字,则支持细粒度定位的解释。论文用案例可视化回答,展示可取与不可取样本中目标字符对应的 token 权重明显高于非目标 token。敏感性方面,截断范围在适中区间性能稳定,过宽会轻微降低准确率,因此选中间值。训练动态方面,加权方法随训练只提升可取 token 的平均对数似然,而有监督微调会同时抬高不可取 token 的似然,说明加权抑制了错误方向。

下表用论文连续正文报告的奖励数值整理定位效果,列数满足比较需要,数值与单位保留原文写法。表前问题是:目标 token 与总体均值差多少,方向是否符合预期,表中最后一行给出准确率锚点作为参照。

Token 组奖励均值总体均值方向判断支持的机制结论
可取目标 token0.220.12高于总体应增大权重并模仿
不可取目标 token-1.540.12远低于总体应增大权重并避开
总体平均0.120.12基准非目标位置权重较小
准确率锚点0.668 到 0.9580.668 到 0.958提升数据加权共同作用

上表解释了主要收益与代价。收益是目标位置自动获得更强信号,无需人工标注;代价是需要维护两个对比模型并调截断与放缩系数。未胜出项也需说明:在配对子集上加权方法与非加权差距缩小,说明小数据下加权优势有限;中文上配对方法仍有一定效果,说明语言与基座变化时结论需重新校准。

下面案例图进一步把权重落点具体到字形,请按图例深浅观察而非猜测颜色含义,重点看目标字与其他字的对比。

看图路径: 1. 先区分上下两块样本及其英文含义;2. 沿日文序列找到被深色高亮的目标字;3. 对照右上角由浅到深的权重图例确认目标位置权重最高

原论文 Figure 5:Case study of token weight estimation. The tokens of target character have higher weights.

论文图 5。原论文 Figure 5:“Case study of token weight estimation. The tokens of target character have higher weights.”。

从像素可见,上面板为麻婆豆腐很辣的可取样本,下面板为辣酱美味的不可取样本,日文序列中目标辛字被深色方框标出,右上角图例显示颜色越深权重越高。该图支持权重估计的有效性,但属于单样本展示,不能推广为所有句子都如此精确,仍需结合上一节的分布统计一起理解。

哪些边界没有测,哪些结论不能外推?

论文在局限中明确只在高难度日语与中文数据上评估,且只评估 0.5B 单一尺寸,原因是同骨干更大版本未公开且算力限制无法做大规模预训练与扩展实验。架构泛化与尺寸扩展行为仍待探索,提出的方法理论上可用于其他特定 token 起关键作用的文本生成任务,但论文只聚焦语音偏好优化,未验证跨任务迁移。

主观评估方面,自然度打分与偏好测试均显示新方法优于基座与标准方法,但标注者数量很少,指令区分自然度打分与成对偏好选择,是否覆盖足够说话人与文本多样性属于未报告项。识别后端方面,除主识别器外还用另一日语识别器复核并得到一致趋势,支持增益不绑定特定后端,但仍是自动指标,不能等同于人评。

因果表述需谨慎。论文直接报告的是准确率提升与错误率下降,有限解释是数据量扩大与 token 加权共同作用,未验证推测是在线同策略一定更好。未测量延迟、实时率与推理开销改善,因此不能承诺这些量得到优化。训练资源与推理开销应分开讨论:训练侧多出对比模型成本,推理侧无额外模块。

复现先做什么,需要哪些超参数与检查点?

复现的第一步是重建数据划分与标签。按论文描述生成或收集含目标歧义字的句子,保证两种读音均衡,每句多次合成后按发音正确性与识别错误率选出可取与不可取。记录男女声、说话人与识别器版本,因为准确率与字符错误率都依赖识别后端。第二步是固定基座与参考策略,用同一基座初始化对比模型与主模型,避免因检查点不同引入偏差。

下表整理论文连续正文给出的可执行配置,阅读时先看训练轮数与学习率,再看额外成本,最后看中文泛化的数据规模,表中数值保留原文写法与单位关系。

配置项取值适用阶段硬件与数据条件备注
优化轮数与学习率1 epoch 与 1e-6 学习率全部偏好优化同基座对比保持一致
对比模型成本10 分钟在 8 卡上权重估计额外预计算相对预训练可忽略
中文样本组织1.5K 配对与 4K 非配对中文泛化每句生成 5 个样本与日语流程相同
日语样本组织1.5K 配对与 9K 非配对日语主实验每句生成 5 个样本非配对约为 6 倍

上表后需强调缺项:对比模型初始化细节、优化器类型、采样温度、声码器配置未在给定证据中完整交代,复现时应先跑基座与标准方法作为锚点,再加入权重模块做增量对比。超参数方面,截断选中间范围,相关系数与曲率按原文等权与小值起步,再做小范围网格。评估时同时报告准确率、字符错误率与坏例率,并用第二识别器复核,避免单后端偏差。

关于可运行性,证据状态为未发现绑定且完成验证的资源,因此只能说论文基于公开代码的许可描述实现,不能写当前可用或已公开。权重下载与系统可运行属于不同事项,需分别确认,不可混为一谈。

何时值得尝试,还需补哪项验证?

当任务满足 3 个条件时值得尝试该方法:输出错误集中在可定位的少数 token,偏好数据大量单侧存在而配对稀少,且整句标签可靠但无 token 标注。日语与中文多音字正是这类任务,目标字决定读音对错,其他位置主要影响流畅度。此时先用非配对方法扩大可用数据,再用对比模型自动定位,比强行构造配对或全句均匀优化更符合问题结构。

何时不值得是同样重要的判断。若错误是全局韵律或音质问题而非离散读音选择,token 权重的增益可能有限;若配对充足且边界样本丰富,成对信号可能更直接;若计算预算极紧,多训练两个对比模型的步骤虽短但仍需实现与调参。常见的误解是把多倍数据直接等同于算法必然强多倍,实际上数据红利与加权机制交织,同为非配对的两种方法对比才是算法增量的证据。

还需补的验证包括更大尺寸与多架构的扩展曲线、在线采集下的稳定性、更多说话人与自发文本的泛化,以及人评与自动指标的一致性分析。研究生若要沿此方向做下一步,建议先复现权重分布与训练动态两张诊断图,确认目标 token 奖励分离后再谈主指标提升,这样复述与改进都有可核对的抓手。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总