英文题目:What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR
会议身份:
conference:interspeech:2026:conference-paper-id:toyin26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#评测协议 #言语障碍 #语音 #语音识别
评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Hawau Olamide Toyin:机构信息未能从会议 PDF 纯文本可靠映射
- S Umesh:机构信息未能从会议 PDF 纯文本可靠映射
- Hanan Aldarmaki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以口吃非典型语音音频为输入,要求同时产出意图转写与逐字转写两种合法输出,难点在于同一音频对应两种真值而单参考词错误率会奖励删除口吃属性的系统。方法链分三步衔接:先在FluencyBank Timestamped全量3430样本上对11个开源系统做零微调推理,得到原始预测文本;再经统一文本规范化后并行计算意图词错误率与逐字词错误率及语义指标,形成双参考排名;最后将音频段与CASA临床事件标注对齐,按SR、ISR、MUR、P、B五类事件切分误差构成,并对比词错误率与语义指标分歧以检验意图评测充分性。与既有单参考评测的本质差异是坚持双真值并行排名,从而暴露自回归解码的语言先验归一化偏置与CTC局部声学映射的保留偏置,为按听写与临床评估分选架构提供依据。在FluencyBank Timestamped基准下,NVIDIA Canary-1B-v2的意图词错误率isWER为13.85,低于Whisper Large-v3的意图词错误率isWER16.13。该结论的适用边界受限于英语访谈域与默认推理配置,跨域重度口吃外推尚未验证。结论限于英语访谈域与默认推理配置,未验证微调、多语言与重度外推。原文未披露训练与部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Theehawau/usecase_asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么口吃语音让一句话有两个正确答案?
这篇论文研究的是非典型语音中的口吃语音识别。输入是一段真实采访录音,时长可能只有几秒,但里面包含重复、延长、填充词和阻塞。例如说话人实际发出的是类似我我我想去、嗯走的声音。如果按字面记录,就要保留所有的我和嗯;如果按说话人本意记录,就只写我想去。两个文本都忠实于不同目标,都可以称为正确答案。
初学者容易把语音识别理解为把声音变成文字,1 对一打分即可。但口吃语音打破了这个假设。论文开场举了一个 2 秒录音的例子:一个模型输出删掉口吃的流畅句,另一个模型输出保留重复的原始句。若只用流畅句做参考,前者得分更高;若只用原始句做参考,后者得分更高。
评价者必须先回答下游任务是什么:如果是听写和语音助手,用户要的是可执行的干净指令;如果是言语治疗和严重度评估,治疗师要的是哪个词诱发了口吃、重复了几次。
因此本解读的目标是帮研究生复述双参考基准的完整链条:任务如何定义两种参考,11 个模型如何按原样调用而不微调,词错误率与语义分如何分别计算,以及架构分化与事件难度如何被验证。必须保留的信息包括数据集名称与样本量、模型家族划分、意图词错误率与逐字词错误率的定义方向、排名翻转的具体数字、事件缩写含义,以及代码已公开的事实。输出按学习依赖展开,先讲任务与路线,再讲方法全景与组件计算,最后讲实验条件、结果反证与复现动作。
前人走了哪条路:为什么主流评价隐含了意图偏好?
第一条路线是报告非典型语音上的性能与偏见。已有工作在真实与合成口吃语音上用意图文本做唯一参考,比较流畅与口吃语音的词错误率和语义分,结论是严重程度越高失败率越高。另一部分工作把语音助手当成语义问题,直接优化意图理解,例如对命令做个性化微调。这类路线本身没有错,但它们把删去不流畅当成默认正确,没有声明参考类型。
第二条路线是把识别当作不流畅事件检测。做法是在转写中加入特殊标记,例如用重复标记代替写出 3 次我,或者做数据增强与微调来提升事件检出。还有工作为失语症提出不完美词错误率,先做意图归一化再检测事件。这些工作承认逐字细节有价值,但往往只服务于检测流程,没有系统比较不同架构在两种参考下的取舍。
论文回顾近五年发表在语音主会的工作后报告,只有一项工作同时区分并评价意图与逐字。常见做法是事后把逐字文本格式化、删掉不流畅事件再当参考,或者做去填充词的后处理,这会提升类意图指标却损害逐字忠实度。教学例子是:把二十的阿拉伯数字与英文单词视为等价,意图上可接受,但逐字计分仍可能判错。类别差异不能当成同条件胜负,本文的贡献正是把两种参考形式化为并列基准,而不是在单一参考下争最好。
问题如何形式化:两种参考与两种用户是谁?
论文把问题定义为双参考基准。设同一音频对应两个参考文本:意图参考是去掉不流畅后的规范句,例如我想要去;逐字参考是保留重复与填充的实际产出,例如我我我想要嗯去。模型输出一个假设文本,评价时分别与两个参考计算词错误率,得到意图词错误率与逐字词错误率,越低越好。同时用语义相似度辅助判断意图是否保留。
两类用户对应两类正确。意图用户包括口吃者本人做听写、发指令,以及语音助手执行命令,他们不希望重复词进入文档或被误执行。逐字用户包括言语语言病理学家、家长与研究者,他们需要知道阻塞发生在哪、哪个音节被重复,以便做严重度评估与模式研究。若论文只报告一种词错误率却不说明参考类型,就会误导选型:一个擅长删除口吃的模型会被宣传为总体最好,而临床需要的保留能力反而被惩罚。
意图转写 × 逐字转写: 意图转写分工是还原说话人想表达的规范文本,主动删去重复、延长和填充词,服务于听写与指令执行;逐字转写分工是忠实记录实际发出的每一个音节碎片与重复,服务于临床评估与言语研究;二者搭配的理由是同一段口吃音频同时对应两个合法文本,组合意义在于评价时必须声明采用哪一种参考答案,否则把删去口吃当成正确就是一种未经声明的价值选择。
这种双重性还带来公平性含义。把归一化写死为正确,等于规范了口吃者应该如何被书写。论文因此要求后续工作明确声明优化的是哪种转写,并公开局限,例如是否保留重复。问题本身不涉及新模型训练,而是评价协议的修正:同一输出在不同参考下含义不同,排名不稳定不是噪声,而是任务定义不同。
方法全景:不训练新模型如何完成双参考基准?
论文没有提出新架构,也没有微调任何模型,全部 11 个开源模型都按公开默认配置原样推理。方法全景可以沿一个样本走完:取一段 FluencyBank 访谈音频,先找到它在 FluencyBank Timestamped 中的意图与逐字两段参考,再到 CASA 中找到重叠时间段的临床事件标签,例如音节重复或延长;把音频送入某个待测模型得到假设文本;用统一文本归一化去掉大小写与标点但保留重复词与填充词;最后分别与两个参考计算词错误率与语义分,并按事件分组聚合。
关键设计是控制比较条件。为了分离架构效应,论文纳入了在同一 NeMo 语音识别数据集合上训练的 NVIDIA 模型家族,包括自回归的 Canary、Transducer、CTC 与 FastConformer 等变体。这样当训练数据相同时,若仍出现意图与逐字分化,就更支持是训练目标与解码行为导致的偏好,而非数据差异。其他模型如 Whisper、Wav2Vec2、HuBERT、SpeechBrain 系列则用于覆盖编码器解码器、CTC 与混合注意力等更广谱系。
FluencyBank Timestamped × CASA: FluencyBank Timestamped 分工是提供同一访谈音频的逐字与意图两套转写,使双参考评价成为可能;CASA 分工是为同一语料提供临床口吃事件切分,包括音节重复、不完全音节重复、多音节单元重复、延长和阻塞;搭配理由是只有把文本参考与事件标签按音频重叠对齐,才能按事件类型拆解误差,组合意义在于论文得以区分哪类口吃事件拖累意图归一化、哪类拖累逐字保留。
推理与评价全部可重放。论文说明使用各模型在模型主页描述的推理与解码设置,不做参数搜索,代码已公开。资源状态是正文开源声明的唯一依据,本次收到的资源状态显示代码链接当前可用,地址为论文中给出的仓库。初学者复述时要强调:这是一项基准研究,计算过程是调用、解码、归一化与计分,没有梯度更新,也就不存在拿掉某训练步骤会怎样的因果结论。
组件如何分工:自回归与 CTC 看到的证据有何不同?
自回归序列到序列模型的直觉是全局加历史。编码器先看完整音频,解码器每步同时看全部声学上下文与之前已生成的词,像语言模型一样预测下一个词。当某段 acoustics 因延长或重复而不确定时,语言先验会把它补成最可能的流畅词。论文假设这类模型更擅长意图识别,因为它们能用上文把碎片归一化掉。典型代表是 Canary 与 Whisper。
CTC 模型的直觉是局部映射。编码器每帧输出一个文本单元分布,假设各输出单元条件独立,较少依赖已生成的词历史,更多依赖当前帧的声学证据。重复了几次就写几次,不会主动删改。论文假设这类模型更擅长逐字转写,因为它们忠实于局部声学。典型代表是 NVIDIA CTC、Wav2Vec2、HuBERT 与 QuartzNet。Transducer 介于二者之间,用截至当前时刻的声学帧加历史做流式预测。
自回归序列到序列 × CTC: 自回归序列到序列分工是利用全部音频全局上下文加已生成的上文逐词预测,能靠语言先验把不确定的重复片段归一化为流畅词;CTC 分工是只用当前帧附近的局部声学证据独立映射到文本单元,较少依赖上文历史;搭配理由是二者代表了依赖语言上下文与依赖局部声学的两个极端,组合意义在于论文可以用同族模型对照证明转写偏好来自训练目标与解码行为,而不只是训练数据不同。
评价组件同样分工明确。意图词错误率与逐字词错误率都是词错误率,只是参考不同;SeMaScore 与 BERTScore 负责语义。论文用 Whisper 的基础文本归一化统一大小写与标点,但明确不删除重复与填充,这是保证双参考公平的前提。若归一化时删掉重复,逐字任务就被提前泄露了答案。
指标如何计算:词错误率与语义分为何必须联用?
词错误率由替换、删除、插入 3 类编辑操作构成。意图场景下,模型输出要与干净参考比,重复残留会计为插入,碎片误配会计为替换;逐字场景下,模型输出要与保留重复的参考比,漏写重复会计为删除,碎片写错会计为替换。论文报告按事件分组后,意图以插入与替换为主,逐字以替换为主,并给出具体计数,说明两类任务的失败模式不同。
语义分的必要性来自意图参考与声学不完全对应。意图参考是人为去掉重复后的规范句,词错误率对表面形式严格,会把二十与 20 判为错误,尽管含义未变。论文用表格展示三指标行为分化:词错误率最透明但会夸大格式差异;SeMaScore 对含义改变更敏感,能拉开好坏假设的差距,但对数字写法仍敏感;BERTScore 在短句上区分度最弱,明显错误的假设仍能得高分,对专有名词错误也不敏感。
词错误率 × SeMaScore: 词错误率分工是按替换、删除、插入 3 种编辑操作逐词计分,透明且对表面形式严格;SeMaScore 分工是度量假设与参考在语义上的接近程度,用于判断错误是否改变含义;搭配理由是意图识别中参考文本本就不是音频的逐字删除,单纯词错误率会把数字写法等价变体也判错,组合意义在于意图场景需要词错误率加语义相似度联合报告,逐字场景则仍以词错误率为主。
复述时要记住方向:词错误率越低越好,SeMaScore 与 BERTScore 越高越好。论文建议意图应用报告意图词错误率加语义相似度,逐字应用报告逐字词错误率。相关性不等于因果,语义分高不证明临床可用,仍需看是否保留了关键重复。
有无训练阶段:冻结参数下真实计算是什么?
本研究没有训练阶段,没有梯度路径、优化器更新、参数冻结与解冻或重置时机的报告。11 个模型全部按发布权重原样调用,不做微调与超参数搜索。真实计算只有 3 步:前向推理得到假设文本,文本归一化统一格式,计分与按事件聚合。论文未报告训练资源、推理延迟与吞吐,因此不能从模型名称推定实现细节,也不能承诺延迟或成本改善。
对于 NVIDIA 家族,论文利用了它们大多在同一预定义 NeMo 语音识别数据集合上训练这一事实,把它当作自然对照。这不是本论文的训练,而是借用已有训练配置的等数据条件来比较不同目标:自回归、Transducer 与 CTC 在相同数据下仍分化,就支持目标本身带来偏好。但论文也承认并非所有模型数据设置可比,跨家族比较时参数量与数据仍混杂,不能把趋势推广到每一组都成立。
Transducer × 编码器 CTC: Transducer 分工是流式地结合截至当前时刻的声学帧与已预测文本历史来预测下一个单元,兼顾声学与短历史;编码器 CTC 分工是基本只用当前时刻编码器表示做帧级分类并假设输出单元条件独立,更贴近声学;搭配理由是二者都是非自回归全局解码之外的中间路线,组合意义在于检验偏好是连续谱还是只有自回归与 CTC 两端才显著,论文结果显示 Transducer 居中而 CTC 家族整体更偏逐字。
缺项要明确指出:原文未给出各模型的训练轮数、学习率、数据配比与解码束宽的具体统一表格,只说采用各模型主页默认配置。若要复现,首要动作是锁定各模型的提交版本与解码配置,而不是猜测训练细节。无训练不等于确定性求解,解码采样与外部环境仍可能带来波动,冻结参数不能保证输出逐字确定。
实验条件:数据、划分、基线与聚合口径是什么?
数据来自两个已发表来源。FluencyBank Timestamped 提供访谈部分的逐字与意图转写,论文使用其全量 3430 个样本,语言为英语。CASA 提供同一语料的临床主次口吃事件切分,论文按音频重叠把事件标签对齐到转写片段,用于按事件分析。主要事件缩写为 SR 音节重复、ISR 不完全音节重复、MUR 多音节单元重复、P 延长、B 阻塞。
基线就是 11 个模型互为对照,没有额外的搜索最优或事后最优值。模型清单覆盖自回归的 Whisper Large-v3、SpeechBrain Transformer、NVIDIA Canary-1B-v2,非自回归的 NVIDIA Transducer、NVIDIA CTC、HuBERT Large、Wav2Vec2 Large、NVIDIA FastConformer、SpeechBrain Streaming、NVIDIA QuartzNet 与 SpeechBrain CRDNN。评价时预测与参考都经过同一归一化再计算意图词错误率、逐字词错误率与 SeMaScore,并报告按词错误率的排名。
聚合口径是全集平均加按事件分组平均。论文未报告置信区间与显著性检验,也未报告硬件预算与推理开销。复述时不要编造划分比例,原文用的是全集,没有训练集测试集重划分。指标单位按原文:词错误率以小数或百分比形式出现,数值相同时仍需核对是意图还是逐字、是总体还是某事件子集,不能只看数字相同就认为是同一指标。
主结果:排名为何随参考答案翻转?
论文报告的核心现象是排名不稳定。总体上意图最优是 NVIDIA Canary-1B-v2,意图词错误率为 13.85,逐字词错误率为 21.95,意图排名第 1 而逐字排名第 2;逐字最优是 NVIDIA CTC,逐字词错误率为 17.20 左右,意图排名第 5 而逐字排名第 1。常被用作非典型语音基准的 Whisper Large-v3 意图排名第 2、逐字排名第 3,同样不是双榜第一。多个系统在切换参考后移动多位,这不是计分噪声,而是两种正确并存。
以下导读先建立坐标系,再看分化,最后落到可运行策略的选择。横轴是意图词错误率,纵轴是逐字词错误率,都是越低越好。对角虚线为双任务均衡,离线越远专门化越强。左上圆点为自回归编码器解码器,右上方形为 CTC,中间为 Transducer 与混合模型。
看图路径: 1. 先看横轴意图词错误率与纵轴逐字词错误率都是越小越好,原点方向在左下;2. 再看灰色虚线为双任务均衡线,偏离虚线越远说明任务专门化越强;3. 对比左上圆形自回归点与右上方形 CTC 点的位置,分辨意图优势区与逐字优势区;4. 检查同为 NVIDIA 家族的点是否仍保持相同分化,以排除训练数据不同的解释
论文图 1。原论文 Figure 1:“Intended vs Verbatim ASR Performance for top per- forming models. Distance from diagonal infers task specializa- tion. Ar: Autoregressive, Enc-Dec: Encoder-Decoder.”。
从可见内容看,NV Canary 与 Whisper Lg v3 位于左下意图优势区,NV CTC 位于右上逐字优势区,NV FastConformer 与 NV Transducer 靠近中线,Wav2Vec2 与 HuBERT 位于右下双差区。即使只看同数据训练的 NVIDIA 家族,Canary 偏意图、CTC 偏逐字的分化依然存在,支持训练目标与解码行为本身会塑造转写风格。教学含义是选型必须先定用例:听写与指令选意图最优,临床记录选逐字最优,没有普适最好。
为便于核对,把最关键的可运行对照整理成下表。比较问题是同一音频下谁更适合哪种参考,公平条件是同一 3430 样本全集与同一归一化,指标方向为词错误率越低越好。表中数字保留原文写法,百分点与相对百分比不混用。
| 使用场景 | 参考文本类型 | 评价指标 | 最优模型 | 词错误率 |
|---|---|---|---|---|
| 听写指令 | 意图参考 | 意图词错误率 | NVIDIA Canary-1B-v2 | 13.85 |
| 临床记录 | 逐字参考 | 逐字词错误率 | NVIDIA CTC | 17.2 |
| 听写指令 | 意图参考 | 意图词错误率 | Whisper Large v3 | 16.13 |
| 临床记录 | 逐字参考 | 逐字词错误率 | Whisper Large v3 | 25.01 |
表后解释是:意图最优与逐字最优分属不同家族,Canary 在意图上领先但在逐字上让位给 CTC,Whisper 在两榜都靠前但都不是第一。代价是若只看意图榜会误以为 CTC 很差,实际上它是逐字榜第一;反之只看逐字榜会低估 Canary 的归一化能力。未胜出项如 SpeechBrain Transformer 与 CRDNN 在两榜都靠后,说明并非所有自回归或混合模型都自动获得意图优势,架构与数据仍有边界。
事件拆解:哪类口吃最拖累两类任务?
论文把音频按 CASA 事件分组后,用意图最优的 Canary 测意图、用逐字最优的 NVIDIA CTC 测逐字。结论是延长事件在两类任务下都最容易,词错误率最低;不完全音节重复与多音节单元重复在两类任务下都最难。直觉是延长只是时间拉伸,词形稳定,模型易映射到正确词;而碎片重复既难删干净又难写准确,意图要去掉碎片,逐字要保留碎片写对。
以下导读先看图例与平均线,再定位最易与最难事件。深色柱为意图,浅色柱为逐字,两条水平虚线为总体平均。纵轴是词错误率,越低越好。
看图路径: 1. 先对照图例深色为意图、浅色为逐字,再看每组事件下两根柱子的高低;2. 再看两条水平虚线代表的总体平均,判断哪些事件高于平均误差;3. 重点比较延长事件与不完全音节重复、多音节重复事件的柱高差异;4. 观察阻塞与音节重复事件是否同样低于平均,确认最难事件是否集中
论文图 2。原论文 Figure 2:“Word error rate by stutter event type or intended and verbatim references.”。
可见内容显示,P 组两根柱子都最低且低于平均线,SR 与 B 组居中且低于平均,ISR 与 MUR 组明显高于平均,其中 MUR 的逐字柱最高,ISR 两柱都高。这支持论文判断:ISR 与 MUR 不成比例地驱动误差。像素不能精确读出的具体柱高不硬写,以原文总体平均与相对高低为准。
为核对指标行为差异,把论文讨论语义指标的样本整理成下表。比较问题是词错误率与语义分在意图场景是否一致,公平条件是同一归一化与同一意图参考,方向为词错误率越低越好、语义分越高越好。
| 样本 | 参考与假设 | 意图词错误率 | 语义分 | 词汇分 |
|---|---|---|---|---|
| 样本 1 | 意图参考对正确假设 | 0 | 1 | 1 |
| 样本 1 | 数字写法变体假设 | 0.33 | 0.63 | 0.99 |
| 样本 2 | 明显错误的重复假设 | 1 | 0.37 | 0.84 |
| 样本 3 | 专有名词混淆假设 | 0.3 | 0.7 | 0.86 |
表后解释是:词错误率最严格但会把等价写法判错,SeMaScore 对含义改变更敏感而能拉开差距,BERTScore 在短句上区分度不足,明显错误仍能得 0.84 左右,两个不同的地名错误甚至得相同分数。代价是没有任何单一指标可独立报告意图准确率,必须联用。未评测边界是长句与多事件叠加样本的语义稳定性,原文未单独量化。
边界与反证:哪些结论不能推广?
论文明确的局限是仅限英语与 FluencyBank Timestamped 访谈域,结论向多语言与更多说话场景推广仍待验证。模型间训练数据与参数量不完全可比,跨家族的优劣不能解读为架构因果,只有 NVIDIA 同数据子集的分化更支持目标效应。评价未测量误判率之外的延迟、成本与帧率,不能承诺这些量得到改善。
反证来自编辑操作构成与样本输出。意图误差以插入与替换为主,逐字误差以替换为主,说明意图难在删不干净、逐字难在写不准碎片。例如逐字参考为 bureaucratic 的不完全重复时,逐字模型把碎片写成相近但错误的音节;同一音频下意图模型则试图配成合理短语,插入了原本没有的词。再如多音节重复的 bully 样本,逐字模型漏写重复并替换词尾,意图模型则把整句改写为长期 workforce 类的流畅但错误的句子。
另一个反证是语义指标的盲点。数字写法等价仍被扣分,说明归一化控制必须谨慎;BERTScore 对明显错误仍给高分,说明自动语义分不能当成人评。总体趋势不等于每步成立,某些阻塞样本的意图模型反而比逐字模型更不稳定。复述时要用报告、支持、可能 3 级表达:排名翻转是报告,架构分化是数据支持的解释,跨语言适用是待验证推测。
复现先做什么:如何一步步重跑双参考基准?
第一步准备数据与标签。获取 FluencyBank Timestamped 全量 3430 样本的音频与两套转写,再获取 CASA 的事件标注,按时间重叠把事件对齐到转写片段。记录语言为英语、域为访谈,不要自行划分训练测试集。第二步锁定模型版本与解码配置。按各模型主页默认推理设置调用 11 个开源权重,不微调,不调参,保留版本号以备核查。
第 3 步统一归一化与计分。对假设与参考同样做去标点与统一大小写,但保留重复与填充词,然后分别计算意图词错误率、逐字词错误率与 SeMaScore,并记录按词错误率的排名。第四步做事件分组与误差构成分析。按 SR、ISR、MUR、P、B 分组统计词错误率,再统计替换、删除、插入占比,检查延长是否最低、不完全与多音节重复是否最高。
信息条件上,代码当前可用,权重需从各自官方仓库下载,系统可运行取决于本地解码环境。论文未给出硬件预算,复现时应自行记录推理耗时与显存占用,但不要回填为论文数字。还需补的验证包括中文等其他语言、儿童与重度口吃、流式解码下的逐字稳定性,以及人评对意图等价写法的接受度。
收束:何时值得尝试双参考评价?
当你的用户同时包括要干净文本的人与要原始记录的人,就值得尝试双参考。听写、指令与字幕优先意图参考,报告意图词错误率加语义分;严重度评估、治疗随访与口吃模式研究优先逐字参考,报告逐字词错误率。选型上,自回归序列到序列更可能直接给出可用的意图文本,CTC 更可能保留可审计的逐字细节,Transducer 居中可按延迟需求权衡。
常见误解是把词错误率低等同于对口吃者更公平。论文的纠正是:删掉口吃换来的低分对临床可能是信息丢失,保留口吃换来的高分对助手可能是可用性下降。公平来自声明与匹配,而非单一分数。另一个误解是把语义分高当成含义一定正确,实际上数字写法、专有名词与短句重复仍会误导自动分,需要人评抽查。
一句话收束是:先定用例再选参考,先定参考再比模型,任何自称非典型语音最好的结论都必须注明是在哪种参考下最好,否则就是把一种书写规范强加给所有声音。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

