英文题目:CLASH: Counterfactual Auditing of Lexical and Prosodic Reliance in Spoken Sarcasm Detection
标签:#口语理解 | #评测协议 | #韵律 | #音频大模型
评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Qiyang Sun:机构信息未在 arXiv HTML 中可靠披露
- Xudong Li:机构信息未在 arXiv HTML 中可靠披露
- Yupei Li:机构信息未在 arXiv HTML 中可靠披露
- Jiabin Xue:机构信息未在 arXiv HTML 中可靠披露
- Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露
- Jiaming Li:机构信息未在 arXiv HTML 中可靠披露
- Bjorn W. Schuller:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
口语讽刺检测需判断字面与意图是否相反,输入为目标话语及可选上下文,输出为讽刺二分类,难点是词汇内容与韵律高度纠缠。受控词汇声学分离框架对同一话语构造原始与三种变换语音,再用固定检测器打分并做配对比较,最后经时长加权与聚类自助法检验稳健性。词汇保留分支压平基频与能量起伏而保留时序,韵律保留分支用声码器替换谱包络而保留基频,近似中性分支叠加两者。与已有消融只看加音频是否有益不同,该设计引入中性参照并分离分数敏感性、区域下曲线面积判别力与二值决策。在CMMA语料的目标-only评测条件下,Qwen3-Omni词汇保留条件的AUROC为.688,高于韵律保留条件的AUROC .549。结论仅适用于所测检测器与变换链路,跨语料的上下文与交互效应并不一致。其适用边界受限于不完美解耦与语料特异结构,跨场景外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/glam-imperial/clash — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
这篇解读的输入是题为 CLASH 的英文原文证据与两张官方原图像素,目标是让刚进入语音与音频领域的研究生能够核对方法并复述实验。必须保留的信息包括 4 个语音条件如何构造,3 类检测器如何固定参数评估,主要对比量如何定义,时长平衡与簇自助如何实施,以及在何种条件下词汇保留优势成立,在何种条件下上下文与交互效应不一致。
输出是一套按学习依赖展开的中文讲解,不做营销式判断,不补写原文没有的数值效果。全文先讲任务为什么不能只看正确率,再讲反事实审计的全景,然后沿着一个样本走完输入到表示到组件到目标再到输出,接着讲构造与推理的真实计算过程,最后讲实验条件与结果反证,以及复现步骤与适用边界。
教学用的举例会明确标为例子,例如把字面夸奖而意图相反的一句话拿来说明字面与语调可能相反,但例子不携带论文的定量结论。所有关键数字都回到原文连续句子核对,单位与精度保留原样,代码链接本次显示当前可用,但可用不等于一键可运行。
讽刺检测与诊断路线此前各自解决了什么?
口语讽刺检测的任务是判断说话人是否讽刺,其难点在于意图可能与字面内容相反,而语音中字词选择与对话上下文与发声方式都可能提供线索。早期路线用韵律与频谱与上下文描述子做分类器,后来用学到的声学表示做迁移,再后来在英文与中文多模态会话语料上做特征融合与不一致建模。
这些工作提高了总体预测性能,但作者指出音频带来的总体增益不能证明系统用了韵律,因为学习到的语音嵌入可能同时混入词汇与韵律信息。另一条诊断路线开始区分总体增益与线索使用,例如用韵律中性的语音合成揭示语音情感识别的语言敏感性,以及用词汇与声学依赖评估报告情感识别中的词汇主导。
针对讽刺,已有工作用提示校准结合声学证据改进检测,也有工作通过模态比较与针对性基频和停顿操纵发现韵律启发式。本文的定位是补充配对析因设计,引入近似中性参考,并把分数移动与带标签判别的曲线下面积与二值判决分开,从而揭示那些被不变判决掩盖的声学反应。理解这一定位很重要,否则会把本文误读成又一个刷分模型,而它实际是一个审计工具。
为什么答对了仍然不知道模型用了什么线索?
初学者容易把答对等同于用对线索,但讽刺恰好是反例。声学研究把讽刺与基频与强度与嗓音质量和语速的变化联系起来,可这种关联不意味着韵律是稳定或充分的判决信号。原文强调自发语音中反讽的声学实现在句子与说话人之间变化很大,人类判断随话语上下文变化,当词义已使讽刺意图明显时韵律标记可能减弱。
因此 1 次正确预测不能揭示检测器用的是词与调还是二者交互。要回答这个问题,需要选择性改变词汇内容与韵律传递,再观察模型分数与讽刺判别与二值预测如何变化。CLASH 把这个问题形式化为同一句话在 4 种条件下的配对比较,用原始标签衡量变换后保留的判别,而不假设变换后人感知的讽刺保持不变。
这个不假设很关键,它避免了把变换后的人类感知变化强加给模型评估,只问模型在给定变换下的排序能力还剩多少。后续所有对比量都围绕这个思想展开,任何把分数移动直接当成绩效提升的解读都会偏离原意,这也是全文反复区分敏感性与判别力的原因。
CLASH 如何把一句话变成四种可比输入?
CLASH 的全称是受控词汇声学分离框架,做法是对每条语音生成配对干预,形成原始与词汇保留与韵律保留与近似中性 4 种条件。同一组输入被送入手工声学特征分类器与自监督学习探针与语音大模型 3 类系统,两套语料分别评估而不混合。条件之间的对比刻画词汇效应与韵律效应与交互,上下文比较与替代语音合成与时长平衡检验稳健性。
下图是方法全景,读者应先沿着从左到右的主路径理解数据如何变成诊断量,再细看中间的变换格子与右侧的相减定义,这是后文所有公式与表格的组织依据。
看图路径: 1. 先沿一至四列箭头走完数据集到干预再到三类探针最后到诊断量的主路径;2. 对照中间二乘二格确认横轴是词汇保留与去除纵轴是韵律保留与中性化;3. 核对右侧三行诊断量分别是词汇效应韵律效应与交互项的相减定义;4. 注意底部英文与中文永不混合的标注说明两语料分别评估
论文图 1。原论文 Figure 1::“Overview of CLASH. Utterances from MUStARD and CMMA undergo paired interventions to form original (O), lexical-preserving (L), prosody-preserving (P), and approximately…”。
从像素可见,全图分为四列。第一列是两个口语讽刺数据集,上为英文 MUStARD 配干得漂亮一类例子,下为中文 CMMA 配类似例子,底部注明英文与中文永不混合。第二列是 2 乘 2 干预格,横向是词汇保留与去除,纵向是韵律保留与中性化,4 个格子分别是原始与仅韵律与仅词汇与中性化,每个格子下方标注词是否保留与韵律是否保留。第三列是 3 类探针,分别为任务训练的监督分类器与自监督语音模型与语音大模型,注明相同 4 条件输入送给每一类并收集判决与内部分数。第四列是模型诊断,分别给出词汇效应与韵律效应与交互的相减定义,并说明输出是每个模型家族的依赖画像。
四个语音条件具体做了什么操作?
先沿着一个样本走完全程。假设输入是一条 16 kHz 单声道目标句语音,检测器参数固定。原始条件直接送入检测器得到连续分数。词汇保留条件的做法是压平音高与能量变化但保留时间与停顿,英文把浊音帧基频设为整句中值,中文把对数基频相对中值的偏离缩小一半以保留声调轮廓形状,非静音帧归一化到中值均方根能量。
韵律保留条件用 WORLD 再合成,把随时间变化的谱包络替换为固定载体包络,同时保留基频与非周期参数,从而破坏反映音段的频谱线索以降低可懂度。近似中性条件组合上述两类操作,但保留的时间结构与处理痕迹决定了它不是信息为空的基线。为检验词汇保留优势是否依赖 WORLD 处理,作者另用固定音色与中性播讲指令的语音合成模型,根据参考文本合成替代词汇保留条件。
词汇内容 × 韵律: 词汇内容指字词组合携带的字面语义证据,负责提供可被转写核对的讽刺含义;韵律指基频与强度等发声方式证据,负责提供语调与重音信息;CLASH 把二者做成 2 乘 2 析因,是因为只有在同一句话上分别保留与去除二者,才能把词带来的判别与调带来的判别分开,而不被说话人与句子差异混淆。
诊断对比的计算目标是条件级别的 AUROC 差异。记每条在各条件下的连续分数为逻辑回归决策值或大模型肯定与否定词符对数概率差,条件 AUROC 是对原始讽刺标签的排序能力。词汇与韵律的补充对比定义如下,原文明确给出实现为条件 AUROC 相减。
\[\Delta_{L}=A_{L}-A_{F},\quad\Delta_{P}=A_{P}-A_{F},\]交互项描述 AUROC 的非加性,原文明确说明它不是某种不一致机制的特指。
\[I=A_{O}-A_{L}-A_{P}+A_{F}.\]需要强调的是,词汇减韵律在数学上消去了中性基线,但词汇保留与韵律保留之间的非目标差异仍未受控,因此不能把该差值读成纯净的词汇因果效应,只能读成在所实现变换下各检测器保留的判别之差。
三类检测器与两种输入范围如何固定比较?
检测器比较包括手工与学习表示在相同分类器与训练协议下的对照。手工基线用开放语音特征集的 88 维功能量,提供显式韵律与频谱与嗓音质量描述子。学习基线用冻结的大规模自监督模型最后一层隐状态做时间平均池化,该对照检验干预反应是否依赖表示,而不假设任一系统选择性编码词汇或韵律。
两者都用标准化特征与正则化逻辑回归,只在原始中文训练语音上训练,三折训练集交叉验证按 AUROC 选正则强度,因此英文评估属于跨语言跨语料迁移。主要大模型是未经微调的指令模型,用贪心解码与固定提示判断说话人是否讽刺,提示要求只回答是或否。上下文感知设置在目标句输入前拼接前文对话文本,且上下文在语音条件之间保持相同。
分数敏感性 × 讽刺判别力: 分数敏感性指干预后连续分数是否移动,负责回答模型是否听到变换;讽刺判别力指移动是否按讽刺标签有序分开,常用 AUROC 衡量,负责回答移动是否有用;二者必须搭配,因为分数大幅移动而 AUROC 接近 0.5 意味着声学有反应但无标签信息,不能当作会用韵律判讽刺。
评估量除条件 AUROC 外,还包括配对分数差的 AUROC 与固定零阈值下的宏平均与正例预测率,以及箱内标准化分数敏感度。配对分数差的 AUROC 与条件 AUROC 之差是两个不同量,前者问分数变化是否携带标签信息,后者问 2 个条件下各自排序能力之差。处理敏感性检查用检测器分数区分原始与中性,取较大一侧以允许任一分数方向,这些定义共同支撑后文分数移动与判别分离的结论。
本研究训练了什么,没有训练什么?
本研究没有训练大音频语言模型,大模型部分是无微调调用,固定提示加贪心解码得到肯定与否定词符概率差作为连续分数,再按零阈值得二值判决。真正涉及参数拟合的是探针部分,手工特征与冻结自监督表示各自接正则化逻辑回归,只用原始中文训练语音训练,交叉验证选正则系数。辅助审计比较逻辑回归与线性回归与两种梯度提升树头,并检查训练与测试特征分离。
原文未报告优化器细节与学习率与更新步数等缺项,因此不能从模型名称推定实现细节,也不能把冻结参数等同于系统输出确定。时长平衡不是模型训练,而是评估加权。按下式按原始时长分五分位箱,在箱内均衡两类总贡献,所有语音条件共用同一权重计算加权 AUROC,另有十分箱分析检验分箱敏感性。
\[w_{i}=\frac{\min\!\left\{n_{b(i),0},\,n_{b(i),1}\right\}}{n_{b(i),y_{i}}},\]统计推断用 2000 次簇自助百分位置信区间,中文按会话整簇与英文按说话人整簇重采样,每次重采样保留全部配对条件与上下文设置并重算对比与权重,分箱边界固定。组内 AUROC 把正负比较限制在同一会话或同一说话人内,用于检验优势是否来自说话人与会话身份混杂。
时长平衡 × 簇自助置信区间: 时长平衡指按原始时长分箱并在箱内均衡两类权重,负责去除时长这一残留标签线索对词汇与韵律对比的污染;簇自助置信区间指按会话或说话人整簇重采样并重算对比与权重,负责保留配对结构与相关性;二者搭配才能判断词汇保留优势在控制时长与抽样相关后是否仍大于零。
复述时应说清哪部分是拟合与哪部分是调用与哪部分是评估加权与重采样,避免把无训练误述为确定性求解,这是初学者最容易混淆的地方。
数据规模与划分与指标与代码条件是什么?
实验用中文 CMMA 与英文 MUStARD 两套语料分别评估,指标方向是 AUROC 越高排序能力越强,宏平均越高二值判决越均衡,正例预测率描述偏向肯定回答的程度。比较公平性来自同一句话的配对条件与检测器参数固定与上下文在条件间相同,以及时长平衡时各条件共用权重。下表整理数据规模与标签分布,阅读时先确认主估计与跨模型公共子集是两套分离评估,不能把不同阶段的数字直接对比。
表前提出的问题是样本量与标签分布是否支持跨语料比较,公平条件是两语料永不混合且分别计算指标,指标方向是规模越大估计越稳而分布越偏则更需看 AUROC 而非准确率,这是理解后续英文时长偏差的关键。
| 语料与用途 | 主估计条数 | 公共子集条数 | 讽刺占比 | 评估方式 |
|---|---|---|---|---|
| 中文 CMMA | 3960 条 | 781 条 | 11.4% | 分别评估不混合 |
| 英文 MUStARD | 690 条 | 163 条 | 50.0% | 分别评估不混合 |
表后解释是中文主估计量大但标签稀疏,英文量小但两类均衡,因此英文的时长偏差更容易放大干预对比,未胜出项是探针在英文上的跨语料迁移本身较弱,不能把大模型的词汇优势推广为所有表示的共性。代码方面,资源状态显示代码链接当前可用,但可用不等于权重可下载或一键可运行,复现仍需按原文核对模型版本与解码设置,硬件预算原文未报告具体机时。
主结果显示了多大的词汇保留优势?
主结果按目标句大模型与未调整时长组织,测的是词汇保留与韵律保留各自条件 AUROC 之差,比较对象是同一模型在同一语料上的两种变换,指标越大越支持词汇保留下保留更多判别。下表用原文连续句覆盖关键数字,阅读时注意这是未调整值,后续时长平衡会缩小英文差距。
表前的问题是在固定检测器与配对输入下词汇保留是否系统性高于韵律保留,公平条件是同一模型同一语料内比较,指标方向是差值为正表示词汇保留领先,上下文感知下因前文文本跨条件共享而预期缩小。
| 评估设置 | 中文 CMMA 对比 | 英文 MUStARD 对比 | 方向 | 适用条件 | 指标含义 |
|---|---|---|---|---|---|
| 目标句未调整 | 0.139 | 0.299 | 均为正 | Qwen3-Omni 目标句 | 词汇减韵律 AUROC 差 |
| 上下文感知未调整 | 0.074 | 0.183 | 均为正但缩小 | 保留前文文本 | 词汇减韵律 AUROC 差 |
表后解释是未调整下英文优势明显大于中文,但这包含时长等残留线索的贡献,不能直接读成英文更依赖词汇。未胜出项是手工与自监督探针的词汇与韵律分离很小,尤其在英文上几乎无分离,且原文指出更强的原始语音性能不持续对应更大的韵律保留优势。另一反例是探针的韵律增量多为负值,说明相对词汇保留优势不意味着绝对判别强。重提结果时新增的对照是上下文感知下优势缩小,提示前文文本提供了跨条件共享的证据。
时长偏差如何夸大英文对比,平衡后还剩多少?
因为干预保留时间结构,作者检验时长是否为残留标签线索。英文中时长本身就有判别力,讽刺句平均更长,而模型在不可懂语音上的分数与时长负相关,较长的讽刺句在去除词汇后可能得分更低,导致韵律与中性条件出现低于随机的排序。下表整理时长事实与平衡前后变化,表前问题是时长在多大程度上污染了干预对比。
公平条件是各条件共用同一箱内权重并重算加权 AUROC,指标方向是平衡后中性基线上升而词汇减韵律差值应更可比,这决定了不能只看差值缩小就否定方向稳健性。
| 检查项 | 英文 MUStARD 数值 | 中文 CMMA 数值 | 平衡后变化 | 含义 | 适用模型 |
|---|---|---|---|---|---|
| 时长本身判别与均值 | 0.660,5.77 s 与 4.45 s | 原文未给同口径 | 英文基线受影响大 | 时长是残留线索 | 通用检查 |
| 中性基线与词汇减韵律 | 0.343 到 0.447,0.299 到 0.135 | 0.139 到 0.148 | 英文缩小但仍为正 | 优势方向稳健 | 目标句大模型 |
表后解释是平衡后英文中性条件 AUROC 明显上升,词汇减韵律从高位回落但方向仍为正,中文变化较小且略有上升。代价是平衡依赖分箱选择,原文用十分箱做敏感性分析,复现时应保留分箱边界固定的做法。替代词汇合成进一步支持目标句大模型的对比在两种词汇保留实现下同向,但二进制判决不同,中文合成使正例预测率上升而宏平均下降,且该稳健性是模型特定的。
词汇保留条件 × 韵律保留条件: 词汇保留条件通过压平基频与能量变化保留可懂度,负责留下词而弱化调;韵律保留条件通过固定谱包络保留基频参数,负责留下调而破坏可懂度;把二者与近似中性条件配对比较,才能得到词汇效应与韵律效应各自相对中性基线的判别增量。
分数动了为何判别不动,上下文效应稳定吗?
配对分数诊断区分分数敏感与标签判别与二值判决 3 个层次。下表先看声学干预是否只移动分数而不改进排序,表前问题是韵律保留相对中性是否带来可用判别,公平条件是同一模型同一语料内配对比较,指标方向是配对差 AUROC 越接近 0.5 越说明移动无标签信息。
| 模型与语料 | 分数上升占比 | 配对差 AUROC | 二值判决 | 结论 | 层次含义 |
|---|---|---|---|---|---|
| 目标句大模型中文 | 74.8% | 0.566 | 均为非讽刺 | 有移动弱判别 | 敏感不等于判别 |
| 目标句大模型英文 | 82.5% | 0.524 | 均为非讽刺 | 有移动弱判别 | 敏感不等于判别 |
表后解释是多数句子韵律保留相对中性提高了对数几率,但两条件都只给出非讽刺判决,且配对差 AUROC 仅略高于随机,说明声学响应不等于有效韵律利用。学习探针也有类似分离,中文均值移动较大而差值 AUROC 接近随机。上下文比较进一步显示目标句的标准化韵律减中性移动大于上下文感知,但这不意味着更大韵律判别。
下图导读帮助区分两种纵轴,左图是标准化分数移动之差,右图是韵律增量在目标句与上下文之间的 AUROC 对比之差,两轴度量不同,不能混读,这是初学者最容易误读的地方。
看图路径: 1. 先看左图横轴是否为目标句减上下文的标准分数移动并确认零线位置;2. 再看右图三行未调整时长平衡与同身份内估计的点与区间是否过零;3. 区分左右两图横轴量纲不同不能直接比较高低
论文图 2。原论文 Figure 2::“Qwen3-Omni context comparison. Left: target-only minus context-aware standardised P-F score shifts.”。
从像素可见,左图只有两个点区间,中文点明显在零右侧约 0.3 附近,英文点区间更宽且横跨较大范围,虚线零线在最左。右图有三行,分别为未调整与时长平衡与同身份内,每行有两个点区间,蓝色为中文红色为英文,多数区间横跨零线。解释是目标句确有更大分数移动,但右图同身份内估计区间包含零,中文上下文效应的显著性在限制到同一会话后消失,英文同说话人估计接近零。因此原文判断为缺乏一致补偿效应的充分证据。下表给出原文报告的上下文与身份内数字。
| 对比口径 | 中文 CMMA | 英文 MUStARD | 区间是否过零 | 含义 | 适用条件 |
|---|---|---|---|---|---|
| 上下文效应与同身份 | 0.069 到 0.067 到 0.037 | -0.012 | 同身份过零 | 不支持一致补偿 | Qwen3-Omni |
| 原始减词汇保留 | 0.046 到 0.006 | 0.106 与 0.090 | 身份内仍有英文剩余 | 语料相关 | 同会话说话人内 |
表后需说明未胜出项是同身份内原始减词汇保留在中文从 0.046 降到 0.006,而英文仍保持 0.090 左右,交互项在英文为正而在中文为负,表明词汇保留优势与语料相关的上下文和联合效应共存,但语言与语料同时变化,不能分离出文化机制。
哪些边界会限制归因结论的推广?
原文明确列出 3 类限制。第一是不完美线索分离,词汇保留仍保留节奏线索,韵律保留与中性条件仍有处理痕迹,变换质量检查只支持可接受而不建立完美分离。第二是探针迁移,手工与学习探针只在原始中文上训练,训练测试域分类可达较高 AUROC 且原始与中性可被分数分开,这种分离可能来自目标线索变化也可能来自处理伪影,无法识别相对贡献。
因此探针画像只刻画所测表示与读出与迁移设置而非模型家族通性。第三是语料特定结构,语言与语料同时变化,上下文与交互的语料差异不能分离出文化机制。此外,原文用词是报告与显示与支持有限解释,对未验证推测保留可能与待验证的表述。
自监督语音探针 × 大音频语言模型: 自监督语音探针指冻结语音表示再接逻辑回归的做法,负责检验同一分类器下表示不同是否改变干预反应;大音频语言模型指直接用语音指令判断是否讽刺的做法,负责检验端到端系统是否依赖词汇;二者搭配的原因是探针的跨语料迁移可能掩盖归因,而大模型保留更强词汇判别,需要同协议对照才能看清边界。
缺失证据不是技术错误,例如未测量误判率与延迟与成本时不应承诺这些量改善。总体趋势不等于每组每步成立,替代合成的稳健性被明确限定为模型特定,这是复述时必须保留的限定语,否则会把特定模型的结论推广成通用规律。
要复现这套审计先做什么,需要哪些信息条件?
复现的第一步是按语料分别准备 16 kHz 单声道目标句与前文文本,保持同一句话的 4 条件配对与同一标签。第二步是实现词汇保留的基频与能量压平,注意英文与中文的不同处理,中文需保留声调轮廓形状只缩小偏离,韵律保留用固定载体谱包络再合成并保留基频与非周期参数,中性条件组合两者,另用固定音色中性播讲合成实现替代词汇保留。
第三步是固定检测器参数评估,探针只在原始中文上训练并用交叉验证选正则,大模型用固定提示与贪心解码取肯定与否定词符概率差,上下文在条件间保持相同。第四步是按时长分箱计算共用权重并重算加权 AUROC,再按会话或说话人整簇做 2000 次自助重算对比与权重,分箱边界固定。
关键超参数与信息条件包括分箱数与权重定义与自助次数与簇定义与提示原文与阈值 0,这些在原文方法节已给出,缺的是优化器细节与硬件预算,复现探针时需自行记录环境。代码链接本次显示当前可用,但应区分代码开源与权重下载与系统可运行三件事,先跑通 4 条件生成与分数提取,再谈诊断量。常见误解是把分数移动当成绩效提升,复现时必须同时输出移动比例与配对差 AUROC 与二值判决 3 层结果。
何时值得尝试这套方法,还需补哪项验证?
当你的语音分类器在加入音频后总体分数上涨,但你怀疑上涨来自文本泄漏与时长或说话人身份时,值得尝试这套配对反事实审计。它用最小代价回答 3 个问题:变换是否被听到与听到是否有标签信息与信息是否改变判决。对口语讽刺这类意图与字面相反的任务,这种分层尤其重要,因为韵律启发式可能只移动分数而不改进排序。
本文的直接报告是目标句大模型的词汇保留优势在时长平衡与替代合成后仍为正且区间高于零,有限解释是声学敏感不等于讽刺判别,未验证推测是跨语言差异背后的机制。还需补的验证包括更干净的韵律保留与中性基线与同一说话人同文本的多实现合成,以及人类感知在变换后是否仍为讽刺的独立标注,否则不能把模型排序变化等同于人类线索使用。
部署前还需补误判率与延迟与成本测量,因为原文未测量这些量。收束一句话是,音频增益 alone 不能证明用了韵律,只有在配对变换与时长平衡与身份内比较都成立时,词汇或韵律的判别主张才更可信,这正是 CLASH 留给后来者的使用条件。
📎 论文与评分元数据
排名:前25% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
