标签:#音频问答 | #测试时自适应 | #强化学习 | #音频大模型
评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
👥 作者与机构
- Jiaheng Dong:机构信息未在 arXiv HTML 中可靠披露
- Xiaofeng Yu:机构信息未在 arXiv HTML 中可靠披露
- Jean Honorio:机构信息未在 arXiv HTML 中可靠披露
- Abhirup Ghosh:机构信息未在 arXiv HTML 中可靠披露
- Hong Jia:机构信息未在 arXiv HTML 中可靠披露
- Ting Dang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作处理音频问答(Audio Question Answering,AQA),输入为音频片段 \(a\)、自然语言问题 \(q\) 与 \(J\) 个候选项,输出为解析答案与推理轨迹,难点在于大音频语言模型(Large Audio-Language Model,LALM)易绕开声学证据而依赖语言先验作答。方法链分为三步:先对每条采样轨迹做完整音频条件与文本不可见音频遮蔽条件两次教师强制(teacher-forcing)前向,以平均对数概率差量化轨迹级声学 grounded 程度 \(g_i\);再对比支持多数伪标签 \(m\) 的轨迹与异议轨迹的平均得分差得到声学 grounded 边际 \(s\),并在小批量内标准化后映射为可靠性权重 \(r\);最后将该权重乘以投票边际 \(v(\hat{o}_i)-1/J\) 形成感知 grounded 优势 \(A_i\) 并代入分组相对策略优化(Group Relative Policy Optimization,GRPO)更新。与标准无标签测试时强化学习(Test-Time Reinforcement Learning,TTRL)只奖励多数一致不同,该机制在声学不支持多数票时压低更新幅度,从而保留低概率正确路径。在 MMAR 上 Qwen2.5-Omni-7B 的 Avg@8 相对基线提升 4.6 个点,在 MMAU 上提升 4.9 个点,显示了声学 grounded 对期望准确率的增益。该结论目前仅在选择题推理与同系模型上验证,对开放式问答与跨架构迁移尚未证明。原文仅说明使用 1 张 H100 与 1 张 A100 做 LoRA 更新,未披露训练时长与推理延迟等部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
本文的输入是一个三元组提示,包含一段声音、一个自然语言问题和若干候选答案选项,模型需要在听完声音后生成推理轨迹并解析出最终选项。目标读者是刚进入语音音乐音频方向的研究生,解读目标是让你能复述从如何度量声音被使用,到如何用该度量校准无标签更新,再到实验如何证明改进来自声音利用而非单纯猜对。
必须保留的信息包括遮蔽注意力如何构造对照条件、层级依赖如何聚合到任务级、轨迹级分数如何从两遍前向得到、边际如何比较多数与少数派、优势如何用可靠性缩放投票边际,以及训练只更新低秩适配器而不动主干。输出是 1 篇按学习依赖展开的中文技术解读,所有数字只采用原文连续句子中的写法,不引入外部评价。后续先讲任务与相关路线,再走一遍方法全景与组件计算,然后交代训练与评测条件,最后用结果与反证收束到可复现动作。
已有路线各自解决了什么,还缺哪一块?
大音频语言模型这类系统通常把专用音频编码器抽出的声学表示经投影送入解码器大语言模型,再做指令跟随与回答生成,代表系统包括文中提到的问答与推理系列模型。第一条路线是思维链监督与有标签强化学习,例如构造大规模思维链语料后微调,或用课程式组相对策略优化、规则奖励优化答案正确性与格式,这条路线报告了准确率提升,但奖励只看最终答案是否正确,不检查正确轨迹是否真正用了声音证据。
第二条路线是测试时强化学习,它在无真值测试样本上采样多条轨迹,用多数投票生成伪标签再做组相对策略优化,后续变体加入熵感知探索或少数派保留机制,视觉侧也有用频率与多样性构造奖励的扩展。这条路线解决了无标签可用的问题,但更新方向主要来自输出一致性,当多条轨迹共享语言偏见时,一致性会把捷径当成正确信号。
第三条路线是对多模态内部机制的审视,视觉语言模型研究发现文本主干占比过大,跨模态对齐只优化回答正确而非感知保真,音频模型继承了冻结或轻微调谐编码器加预训练大语言模型的结构与配方,因此同样可能存在感知利用不足。本文的缺口正是第三条路线在音频推理中尚未量化:声音证据在推理各层如何演化、更强的接地是否预测更好表现、去掉声音是否真的导致下降。
教学例子是把考试比作开卷与闭卷对比,开卷能查书不代表一定查了书,要通过遮住书前后成绩与过程的变化才能判断书是否被真正使用,本文后面 3 组分析就是做这件事。
三个研究问题如何对应三次对照操作?
论文把大问题拆成 3 个可操作的研究问题。第一个问题问声音证据在主干各层如何演化,对应操作是逐层比较完整输入与遮蔽声音注意力两种条件下的文本隐表示差异。第二个问题问更强的感知接地是否预测更好表现,对应操作是在任务级计算峰值依赖与完整声音下准确率的皮尔逊相关。第 3 个问题问融合的声音证据是否因果地贡献于表现,对应操作是比较完整声音准确率与遮蔽声音准确率之差,并看该差值是否随依赖增强而变大。
3 个问题层层递进,第一个刻画位置,第二个建立关联,第 3 个检验必要性。需要注意相关性不等于因果,第二个问题的正相关只能说依赖强的任务往往分高,第 3 个问题的遮蔽下降更大才支持声音被下游推理实际使用。原文还说明为避免小样本不稳定,在计算相关时排除了 3 个样本极少的任务。
为理解整体框架,先看方法总览图导读,该图左侧给出两条通路的构造,右上给出 3 组分析的示意,右下给出测试时更新的回路,读图时应先分清哪部分是分析哪部分是优化。
下面导读图二的阅读顺序与条件:该图包含三 B 与七 B 在两个基准上的四块层曲线,每条曲线是 1 个任务,横轴是层序号,纵轴是感知依赖,红色虚线标出峰值层,观察时先看整体先升后降的形状,再看峰值位置是否随模型变化。
看图路径: 1. 先确认四个子图横轴为层数纵轴为感知依赖;2. 再看每子图红色虚线标出的峰值层位置;3. 比较三 B 与七 B 在峰前上升与峰后下降的形状是否一致
论文图 2。原论文 Figure 2::“Layer-wise perceptual reliance across MMAR and MMAU for Qwen2.5-Omni-3B and Qwen2.5-Omni-7B.”。
图二显示的像素内容支持原文的判断:四块子图都呈现早期逐层上升、中层达到最大、晚期逐渐下降的形态,三 B 的峰在 23 层附近,七 B 的峰在 18 层附近,不同任务曲线高低不同但形状一致。这说明跨模态搬运主要发生在早期到中期,晚期更多是在已融合表示上做推理与答案组织。论文据此把峰值层定义为感知与推理的强调分界,并用该层峰值作为任务级声学依赖的代表值。教学上可以这样记:先把声音搬进来,再关起门来推理,峰就是关门的时刻。
方法全景:一个样本如何走完输入到更新?
沿一个样本走一遍有助于固定指代。输入是声音、问题与候选选项,策略模型采样出多条推理轨迹,每条轨迹解析出一个选项或解析失败。接着用多数投票得到伪标签作为正确性方向。同时对每条已生成轨迹做 2 次教师强制前向,1 次允许文本 attending 声音,1 次阻断该注意力,逐 token 计算对数概率差并平均得到轨迹级接地分数。然后比较支持多数票轨迹的平均分数与反对轨迹的平均分数之差得到声学接地边际,再在小批量内标准化并映射到有界可靠性权重。
最后用该权重缩放投票边际得到优势,代入带裁剪与散度惩罚的组相对策略优化目标更新低秩适配器。解析失败轨迹优势置零,优势全接近零的组直接丢弃,负优势再乘以阻尼系数以减缓对少数派的压制。
下面是总览图的导读,该图左侧用两种颜色区分声音与文本 token 并用箭头区分允许与遮蔽的注意力边,右侧上方 3 个面板分别对应依赖曲线与两组散点关系,右侧下方展示从采样到投票再到奖励加权的闭环,读图时先沿主路径再看回路。
看图路径: 1. 先看左侧原始与遮蔽两条解码通路的注意力边差异;2. 再看右上三个小面板如何从依赖曲线走向散点关系;3. 最后沿右下策略模型到多数投票再到奖励计算的回路走一遍
论文图 1。原论文 Figure 1::“Framework Overview. We compare the original and perturbed conditions to compute the instance-level layerwise perceptual reliance.”。
总览图解释如下:左侧原始条件保留跨模态边,扰动条件在每层切断文本对声音的直接注意力,由此逐层算出依赖。右上第一面板把各样本依赖平均成任务曲线并标出峰值层,第二面板把峰值依赖与完整准确率做散点,第三面板把峰值依赖与遮蔽后下降做散点。右下先对每条轨迹算完整与遮蔽两行概率再得接地分数,接着按多数与少数分组求边际,最后用边际调节奖励计算并回传做策略优化。该图把分析与优化放在同一框架下,分析回答声音是否重要,优化回答无标签时如何只放大有声音支撑的更新。
依赖与分数如何计算,符号各指什么?
先讲层级感知依赖。记声音 token 集合与文本 token 集合,对文本中属于问题与选项的子集求平均隐表示,分别在完整条件与遮蔽条件下得到两个向量,二者余弦距离即单样本单层依赖,越大表示该层受声音影响越强。对任务内所有样本平均即任务级依赖。峰值层是使任务级依赖最大的层序号,峰值即该任务声学依赖的代表值。原文用该量做后续相关分析。
\[R_{k}^{(l)}=\frac{1}{N_{k}}\sum_{n=1}^{N_{k}}r_{k,n}^{(l)},\]接着讲因果贡献的度量。对每个任务比较完整声音准确率与遮蔽声音准确率之差,差越大表示去掉声音后掉分越多,声音越必要。该量与峰值依赖的正相关支持声音被下游使用的判断。
\[\Delta_{k}=\mathrm{Acc}_{k}^{\mathrm{full}}-\mathrm{Acc}_{k}^{\mathrm{mask}},\]再讲轨迹级接地分数。对第 i 条轨迹的第 t 个生成 token,计算完整条件下对数概率减去遮蔽条件下对数概率,正值表示该 token 更需要声音而非仅靠语言先验。对轨迹内所有 token 取平均即该轨迹分数,越大表示整条推理链更依赖声音。
\[g_{i}=\frac{1}{T_{i}}\sum_{t=1}^{T_{i}}\Delta_{i,t}.\]然后讲声学接地边际。把支持多数票轨迹的平均分数减去反对且可解析轨迹的平均分数,正值大表示多数票比少数派更接地,伪标签获得感知可信度;接近零表示接地无法区分两组,伪标签缺乏感知支持。
\[s=\underbrace{\operatorname{mean}_{\,i:\,\hat{o}_{i}=m}g_{i}}_{\text{majority}}-\underbrace{\operatorname{mean}_{\,i:\,\hat{o}_{i}\notin\{m,\varnothing\}}g_{i}}_{\text{dissent}}.\]最后讲感知 grounded 优势。记支持某答案的轨迹比例为投票份额,减去均匀份额得到投票边际,乘以可靠性权重即优势。当边际大且可靠性接近上界时更新最强,当可靠性接近下界时更新被压到下限但不完全丢弃,因为下限大于零。全员一致时仍保留正信号。解析失败置零,负优势再阻尼。
\[A_{i}=r\cdot\left(v(\hat{o}_{i})-\frac{1}{J}\right),\]感知依赖 × 任务准确率: 感知依赖负责度量去掉声音后文本表示变化了多少,任务准确率负责度量最终选项选对了多少,二者搭配的原因是只看准确率无法区分靠声音做对还是靠语言猜对,组合意义是用依赖强度解释准确率来源并为后续优化指明应放大的分量。
多数票伪标签 × 声学接地边际: 多数票伪标签负责在无真值时给出正确性方向,声学接地边际负责判断支持多数票的轨迹是否比反对轨迹更依赖声音,二者搭配的原因是多数票可能只是共享语言偏见,组合意义是只有当声音证据支持多数票时才放大更新,否则压低更新。
轨迹级接地分数 × 优势: 轨迹级接地分数负责量化单条推理链对声音的依赖程度,优势负责决定策略梯度中每条轨迹被增强还是抑制的幅度和方向,二者搭配的原因是不能直接把高接地分数当奖励以免强化接地但答错的轨迹,组合意义是先按多数与少数分组比较接地分数得到可靠性权重,再用该权重缩放投票边际形成优势。
上述公式共同说明原文的实现选择:依赖用余弦距离而非准确率差以定位层,分数用对数概率差而非隐状态距离以直接绑定生成过程,边际用分组均值差而非单条分数以避免强化接地但答错的轨迹,优势用固定均匀基线而非组均值以保留全员一致时的学习信号。
测试时更新如何组织,哪些参数在动?
本节对应机械契约中的训练节,但本文没有传统有标签预训练,只有测试时更新,因此先明确没有训练的阶段,再讲实际发生的计算。没有使用真值标签做监督,没有更新音频编码器与大语言模型主干,冻结原始参数,只优化插入线性投影层的低秩适配器,秩为 8,缩放为十六,无丢弃。优化器在提示池上做单轮遍历,每提示采样 8 条轨迹,采样温度为 1.0,核采样为 0.99,每步提示批量为八即每步 64 条轨迹。
学习率为 3 乘 10 的负 6 次方并用常数调度,散度惩罚系数为 0.05 并用低方差估计器。可靠性界为 0.2 到 0.8,负优势阻尼为 0.4,运行尺度取每小批量支撑 spread 的累积平均,小批量标准差用无偏估计。组内优势全接近零则丢弃该组,训练用全局种子,评测种子由全局种子四十二与提示标识哈希派生。计算路径上梯度经由裁剪替代目标回传到适配器,冻结主干不产生更新,伪标签与可靠性权重在每小批量内即时构造,不跨步复用。
原文未报告适配器之外的投影或编码器是否参与梯度,缺项如是即指出未报告,不从模型名称推定。
测试时强化学习 × 组相对策略优化: 测试时强化学习负责规定学习时机与监督来源即直接在无标签测试提示上自举更新,组相对策略优化负责规定组内比较与裁剪优化形式,二者搭配的原因是无真值时只能用组内投票相对优劣代替绝对奖励,组合意义是在单轮测试数据上用组内投票边际乘以感知可靠性来做稳定策略更新。
下表把原文连续句子中实际出现的训练与方法超参数整理成可核对的配置表,阅读时先看采样与批量决定每步轨迹数,再看优化与正则决定步长与约束,最后看感知权重界与阻尼决定更新的上下限。
| 环节 | 参数名 | 原文取值 | 批量含义 | 适用条件 |
|---|---|---|---|---|
| 采样 | 每提示轨迹数与温度核采样 | 8,1.0,0.99 | 每步 64 条轨迹 | 每个提示采样 8 条 |
| 优化 | 学习率与散度系数 | 3×10−6,0.05 | 常数调度与低方差估计 | 单轮遍历提示池 |
| 感知加权 | 可靠性界与负优势阻尼 | 0.2,0.8,0.4 | 下限不丢弃,上限放大 | 小批量内标准化 |
表后需要说明代价与边界:每条轨迹需 2 次教师强制前向以得到完整与遮蔽概率,额外计算随轨迹数线性增长;丢弃全零优势组可省去不可靠更新但也减少步数;负优势阻尼保留少数派多样性,但阻尼过大会减慢纠错。原文未测量延迟与显存峰值,因此不能承诺推理更快,只能说更新更倚重有声音支撑的方向。
在什么数据与协议上测,用哪些指标?
数据为两个广泛使用的多选音频推理基准的测试集。第一基准包含 1000 条样本,覆盖语音、通用音频、音乐与混合音频,按 16 个子类别与 4 个推理层级组织,分别为信号、感知、语义与文化。第二基准取测试迷你划分的 1000 条样本,覆盖语音、声音与音乐,按 27 个子类别组织。2 基准的提示都用于无标签测试时更新,真值仅保留做评测。
模型为两个大音频语言模型的三 B 与七 B 版本,基线包括不做测试时更新的原始模型,以及共享同样组相对策略优化但用二值多数票奖励且无接地加权的标准测试时强化学习。评测含 4 个互补指标:贪心为单次确定性预测,采样 8 条时的多数投票正确性与 8 条平均正确性,以及不同采样预算下至少一条正确的概率。指标方向均为越高越好。硬件为一块 H100 与一块 A100,适配器插入线性投影层。
原文明确提示用于更新时不访问真值答案,这是复现时必须保持的信息条件,否则会把无标签问题误做成有监督微调。下表把可核对的配置信息汇总,数字与单位保留原文写法,裸值不擅自加百分号。
| 环节 | 参数名 | 原文取值 | 批量含义 | 适用条件 |
|---|---|---|---|---|
| 采样 | 每提示轨迹数与温度核采样 | 8,1.0,0.99 | 每步 64 条轨迹 | 每个提示采样 8 条 |
| 优化 | 学习率与散度系数 | 3×10−6,0.05 | 常数调度与低方差估计 | 单轮遍历提示池 |
| 感知加权 | 可靠性界与负优势阻尼 | 0.2,0.8,0.4 | 下限不丢弃,上限放大 | 小批量内标准化 |
表后补充协议细节:贪心反映单发确定性能力,平均正确性反映每条轨迹的期望正确率,多数投票反映集中到主答案的能力,至少一条正确反映不同预算下找到正确解的能力。四者分开才能解释为何本文方法提升前两者多而多数投票提升小。原文未报告人工评价,因此不能把自动多选准确率当成人评偏好。
主结果支持什么判断,有何反例?
先看散点关系的导读:该图左右分别为三 B 与七 B 在第一基准上的任务级散点,横轴为峰值感知依赖,纵轴为完整声音下准确率,红色直线为拟合趋势,右下图例给出相关系数,读图时先看趋势向上,再看偏离点。
看图路径: 1. 先确认横轴为感知依赖纵轴为准确率;2. 再读右下图例中的相关系数与显著性数值;3. 观察左上偏离拟合线的任务点并记住其名称
论文图 3。原论文 Figure 3::“Relationship between perceptual reliance and accuracy at task-level on MMAR for Qwen2.5-Omni-3B and Qwen2.5-Omni-7B.”。
图三的像素内容显示 2 模型都呈正向趋势,三 B 相关为 0.524,七 B 为 0.505,显著性在 0.1 水平。依赖更强的任务往往准确率更高,但个别任务如环境感知与内容分析偏离拟合线,说明依赖不是唯一决定因素,语言难度与任务设计同样起作用。原文把该结果表述为关联而非因果,复述时应保留支持而非证明的措辞。
再看采样预算图的导读:该图左右分别为 2 基准上七 B 的柱状图,横轴为采样数从一到八,纵轴为准确率百分比,同组三根柱子分别对应原始模型、标准测试时强化学习与本文方法,读图时重点比较小预算与大预算两端。
看图路径: 1. 先确认横轴为采样预算而纵轴为准确率百分比;2. 比较同一取值下蓝色绿色红色三根柱子的高低顺序;3. 重点看取值为一和小取值时红色柱子的领先幅度
论文图 5。原论文 Figure 5::“Pass@k (k = 1…8) comparison on MMAR and MMAU for the Qwen-Omni-2.5-7B model.”。
图五的像素内容显示本文方法在几乎所有取值下最高,且在取值为一和小取值时领先更明显;标准方法在大取值时有时低于原始模型。本文解释是困难样本的正确路径本是低概率,错误多数票会压制这些稀有正确路径形成自强化失败,而感知加权对缺乏声音支撑的更新打折,从而保留低概率正确轨迹。该解释有机制支持但未直接测量每条稀有路径的保留率,复述时应标为支持性解释。
下表为主结果的增益汇总,只使用原文连续句子中实际出现的数字,不把表格裸值另行拼凑,阅读时先看基准与指标,再看增益幅度与适用模型。
| 基准场景 | 指标含义 | 基线对照 | 感知方法增益 | 方法归属 |
|---|---|---|---|---|
| 第一基准整体 | 推理准确率 | 原始模型 | 4.6 points | 感知 grounded 更新 |
| 第二基准整体 | 推理准确率 | 原始模型 | 4.9 points | 感知 grounded 更新 |
| 第一基准七 B | 平均与贪心之差 | 原始模型 | 4.6 points 与 2.8 points | 感知 grounded 更新拓宽正确轨迹 |
| 第二基准七 B | 平均正确性 | 原始模型 | 4.9 over Base | 大模型潜在感知能力被解锁 |
表后解释主要收益与具体代价:收益是贪心与平均正确性一致提升,且平均提升常大于贪心提升,说明更多轨迹能到达正确答案而非只 sharpen 最可能预测;代价是多数投票提升小甚至与基线相当,因为优化目标是让每条轨迹更接地而非让概率集中到单一主答案。未胜出项必须指出:部分多数投票指标上本文方法未超过基线或标准方法,这与无标签下不显式最大化多数一致性的设计一致,不能解读为方法失败,而是目标不同导致的分布更分散。
去掉声音会掉多少,更新改了哪些层?
因果检验把完整准确率减去遮蔽准确率,差越大表示声音越必要。原文报告七 B 的相关为 0.588,三 B 为 0.458,方向一致但三 B 显著性较弱。这支持依赖强的任务在去掉声音后下降更大的判断。层变化分析比较更新后相对原始模型的逐层依赖差,标准方法从较早层开始有温和正移,而本文方法在靠输出端的晚期层产生更大增益,早期层变化小。原文解释是奖励梯度从输出回传时对近输出层影响最强,向早期衰减,且早期表示多由编码器与预训练决定,测试时奖励难以重塑最初的跨模态搬运。该解释区分了直接报告的曲线差异与待验证的成因推测。
早期跨模态融合 × 晚期推理利用: 早期跨模态融合负责把声音表征搬运进文本 token 的隐表示,晚期推理利用负责在已融合表示上组织多步推理并形成答案,二者搭配的原因是论文发现依赖曲线先升后降存在峰值分界,组合意义是解释为何感知 grounded 更新主要改变靠输出端的层而难以重塑编码器决定的早期搬运。
下表把两组相关的原文数字整理成可核对的对照,阅读时先看关联对象是准确率还是下降值,再看模型尺度与显著性。
| 分析对象 | 横轴 | 纵轴 | 相关取值 | 模型尺度 |
|---|---|---|---|---|
| 接地与表现关联 | 感知依赖 | 任务准确率 | r=0.524,r=0.505 | 三 B 与七 B |
| 接地与因果下降关联 | 感知依赖 | 准确率下降 | r=0.588,r=0.458 | 七 B 与三 B |
表后必须讲反证与边界:三 B 在下降关联上显著性弱,说明小模型上声音利用的因果证据不如大模型稳;晚期层增益大不等于早期瓶颈被解决,原文明确提出未来需协同更强编码器或对齐来处理早期搬运。不同指标差值不能混放,相关系数与准确率增益是不同量纲,不能直接比较大小。
哪些结论不能下,缺了哪些验证?
第一,相关性不是因果,峰值依赖与准确率的正相关只能说二者同向,不能说提高依赖必然提高准确率,因果部分依赖遮蔽干预,但遮蔽同时改变了注意力分布,不能完全排除分布外效应的影响。第二,接地分数只从生成的思维链 token 计算,未纳入隐表示更直接的接地信号,原文在结论中明确列为当前局限,未来可引入隐状态提供更丰富信号。
第三,多数投票在部分设置下未胜出,说明方法不适合以集中单答案为首要目标的场景,若部署要求高度一致的单一输出,需要另行校准。第四,原文未测量误判率、延迟、显存与输出帧率,不能承诺这些量得到改善;训练资源只报告了显卡类型与单轮遍历,未报告总时长与峰值占用。第五,资源状态证据为无绑定可用资源,因此不得声称代码模型或数据已公开,复现应以论文文字与公式为准。上述缺失不是技术错误,而是在复述与复现时必须保留的边界。
要复现应先做什么,先跑通哪条链路?
先跑通分析链路再跑更新链路。分析链路的最小动作是实现文本对声音的注意力遮蔽,即在注意力分数上对文本行声音列置负无穷再做归一化,分别在完整与遮蔽条件下抽取问题与选项 token 的平均隐表示并算余弦距离,逐层扫描找到峰值层。
更新链路的最小动作是每提示采样 8 条轨迹并解析选项,多数投票得伪标签,对每条轨迹做 2 次教师强制前向得逐 token 对数概率差并平均,按多数与少数分组求边际,在小批量内标准化并裁剪到 0.2 到 0.8,再乘以投票边际得优势,解析失败置零,全零组丢弃,负优势乘 0.4。优化只更新秩 8 缩放十六的低秩适配器,学习率 3 乘 10 的负 6 次方,散度系数 0.05,单轮遍历。
评测时固定贪心、8 条平均、8 条多数与不同预算下至少一条正确的四指标,评测种子由四十二与提示标识哈希派生以保证可比。若只能做一项验证,建议先复现遮蔽后下降与依赖的正相关,因为它是感知 grounded 更新的立论基础。
何时值得尝试这种无标签更新?
当任务确需听清细节而模型常靠语言猜测时值得尝试,例如需要分辨说话人、情绪意图、环境事件与音乐结构的推理题,且手头只有无标签测试提示而无法承担标注时。本文方法的价值在于把一致性信号换成有声音支撑的一致性,避免把共享偏见当成正确。若任务本身可仅靠题面文字答对,或部署要求多数投票高度集中,则收益可能有限,甚至出现平均正确性上升而多数投票持平的现象。操作上应先用遮蔽对照确认声音确有因果贡献,再开测试时更新。
若遮蔽后几乎不掉分,说明瓶颈不在感知,不必强行做感知加权。复现时保留原文超参数与信息条件,区分适配器可运行与主干冻结,不从模型名称推定编码器实现。最终判断保留原文措辞:感知接地是值得优化的目标,本文方法在 2 模型 2 基准上一致改善贪心与期望表现,尤其在有限采样预算下更早找到正确解,但早期感知搬运仍是未解决的瓶颈。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
