英文题目:What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability
标签:#音频字幕生成 | #时频分析 | #可解释性 | #音频大模型
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Lucia Cascone:机构信息未在 arXiv HTML 中可靠披露
- Valeria Fraenza:机构信息未在 arXiv HTML 中可靠披露
- Michele Nappi:机构信息未在 arXiv HTML 中可靠披露
- Fabio Narducci:机构信息未在 arXiv HTML 中可靠披露
- Benedetto Simone:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频多模态大模型以波形与提示为输入生成开放词汇字幕,需为每个内容词元指出时频声学支撑,难点在于多声源时间重叠而频谱分离且证据分散在时频平面。STAG先将多模态预填充末层音频位置隐状态经冻结语言模型头投影到目标词元得分,经截断得到时间轮廓。接着对全长波形做梅尔间隔频带遮挡,在教师强制下测量目标词元概率下降得到频谱轮廓。最后将时间与频谱轮廓外积融合,经高斯平滑与跨词元共享归一化形成词元级时频图,并按事件取最大聚合。与仅给出时间维相关的梯度与注意力基线不同,STAG显式恢复频率支撑并保持词元间相对强度可比,使重叠事件可分。在AudioGrounding基准评测下,Qwen2.5-Omni-3B的指标E为41.97,高于Omni-7B的指标E 41.17。该结论适用边界受限于时间边界评测与可匹配生成事件,对不可分时频交互与未标注频率定位尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,什么信息必须保留?
这篇论文研究的对象是已经能说话的音频多模态大模型。输入是一段波形加上一句提示,论文统一使用英文提示要求模型写一句声音描述。输出是一句自由生成的英文描述,其中包含多个词元。初学者容易把流利等同于听见,但论文开场就区分了两种信息:语言先验可以让句子通顺,只有声学证据才能说明某个词真的来自音频。举例来说,模型写出婴儿哭声,可能是真的在对应时间听到了哭声的谐波结构,也可能是看到哭声常与卧室场景共现而猜出来的。
因此任务被定义为词级谱时间接地。对每个生成的词,产生一个非负相关图,横轴是编码后音频位置代表的时间,纵轴是频率带。目标是让内容词的图落在真实事件的时频支持上,同时让功能词的图保持微弱。必须保留的信息有 3 类:时间顺序不能打乱,因为编码位置保持时序;频率划分必须覆盖整个奈奎斯特范围并可重放。
同一句子内不同词的相对强弱必须可比,否则无法区分实词与虚词。论文把这种解释称为事后解释,即不改模型参数、不重训练,只在冻结模型上做归因与扰动。
学习这篇论文之前,需要先接受一个限制:现有 4 个基准只有时间起止标注,没有频率真值。所以频率定位只能定性看,定量评测必须把时频图投影到时间轴再与标注比较。这个限制贯穿全文,也是理解后文投影公式与反事实实验的关键。
同输入同目标的已有路线差在哪里?
在音频可解释性里,主流路线是为判别模型解释固定类别分数,例如判断一段录音属于狗叫还是警笛。这类方法输入是音频,输出是类别,监督是类别标签,运行阶段是分类后归因。它们不处理自回归生成的词序列,也就不回答每个词各自由哪段声音支持。论文把这类方法归为通用归因基线,包括梯度类的梯度加权类激活映射及其变体、注意力类的原始注意力与 rollout、相关性传播类的注意力相关性传播,以及结构干预类方法。把它们搬到音频语言生成时,只能给编码音频位置分配时间相关,无法显式给出频率支持。
另一条相关路线来自视觉语言模型的词条件定位。代表是词激活映射类方法,把视觉特征通过词特定的输出权重投影,再用因果估计与秩高斯滤波精修。它解决的是图像空间网格上的词定位。音频的不同在于证据同时分布在时间与频率,且多声部事件可以在时间重叠但占据不同谱区。直接照搬空间方法不能分离并发事件。
论文的判断是:据作者所知,此前没有为音频大模型自由描述提供词级谱时间解释的方法。所以后文比较的 10 个基线都是把通用归因或视觉词定位适配到音频生成,而不是同等谱时间方法的同条件胜负。这个定位决定了比较的公平方式:用同一模型的同一句描述、同一词到事件匹配流程,只换解释图的计算方法。
为什么必须拆成时间一路与频率一路?
设想一段录音前半是人声说话,中间叠加一个窄带哔声。如果只给时间解释,哔声所在时刻的高相关可能同时被解释为人声的证据,因为二者在时间上重叠。如果只给频率解释,知道中频带重要,却不知道它在何时出现。教学例子:时间好比知道快递在哪 1 天到达,频率好比知道它放在哪个货架,缺一不可。只有同时给出时间与频率,才能把并发但谱区不同的事件分开。
论文还强调词的差异性。内容词如婴儿、哭、心跳可能指向不同声源或声学属性,需要强接地;功能词如冠词、系动词可能几乎不需要声学支持,应保持静默。这个要求引出后文两个互补指标:事件定位要高,功能词静默也要高。只做到一端的方法会被调和平均惩罚。
形式化目标是:给定波形、提示与生成序列,为每个词产生频率带数乘时间位置数的非负矩阵。后续还要把属于同一事件的多个词元图聚合成事件图,用于评测与删除实验。整个过程不更新参数,只需要前向与教师强制概率。
沿一个样本走完输入到输出的主路径
先跟随图 1 的主路径看 1 次完整计算。顶部是一条横向链路:输入音频波形与提示一起送入冻结的音频大模型,模型自回归生成一句描述,例如包含婴儿一词的句子。下方浅紫色大框是解释模块,对其中每个词分别计算两路剖面再融合。时间分支从多模态预填充阶段的最后一层隐藏状态出发,取出其中对应编码音频的若干位置,用冻结的语言模型头投影到词表,选出目标词的分数并取正部,得到按时间排序的剖面。频率分支把原始波形做短时傅里叶变换,按梅尔间隔划分频带,逐带删除全时段系数后逆变换重建波形,再在固定前缀下测目标词概率下降,得到频谱剖面。
两路剖面在中间的相乘节点做外积,形成原始时频图,再经时间高斯平滑与全句共享最大值归一化,得到最终词级图。多个词的图可进一步按事件取最大值聚合。图中右侧放大部分显示精修归一化后高相关区更集中,而左侧放大部分显示原始图较分散,这对应平滑与归一化的作用。下方标注的置信下降公式说明频谱分支只保留删除后概率下降的频带。
看图路径: 1. 先从顶部输入音频加提示到冻结音频大模型再到生成描述的主链路看数据流向;2. 再看下方左侧时间分支的隐藏状态与语言模型头投影与频谱分支的逐带遮挡如何汇入中间的相乘节点;3. 最后比较中间原始图与右侧精修归一化图的放大部分,确认高相关区域如何变集中
论文图 1。原论文 Figure 1::“Overview of STAG. Token-conditioned temporal relevance and Frequency-Band Occlusion scores are fused into token-specific spectro-temporal maps, which can be aggregated into…”。
图 1 是方法总览的像素证据。顶部雪花标记表示音频大模型在两处均冻结,不更新参数。左侧时间分支画出了隐藏状态序列与词表投影矩阵,中间给出时间长度为编码位置数的彩条;下方频率分支画出逐带遮挡的多个谱图叠影与长度为频带数的竖条。中间原始图与右侧精修图的虚线放大框帮助读者确认同一时频区域在精修前后相关分布的变化。理解这张图后,再读公式就只是把图中箭头写成数学运算。
时间剖面如何从内部激活算出?
时间分支是白盒归因,不需要额外扰动。记多模态预填充最后一层隐藏状态为行数为序列长度、列数为隐维的矩阵,其中一段连续位置对应编码音频特征,且保持时间顺序。把冻结的语言模型头作用于每个位置,得到每个位置对词表中每个词的分数矩阵。设目标词在词表中的索引已知,取出每个音频位置对该索引的分数,只保留正值,负值截断为零,就得到长度为编码音频位置数的时间剖面。直观理解是:模型内部在该音频位置越倾向于输出这个词,时间相关越高。
\[a_{i}[t]=\left[Z_{\pi(t),c_{i}}\right]_{+},\qquad t=1,\ldots,T,\]上式中符号含义是:方括号下标加号表示取正部,映射函数把音频位置序号映射到完整序列中的绝对位置,目标词索引决定选哪一列分数。计算目标是为该词建立有序的时间支持,不做归一化,保留原始正关联强度,留待后续与频谱剖面相乘后再统一归一化。原文明确这是直接投影,没有先归一化,也没有跨词相减。
时间归因 × 频带遮挡: 时间归因负责回答证据在何时出现,它从冻结语言模型头的词条件投影中得到有序时间剖面;频带遮挡负责回答证据在哪个频率带,它通过逐带删除并测量目标词概率下降得到频谱剖面;二者搭配是因为多声部场景中时间重叠但频谱分离的现象常见,组合后以外积形成每个词的时频图,使时间与频率证据互补而不需重训练。
需要提醒的是,时间剖面本身没有频率轴。后文可视化中把基线的时间剖面复制到全频带,只是为了并排显示,不能误读为它们真的做了频率定位。只有本方法通过下一节的遮挡实验真正得到频率轴。
频带遮挡如何测出哪个频率带重要?
频率分支是黑盒扰动,称为频带遮挡。先把零到采样率 1 半的频率范围划分成连续的梅尔间隔频带,论文实现取 10 个带。对原始波形做短时傅里叶变换,得到频率仓与时间帧的复系数矩阵。对每个频带,把物理频率落入该带的所有仓在全部时间帧上置零,保留带外系数,再逆变换重建扰动波形。因为时间定位已由时间剖面提供,这里每个带遮挡整段录音,所以只需做与频带数相同次数的扰动前向,而不是频率乘时间的网格扰动。
每个扰动波形都在教师强制下评测:提示与目标词之前的前缀固定不变,只看冻结模型输出目标词的下一个词概率。原音频下的概率减去遮挡后的概率,再与零取最大,得到该带的频谱相关。只有删除后概率下降的带才被认为相关,概率上升或不变的带记为零。同一组扰动前向可以为句子中所有词提供频谱相关,因为每个词的前缀概率都可以 1 次算出。
\[g_{i}[b]=\max\!\left(0,p_{i}-p_{i}^{(b)}\right),\qquad b=1,\ldots,B.\]上式中第一项是原音频下目标词概率,第二项是遮挡某带后的概率,差值的正部即该带相关。计算目标是识别哪些谱区支撑当前词。原文实现细节是音频重采样到 16 千赫,短时傅里叶变换用 400 采样窗、160 采样跳,频带数为 10,这些条件是复现时必须保持的扰动口径。
\[\mathbf{R}_{i}=\mathbf{g}_{i}\otimes\mathbf{a}_{i},\qquad R_{i}[b,t]=g_{i}[b]\,a_{i}[t],\]融合是把频谱向量与时间向量做外积,每个时频格的值等于频带相关乘以时刻相关。结果矩阵秩至多为一,并假设时间与频率可分离。它不能表达任意局部时频交互,但多声部场景可通过多个词各自的图来描述:时间相似但频谱不同的重叠事件仍可分开。随后每个频带沿时间独立做 1 维高斯平滑,带宽为 6 个编码位置,不跨频率平滑。最后用同一样本所有词精修图共享的最大值做归一化,保持弱词仍然弱,得到最终词级图。
词级图 × 事件级图: 词级图是每个生成词元对应的 B 乘 T 非负相关图,保留最细粒度的声学支持;事件级图是把属于同一声学事件的多个词元图按逐元素取最大值聚合的结果,避免多词事件因求和而虚增相关并保持取值在 0 到 1 之间;二者搭配使细粒度可解释性与事件级评测得以衔接,前者用于诊断,后者用于定位指标与反事实删除。
可分融合 × 时间精修: 可分融合把时间剖面与频谱剖面直接外积相乘得到秩至多为一的原始时频图,它假设时间与频率可分离,不能表达任意局部时频交互;时间精修沿时间轴对每个频带独立做 1 维高斯平滑,不跨频率平滑是因为各频带来自独立遮挡实验;前者以低成本组合两路证据,后者减少相邻编码位置的碎裂,二者共同形成最终精修图。
词到事件的聚合是把子词先合并为词,再按依存句法把指向同一声学事件的词分组,对组内词级图逐元素取最大值。取最大值而不是求和,避免多词事件虚增相关,并使事件图取值保持在 0 到 1 之间。事件图保留完整频带乘时间的结构,用于后续掩膜与删除。
没有训练阶段时,真实计算是什么?
本研究没有训练任何音频语言模型,也没有微调或修改被解释模型的参数。8 个被测模型都是公开可用的已有模型,直接以冻结方式调用。论文明确所有评估都不更新参数,提示固定为要求写一句声音描述。所谓轻量运行器,只是把不同模型的词级分数与下一个词概率暴露出来,后续归因、融合、聚合与评测阶段共享同一套流程。
真实计算分为 3 类。第一类是白盒前向:1 次多模态预填充得到隐藏状态,用于时间投影,不涉及梯度更新,原文未报告梯度路径,也不应从模型名推定其内部融合实现。第二类是黑盒扰动前向:每个样本做与频带数相同的教师强制前向,得到每个词在每个遮挡下的概率,用于频谱剖面。第 3 类是评测与反事实计算:把时频图投影到时间、做大津阈值 2 值化、映射回短时傅里叶变换网格并逆变换重建,再做教师强制概率比较与自由生成重写。
超参数中时间精修带宽、频带数、窗跳长均有报告,事件匹配先用词网引理匹配、必要时用句嵌入余弦阈值 0.8 补充。缺失项是各 backbone 的具体适配细节只在补充材料中,复现时需回到原文补充材料核对,不能从模型名称猜测编码器结构。
教师强制 × 反事实删除: 教师强制是在频带遮挡与目标置信测量时固定提示与此前缀,只让当前目标词的概率随音频扰动而变化,从而隔离声学证据的作用;反事实删除是把事件级时频掩膜映射回短时傅里叶变换网格并逆变换重建波形,再在教师强制下测概率变化与在自由生成下看事件是否消失;前者提供可控的概率因果探针,后者检验解释是否真正影响模型输出,二者共同支撑忠实性判断。
把无训练等同于确定性求解是误解。冻结参数只说明权重不变,生成仍受采样与解码影响;教师强制固定前缀是为了可控比较,自由重生的描述仍可能变化。后文反事实实验同时报告两种条件下的结果,正是为了区分概率下降与文字消失这两个不同层次的证据。
在什么数据与协议下比较,指标方向是什么?
评测用 4 个带时间起止标注的官方测试划分,覆盖受控与真实多声部场景。理解比较条件时,先看下面的数据构成表,它决定了事件密度与难度。表中测试量从数百到上万不等,提示固定,模型各自生成自己的描述,因此匹配到的事件数随模型而变,指标是在匹配到的事件上平均,不直接代表描述质量。
| 基准 | 测试规模与标注特点 | 事件匹配口径 | 说明 |
|---|---|---|---|
| AudioTime | 500 受控片段,每段两个有序事件 | 引理加同义加嵌入 | 受控排序,时间结构清晰 |
| AudioGrounding | 492 真实多声部录音,短语级区间 | 引理加同义加嵌入 | 真实混叠,短语对齐 |
| TACoS | 2,000 较长录音,密集时间对齐描述 | 引理加同义加嵌入 | 长时密集,事件多 |
| AudioSet-Strong | 14,045 多声部片段,类别级边界 | 引理加同义加嵌入 | 大规模类别边界 |
上表提出的数据问题是:不同基准的时长、密度与标注粒度是否一致。公平条件是同一基准内用同一测试划分与同一提示,只换解释方法;大规模可解释性比较用词法匹配以保证跨方法协议一致,跨模型比较用语义匹配并同时报告匹配数。指标方向都是越高越好:事件定位是预测时间掩膜与标注掩膜的交并比,功能词静默是功能词时间位置低于样本阈值的比例,二者的调和平均为事件 F1。大规模比较用 10 个事后基线,全部基于同一模型的同一句描述,避免生成差异污染归因比较。
事件定位 × 功能词静默: 事件定位负责衡量事件级时间剖面与人工标注起止区间的交并比,越高说明声学名词找得越准;功能词静默负责衡量虚词等非声学词的时间剖面有多大比例低于样本级阈值,越高说明模型没有给不需要接地的内容乱分配证据;二者用调和平均合成事件 F1,搭配理由是只准其一的方法都不可取,组合后同时惩罚定位不准与过度归因。
实现上还有两个必须保留的细节。时间投影时先按频带能量平方加权再沿频率加权平均,零图时退化为均匀平均;事件剖面是先投影再按事件取最大,与事件图直接在时频域聚合不同,二者用途不同不能混用。事件定位前对每个事件剖面独立做最小最大重归一化再做大津阈值,这是为了恢复每事件动态范围;功能词阈值则是在共享归一化尺度上对有效事件阈值取平均,保证事件与功能词可比。
主结果测了什么,谁在什么条件下更准?
主比较回答:在同一模型同一描述下,哪种解释的时间投影与人工标注更一致,同时不给功能词乱分配。比较对象包括梯度、注意力、相关性传播、结构干预、激活映射五族共 10 个基线,以及本方法。条件一致:全部用同一参考模型的同一句描述与词法事件匹配。指标方向越高越好。原文报告本方法在 4 个基准上事件定位与事件 F1 均为最高,超出每数据集最强基线一段明确区间,同时功能词静默保持高位。
注意力与传播类方法功能词静默接近封顶但事件定位明显偏低,说明压住虚词不等于找准实词。某梯度变体因剖面平坦在大津阈值后得空掩膜而得零分,这是具体的未胜出与失败例子。
定性上,哔声例子最有教学价值。导读:先看输入谱中部窄带高亮的哔声,再看各方法对同一目标词的归因,最后看本方法是否同时收紧时间与频率。
看图路径: 1. 先看最左输入梅尔谱中虚线框标出的哔声时频位置作为视觉参考;2. 再横向比较中间三个时间方法被复制到全频带形成的竖条与最右本方法形成的横向频带的区别;3. 最后核对顶部颜色条标注的说话人与哔声区间与下方黑色三角目标词的对应关系
论文图 2。原论文 Figure 2::“Attribution maps for the target token beep.”。
图 2 的像素显示:最左为输入梅尔谱,白色虚线框标出哔声的时频位置,图注明确虚线仅为视觉参考而非基准标注;中间三幅为时间方法复制到全频带的可视化,呈现为贯穿全频的竖亮条;最右本方法呈现为落在虚线框内的横向亮带,说明它同时约束了时间与频率。顶部颜色条区分说话人与哔声区间,黑色三角标出目标词位置。需要强调的是,基准没有频率真值,频率定位在此只能定性看,定量必须投影到时间,这与方法总览节的限制呼应。
跨模型分析进一步显示:相似描述与时间一致不等于等价谱时间解释。同一段婴儿哭声加咀嚼声录音,不同模型提到婴儿哭但高相关落在不同谱区;同一段心跳加说话录音,不同模型对后续说话的重视不同,语义侧重也不同。这支持把解释做到谱时间粒度,而不只看文字是否提到事件。
| 比较维度 | 报告内容 | 本方法 | 最强基线对照 | 反例与代价 |
|---|---|---|---|---|
| 4 基准事件定位与综合 | 高出最强基线区间 | 7.58–12.84 事件定位点,8.70–14.33 综合点 | 音频时刻用词激活映射,其余用梯度加权映射 | 注意力类虚词静默近封顶但定位低,平坦方法得零 |
| 事件消失与减半 | 再生描述与减半比例 | 59.5% 消失,44.6% 减半以上 | 同一删除下非目标变化更小 | 失败例中目标事件保留,见反事实图 |
上表综合了论文直接报告的区间与反事实数字,支持的判断是:本方法在时间一致性与综合指标上领先,且删除识别区能选择性降低目标置信并常使事件从重写描述中消失。限制是删除面积与能量不小,非目标也有负向变化,重叠声源会有连带效应,因此只能称为行为层面的忠实性与选择性支持,而非因果证明。
拿掉或换掉哪个部件,收益如何变化?
部件分析回答:频率证据、词间相减、精修方式与投影规则各自带来什么。比较在同一参考模型与语义匹配下进行,但原文明确提醒时间参考同时改变了频率证据与投影策略,不能孤立解读为频带遮挡的单独贡献。尽管如此,所有谱时间配置的综合指标都高于时间参考,支持时间与频谱互补。在固定其余设置下,去掉词间相减后 4 个基准综合指标均提升,说明该相减在此设置无益;把秩高斯滤波换成时间高斯平滑带来最大提升;最大投影与加权投影差异很小,说明对投影规则不敏感,最终采用加权投影。
反事实删除的成功与失败例子提供了另一类消融视角:同一掩膜构造下,成功行删除中频关键带后目标事件从重写中消失,失败行删除低频区后目标事件保留。这说明掩膜位置与事件谱结构是否对齐决定了干预效果,不是删得越多越有效。导读:先看事件两个词元图的异同,再看掩膜与删除谱的对应,最后看文字是否消失。
看图路径: 1. 先看成功行前两列同一事件两个词元图的差异,确认聚合为事件掩膜的依据;2. 再看第三列绿色选择区与第四列黑色删除区在时频位置上是否一致;3. 最后对比成功行再生描述中目标事件消失与失败行中目标事件保留的文字差异
论文图 5。原论文 Figure 5::“Representative counterfactual deletions.”。
图 5 像素显示两行四列:上行为成功例,下行为失败例;前两列为同一事件两个词元的时频图,第三列为聚合事件掩膜上叠加的绿色选择区,第四列为删除后的反事实谱上对应的黑色缺失区。成功行中婴儿哭声的中高频被大块删除,重写变为含糊的吱吱声;失败行中蛙叫的低频删除后重写仍保留蛙叫。黑色三角与顶部颜色条标出目标事件区间,绿色与黑色的对应关系可直接执行观察。这组对比说明忠实性是选择性的、与谱结构有关的,而不是无条件成立。
| 部件与开销 | 操作 | 报告变化 | 适用条件 | 未验证边界 |
|---|---|---|---|---|
| 精修方式 | 秩高斯换为时间平滑 | 综合提升 7.26–8.48 点 | 固定无词间相减与最大投影 | 非此组合下的增益未单独报告 |
| 投影规则 | 最大换为加权 | 差异仅 0.04–0.26 点 | 最终配置采用加权 | 对定位的单独影响有限 |
上表说明主要收益来自时间平滑而非投影规则微调,代价是每次解释需做与频带数相同的扰动前向。原文未测量延迟与每步开销,总体趋势不等于每组都成立,复现时应记录扰动前向耗时与掩膜面积,避免把平均增益推广到所有样本。
哪些误差不是定位错,而是评测本身的边界?
论文用专门的例子说明标签歧义会惩罚正确的定位。一种情形是基准标注为机械声,模型生成报警声,但时频图仍落在标注区间内,听感上也合理;另一种是基准标注为引擎声,模型生成刹车声,图仍与标注区间重叠。这些例子表明,基于词形与同义匹配的聚合指标会把语义合理但字面不同的生成判为未匹配或错位,而词级图却显示声学定位是对的。初学者应区分两种失败:图错位是方法问题,字面不匹配但图重叠是评测口径问题。
方法本身的边界有三点。第一,频率没有真值,定量只能投影到时间,频率好坏只能定性看。第二,可分融合假设时间与频率可分离,不能表达任意局部时频交互,重叠事件靠多词多图近似描述。第三,事件匹配依赖词网与句嵌入阈值,阈值与分词聚合会影响匹配数与平均结果。论文结论明确把开发谱时间标注基准与研究不可分归因机制列为未来工作。
还有一个易误解点:跨模型表中某小参数模型综合指标超过其大参数版本,不能读作小模型描述质量更高。原文强调指标是在各自生成的可匹配事件上平均,应与匹配数一起解读,刻画的是接地行为而非描述质量,且行为随模型与基准而变。
要复现,先固定哪些信息条件与计算口径?
复现的第一步是固定提示与采样。提示统一为要求写一句声音描述,音频重采样到 16 千赫,短时傅里叶变换用 400 采样窗、160 采样跳,频带数为 10 个梅尔间隔带,时间精修带宽为 6 个编码位置。时间分支取多模态预填充最后一层隐藏状态中编码音频段,用冻结语言模型头投影并取正部;频率分支对每个带做全时段删除并逆变换重建,在固定前缀下测目标词概率下降的正部。融合为外积,精修只沿时间做,归一化用同一样本所有词共享的最大值。
第二步固定评测口径。大规模跨方法比较用词法匹配以保证协议一致,跨模型与部件分析用语义匹配并报告匹配数,二者数值不可直接比较。事件定位前对每事件剖面独立最小最大重归一化再做大津阈值,功能词阈值在共享尺度上取有效事件阈值的平均。反事实时把事件图用大津阈值 2 值化并缩放到短时傅里叶变换网格,删除选中系数后逆变换重建,再分别做教师强制概率比较与自由重写消失率。抽样规模是每基准 100 样本共 1025 事件,目标变化用均值对数概率差、减半比例、消失率与非目标变化共同报告,并记录掩膜面积与移除能量。
资源状态是正文开源声明的唯一依据。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。复现时应把运行器、归因融合聚合评测链路与模型适配分开实现,保留扰动次数、阈值与随机重采样次数的可配置日志,以便他人在相同口径下重放。
何时值得尝试,还需补哪项验证?
当需要回答模型每个实词是否真听见、并发事件在谱上如何分开、虚词是否被乱接地时,这个框架值得尝试。它的可运行策略是明确的:冻结模型加 1 次白盒投影加与频带数相同的黑盒扰动,不需重训练即可得到词级与事件级时频图,并能用删除实验检验选择性。已有证据显示它在 4 个基准的时间一致性与综合指标上领先,且删除识别区后目标置信下降大于非目标、过半事件从重写中消失。
但采用前需补三项验证。第一,在自己的数据上补频率层面的检查,因为公开基准没有频率真值,至少做人工听辨抽查被删频带是否对应目标音色。第二,记录扰动开销与掩膜代价,包括扰动前向耗时、删除面积与能量,以及重叠场景的连带下降,避免把平均收益当成每样本保证。第三,固定词到事件的聚合与匹配阈值,做阈值敏感性与人工复核,因为标签歧义会显著影响匹配数与平均分。完成这些后,才能把行为层面的支持谨慎地读作可部署的解释能力。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses


