英文题目:A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs

会议身份:conference:interspeech:2026:conference-paper-id:lee26o_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #音频大模型 #模型评估 #环境声 #音频问答

评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Taehan Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Jaehan Jung:机构信息未能从会议 PDF 纯文本可靠映射
  • Hyukjun Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为含1至5个声音事件的真实录音与询问是否含某事件的是非问题,输出为是或否判断,难点在于多事件场景下既要检出存在事件又要抑制对不存在事件的误报。该工作先用指令模型从人工字幕抽取声源与属性二元组并经人工统一本体,再用音频文本对比模型的文本编码器嵌入事件并取语义距离足够远的子集构造不存在事件查询,最后用4种提问模板与3种回答指令组合的12种提示对4个音频大语言模型做贪婪解码评测。与此前依赖名词解析或至多400样本人工标注的幻觉评测相比,关键差异在于以音频对齐相似度过滤负例并按事件数量分层控制场景复杂度,使误报更可解释为幻觉而非本体歧义。在71,174条AudioCapsV2音频构建的大规模评测上,从1事件到5事件,真阳性率下降约29个百分点而假阳性率上升约8个百分点。结论仅适用于字幕显著事件覆盖的日常环境声与所测4款模型及是非式存在判断,未验证时序定位、开放式描述或强重叠混响下的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

这篇解读的输入是论文正文给出的完整方法与实验描述,目标是让刚进入语音与音频语言模型方向的研究生能够复述多事件音频定位敏感性分析的全流程。需要保留的关键信息包括数据来源与规模、事件抽取与归一化规则、缺席事件的相似度过滤方法、4 个被测模型与 12 种提示词组合、是否问句的判定方式,以及随事件数变化的在场真阳性率与缺席假阳性率趋势。

输出是一套按学习依赖组织的技术说明,先讲任务为什么需要多事件评估,再讲查询如何构造,然后讲实验条件如何保持一致,最后讲结果支持什么判断、不支持什么判断。阅读时可以把每段音频想象成日常录音,里面可能同时有人说话、雨声和雷声,模型要回答某个具体声音是否存在。

单事件评估只问录音里最显著的一个声音,容易给出偏高的分数,多事件评估则要求模型在声音叠加时仍然分清有与无。论文没有训练新的音频大模型,而是把已有模型当作被测对象,通过大规模是否问句探测其可靠性边界。本次没有发现完成可用性验证的代码与数据链接,因此不能写代码或数据已公开,只能按正文描述复述构造步骤。本文不引入原文之外的模型性能数字,所有比较都限定在原文报告的 4 个模型与两种查询类型之内。

此前用哪些路线测幻听,为什么还不够?

在音频语言模型中,幻听通常指模型声称听到了音频里并不存在的声音,此前一条路线是从描述文本中做名词解析,直接把名词当作候选声音对象再提问。这种做法实现简单,但容易产生本体不一致的问题,例如音频中有鸟叫时问是否有动物,若模型答否,按字面会被记错,而按证据看回答可能自洽。

另一条路线是人工标注少量样本做细粒度分析,优点是标签准确,缺点是样本量往往只有几百条,难以覆盖多样的声学条件。还有一类工作是综合推理基准,报告任务准确率,但不分离场景复杂度对定位与误报各自的影响。也就是说,已有工作要么查询构造不够受控,要么规模太小,要么没有把复杂度作为自变量。

本研究的选择是走大规模受控查询路线,用统一的来源加属性结构约束事件表达,再用音频对齐的文本嵌入过滤掉与在场事件过于相近的缺席候选。这样做的好处是评估量大且误报测量不易被近义查询夸大,代价是整个流程依赖自动抽取加人工归一化的质量。如果抽取漏掉某个真实事件,那么针对该事件的缺席查询就会变成标签噪声,理解这一取舍,才能正确看待后文假阳性率上升的含义。

要回答的具体问题是什么,如何度量答对与答错?

论文把问题定义为事件定位(event grounding):给定一段音频和一个用文字描述的事件,判断该事件是否存在。形式上,一段音频记为若干归一化事件的集合,在场查询来自集合内部,正确答案为是,缺席查询来自与集合语义距离足够远的外部采样,正确答案为否。

模型输出被约束为是或否(yes or no),评估指标是在场查询上的真阳性率(True Positive Rate)和缺席查询上的假阳性率(False Positive Rate)。前者越高说明漏检越少,后者越低说明幻听越少。理想模型应在事件数增加时保持前者稳定、后者稳定,实际观察到的却是前者下降、后者上升。

论文还关心两个衍生问题,一是换提示词是否会同时改变两个指标,二是模型在答对与答错时的置信度分布是否随复杂度变化。需要强调的是,这里的复杂度指同一段音频中包含的事件个数,不是音频时长或信噪比。事件个数的分组来自文本抽取结果,因此论文额外用与抽取无关的音频嵌入有效秩来佐证分组合理性。

在场事件检测 × 缺席事件检测: 在场事件检测的分工是检验音频中真实出现的事件能否被答为有,缺席事件检测的分工是检验音频中不存在的事件是否被误答为有,搭配理由是只看前者会掩盖幻听,只看后者无法衡量漏检,组合后才能同时刻画随事件数增加而出现的双向漂移。

沿一个样本走一遍有助于建立直觉,教学例子如下。假设某条音频的描述是雨落到硬表面、雷鸣且有女性说话,归一化后得到 3 个在场事件,针对其中每个事件各构造一个是否问题,正确答案都是是。再从远离这 3 个事件的候选中采样 5 个缺席事件,例如警笛响、鸭子叫等,正确答案都是否。这样一段音频就贡献多个是否判断,聚合到大量音频上即可计算真阳性率与假阳性率。例子到此为止,具体数值以正文实验为准。

从描述到是否问句,全流程经过哪几站?

全流程可以分为四站。第一站是事件抽取,从音频描述中抽取来源(source)与属性(attribute)二元组,来源是明确提到的发声体,属性是明确陈述的声音动作或质地。第二站是归一化,把同义与形态变体合并为统一类别,并只保留出现次数足够多的常见事件类型。

第三站是缺席事件构造,用音频对齐嵌入计算事件间余弦相似度,保留与在场事件足够不相似的候选,再随机采样。第四站是模型评测,把每个事件填入固定的问句模板与回答指令模板,用贪心解码(greedy decoding)得到是或否,并记录输出词概率用于置信度分析。

4 个被测模型都是公开可用的音频能力大模型,评测时通过推理加速框架运行,不做额外微调。提示词方面,4 个问句模板与 3 个回答指令模板交叉得到 12 种提示词,目的是暴露措辞敏感性。整个设计把数据构造与模型推理分开,前三站决定查询质量,第四站决定测量方式,任何一站的偏差都会传导到最终曲线。

有效秩 × 场景复杂度: 场景复杂度的分工是用一段音频包含的事件个数刻画听觉负担,有效秩的分工是用与文本抽取无关的自监督音频嵌入分布维度独立验证负担是否真实增加,搭配原因是事件个数来自文本可能有噪声,组合声学侧证据才能确认分组不是人为划分的假象。

为独立验证事件数确实对应声学复杂度,论文计算自监督音频模型嵌入的有效秩(effective-rank,简称有效秩)。有效秩越高,说明嵌入维度利用越分散,间接反映声音成分越丰富。下段导读先说明该图横轴为事件数分组、纵轴为有效秩取值,两类箱体分别对应两种音频编码器,观察重点是中位数是否随事件数上移。

看图路径: 1. 先看横轴 1 到 5 的事件数分组与纵轴有效秩取值范围;2. 再对比相邻两组箱体中位线随事件数上移的幅度;3. 最后观察箱体高度与须线长度,判断分布是整体上移还是仅尾部拉长

原论文 Figure 2:erank distribution of audio embeddings from EAT (left) and SSLAM (right).

论文图 2。原论文 Figure 2:“erank distribution of audio embeddings from EAT (left) and SSLAM (right).”。

该图显示无论使用哪种音频嵌入,箱体中位数都随事件数从 1 到 5 逐步抬高,说明复杂度分组有声学侧支撑,而不仅是文本计数的产物。但也要看到箱体之间重叠较大,意味着事件数相同的音频内部差异仍然明显,不能把有效秩当作事件数的精确预测器。该佐证支持后文按事件数分组比较真阳性率与假阳性率的做法,但不证明每个分组内部同质。

事件如何抽取与归一,为何用音频对齐嵌入过滤?

抽取阶段使用大语言模型从每条描述中抽取来源与属性,并施加严格策略:只抽明确陈述的事件,忽略不确定的提及;把抽象占位词与代词视为无效来源;避免用重复来源名的属性。原文思路是人物、狗这类具体发声体可以作为来源,谈话、吠叫这类动作可以作为属性,而含糊的某个东西则不能算有效来源。这种约束减少了把推测内容当作标签的风险。

抽取后发现同一事件有多种字面形式,因此安排人工按 4 条原则归一:本体归一合并同义或上下位来源,数量归一统一为单数,格式归一统一属性为动名词形式,标准归一改写语义等价表达。经过滤后得到约 140000 个事件,来自约 70000 段音频,并进一步收敛为 578 个唯一事件类型,包含 129 种来源与 201 种属性。

来源属性事件 × 音频对齐文本嵌入: 来源属性事件的分工是把自由描述压缩为发声体加声音动作的可比查询单元,音频对齐文本嵌入的分工是在向量空间中度量两个事件听起来是否相近,搭配原因是仅靠字面相似会误伤声学关联,组合后才能采样出距离足够远的缺席查询,避免把证据自洽的回答误判为幻觉。

缺席查询的关键是不能问得太像在场事件,否则模型答是可能是证据自洽而非幻觉。通用语言模型擅长字面语义,但声学相似不总跟随字面相似,规则词典也难以覆盖振动与锯木声这类听感关联。论文对比了通用编码器与音频文本对比训练的编码器,发现后者给听感相近的事件对更高相似度与更靠前的排名,因此选用音频文本对比训练的编码器做过滤。

下段提出本表的比较问题:在不同事件数组合下样本占比如何分布,公平条件是同一抽取与归 1 流程,指标方向是样本量越大分组估计越稳定。原表头单位为百分比,数据格保留原百分号写法,事件总量与唯一类型作为背景列不参与分组比较。

分组1 个事件2 个事件3 个事件4 个事件5 个事件
样本占比25.8%49.3%20.5%3.8%0.5%
规模背景145,236 个事件71,174 段音频578 个类型129 种来源201 种属性

该表显示两事件样本占比接近一半,构成主要比较基础,一事件与三事件样本也足够形成趋势,而四事件与五事件样本很少,因此尾部估计方差更大。未胜出的一面是稀有组的代表性有限,不能把五事件点的具体数值推广为所有复杂场景的精确值。解读五事件处的波动要更谨慎,应把趋势当作主要信息,把单点数值当作估计值。

本研究训练了什么,没有训练什么,真实计算是什么?

本研究没有训练任何新的音频大模型,也没有微调被测模型的参数,4 个被测模型的参数在评测期间保持冻结,不存在梯度更新路径。监督来源不是模型训练损失,而是评测阶段的是否标签,即在场查询标签为是、缺席查询标签为否。把无训练等同于确定性求解是误解,因为贪心解码之外的输出解析与提示词措辞仍会带来变化。

真实计算分为构造侧与推理侧。构造侧的计算包括大语言模型抽取、人工归一、文本嵌入编码与余弦相似度排序,以及按交集采样缺席事件。推理侧的计算是把音频加提示词送入被测模型,用贪心解码生成是或否,并提取是与否两个词的输出概率做归一化置信度。论文明确报告缺席采样中超参数与采样个数的选择:在单事件情形下先按相似度排序确定阈值位置,经验取值为 0.3 以平衡多样性与语义距离。

在多事件情形下对一段音频内所有在场事件的不相似集合取交集,再随机采样 5 个缺席事件,最终得到约 356,000 个缺席查询。缺席查询远离在场查询的效果可以用嵌入空间可视化直观检查,下段导读先说明左侧为 3 维主成分球面与全部事件背景点,右侧为该样本的在场与缺席列表,观察重点是两类点是否分离。

看图路径: 1. 先找到球面上绿色在场点与红色缺席点的大致位置关系;2. 再核对右侧列表中雨落雷鸣加女性说话的在场组合与警笛等缺席项;3. 最后观察蓝色背景点构成的稠密球面,理解缺席采样远离在场簇的含义

原论文 Figure 3:Visualization of the event embedding space on princi- pal component axes.

论文图 3。原论文 Figure 3:“Visualization of the event embedding space on princi- pal component axes. Blue dots indicate all other events.”。

该图对应描述为雨落到硬表面、雷鸣且有女性说话的样本,右侧列表把 3 个在场事件与 5 个缺席事件一一列出,左侧球面显示蓝色背景事件构成稠密分布,而红色缺席点明显偏离绿色在场点。这支持缺席采样确实保持了语义距离,但也留下未验证点:阈值取 0.3 之外的取值是否会改变结论,原文没有展开该消融,因此不能断言当前过滤是最优的。复现时应先固定该阈值与随机采样数,再检查结论是否稳定。

模型、提示词与判定条件如何保持一致?

被测模型包括 3 种规模的同系列全模态模型与一个音频专用模型,共 4 个,评测时均使用贪心解码与同一加速推理框架,运行硬件报告为高性能图形处理器。查询侧对每个模型生成约 500,000 个是否问句,覆盖在场与缺席两类。提示词由 4 个问句模板与 3 个回答指令模板交叉组成,共 12 种。

问句模板围绕是否存在某声音的不同措辞,回答指令模板要求只输出是或否。评估时把模型自由输出映射为是或否二选一,并用归一化概率表示置信度。这种设计的公平条件是同一音频与同一事件在不同提示词下只改变措辞,不改变正确答案,因此跨提示词的差异可以归因于措辞敏感性。

指标方向是真阳性率越高越好,假阳性率越低越好,条件假阳性率用于检查当在场事件大多答对时缺席误报是否下降。需要保留的细节是,论文还计算了提示词排序的一致性与复杂度差距的相关性,用以量化权衡强度。未报告的缺项包括解码温度之外的采样设置、输出解析失败率,以及推理延迟与显存开销,因此不能从本研究推断各模型的部署成本高低。复现时应严格保留 12 种提示词的原文措辞与只输出是否的指令,任何额外解释性指令都会改变回答偏向。

事件变多时,漏检与误报如何变化?

核心结果是随事件数从 1 增至 5,在场检测的真阳性率持续下降,缺席检测的假阳性率持续上升。摘要层面的概括是真阳性率下降约 29 个百分点,假阳性率上升约 8 个百分点。4 个模型表现出相同方向,但幅度与提示词带宽不同,其中音频专用模型跨提示词波动最大,小规模全模态模型波动相对较小。

论文还检验了当模型在某段音频上答对至少 75% 在场事件时,对应缺席查询的误报是否下降,结果是条件误报最多比总体误报低 0.3 个百分点,说明即使在场部分基本答对,幻听也没有明显消除,二者只是弱耦合。下段导读先说明该图按模型分面、横轴为事件数、绿线为真阳性率、红线为假阳性率,实线虚线点线分别对应平均与最好最差提示词,观察重点是绿带下行与红带上行是否跨模型成立。

看图路径: 1. 先按每个模型子图区分上方绿色真阳性曲线与下方红色假阳性曲线;2. 再对比实线平均值与虚线最好提示词和点线最差提示词围成的带宽;3. 最后沿横轴 1 到 5 观察绿线下行与红线上行的斜率在四个模型间的差异

原论文 Figure 4:True Positive Rate (green) on present-event detection and False Positive Rate (red) on…

论文图 4。原论文 Figure 4:“True Positive Rate (green) on present-event detection and False Positive Rate (red) on absent-event detection, plot- ted against the number of events across audio LLMs.”。

该图显示在五事件处绿色带仍明显低于一事件处,红色带仍高于一事件处,说明复杂度效应不是某个措辞的偶然结果。图中每个子图标题还给出总体均值与波动,像素可见真阳性率均值在 0.85 至 0.88 附近,假阳性率均值在 0.054 至 0.101 附近,条件误报与总体误报接近。绿色带与红色带宽度即提示词敏感性,音频专用模型的带宽明显更宽。

真阳性率 × 假阳性率: 真阳性率的分工是度量在场查询中回答为有的正确比例,假阳性率的分工是度量缺席查询中错误回答为有的比例,搭配原因是单一指标会被偏向回答为是或否的倾向掩盖,组合起来才能揭示提示词把模型推向多答是或多答否时的代价。

置信度分析进一步显示,答对时的置信度呈高值聚集的长尾分布,答错时的置信度分布更扁平,且随事件数增加,答对置信度下降,答错置信度没有一致趋势。下段导读先说明该图按模型分块、左侧为在场检测、右侧为缺席检测、横轴为事件数、纵轴为归一化词概率,观察重点是正确侧中位线是否下移。

看图路径: 1. 先区分左侧在场检测与右侧缺席检测两大列的分布朝向;2. 再对比正确侧分布的高耸形态与错误侧分布的扁平形态;3. 最后沿 1 到 5 追踪正确侧中位横线下移的程度,判断不确定性如何增加

原论文 Figure 5:Normalized output token probability distribution of Audio LLMs.

论文图 5。原论文 Figure 5:“Normalized output token probability distribution of Audio LLMs. Yes / No scores are at the left / right axis, respectively.”。

该图像素可见在场列的正确侧分布主体偏高但尾部随事件数变长,缺席列的正确侧同样在高值聚集,而错误侧更分散。这支持复杂音频带来更大不确定性的判断,但原文用词是揭示不确定性增加的空间,而不是证明某种校准方法有效。重提结果时需要增加适用条件:上述趋势是在相似度过滤后的缺席查询上测得的,若不过滤近义查询,假阳性率会被高估;若只看单一提示词,可能因回答偏向而高估或低估任一指标。

换一种问法会怎样,召回与误报为何此消彼长?

论文把 12 种提示词分别按在场真阳性率从高到低排序,再按缺席假阳性率从低到高排序,计算两套排序的一致性。结果是一致性为负,意味着在场表现好的提示词往往在缺席侧表现差。直接看极值也得到相同印象:取得最高真阳性率的提示词往往同时取得较高的假阳性率,取得最低假阳性率的提示词往往同时压低真阳性率。

提示词敏感性 × 回答偏向: 提示词敏感性的分工是描述更换问法与输出指令带来的性能波动幅度,回答偏向的分工是解释波动来自模型更倾向答是还是答否,搭配原因是只报告波动无法指导选择,组合后才能说明提高召回的问法往往同时抬高误报。

下段提出本表的比较问题:在可实际运行的 12 种措辞中,是否存在同时最优的提示词,公平条件是同一模型与同一查询集合,指标方向是真阳性率越高越好、假阳性率越低越好。原表头单位为百分比,数据格为裸数值写法,此处保留裸数值不逐格追加百分号,单位由表头交代。

模型最高 TPR 提示词与取值最低 TPR 提示词与取值最低 FPR 提示词与取值最高 FPR 提示词与取值
30B 全模态q2r2 / 91.8q4r3 / 86.4q4r3 / 5.6q2r2 / 11.5
7B 全模态q1r1 / 90.3q3r3 / 84.6q3r2 / 3.6q1r1 / 9.1
3B 全模态q1r1 / 90.9q4r2 / 79.3q4r2 / 3.9q1r1 / 11.2
7B 音频专用q1r3 / 94.2q3r3 / 75.8q3r1 / 3.4q4r1 / 21.0

该表显示同一提示词编号常同时出现在高真阳性与高假阳性两端,例如某模型中同一问法既拿下最高真阳性也拿下最高假阳性,说明该措辞把模型推向多答是。反之,拿下最低假阳性的措辞往往也压低真阳性,说明模型被推向多答否。具体代价是选召回最强的提示词要承受误报明显上升,选误报最低的提示词要承受十多个百分点的召回损失。

未胜出项同样重要:没有一种提示词在两侧同时最优,因此不能把换措辞当作免费的性能提升。论文进一步计算每个提示词从 1 事件到 5 事件的复杂度差距,发现真阳性差距与假阳性差距呈强负相关,相关系数约负 0.73 至负 0.95,说明对复杂度更敏感的提示词在一侧敏感、在另一侧反而不敏感。这支持回答偏向随复杂度放大的解释,但属于有限解释而非因果证明,待验证的是偏向来自指令理解还是音频编码。

哪些结论站得住,哪些还不能说?

站得住的是方向性结论:在受控过滤与 12 种提示词平均下,事件数增加伴随真阳性率下降与假阳性率上升,且提示词在召回与误报之间存在权衡。支持强度来自大样本量、跨 4 个模型的一致方向,以及独立声学有效秩对分组的佐证。有限解释的是回答偏向与不确定性机制:排序负相关与置信度分布变化支持模型在复杂场景下更不确定,但没有证明不确定性来自音频编码、语言先验还是指令理解。

不能说的是因果与部署含义:相关性不是因果,不能说事件数必然导致幻听,因为音频时长、响度与标注完整性都可能混杂。未测量延迟、成本与误判的实际危害,不能承诺换提示词或加过滤能改善真实应用体验。数据侧限制包括稀有组的样本很少、人工归一依赖一致同意但未报告一致率、抽取指令只在网页提及而正文未展开。

方法侧限制包括阈值取 0.3 缺乏消融、只用贪心解码而未比较采样解码、只用是否问句而未测试开放式描述。阅读时应把五事件点的精确数值当作估计值,把趋势当作主要信息。总体趋势不等于每组每步都成立,个别模型在相邻事件数之间的变化可能平缓,但从 1 到 5 的整体落差方向一致。

要复现这套评估,先做什么,需要哪些参数?

复现应按构造先于评测的顺序进行。第一步是获取音频描述集合并运行抽取,保留来源与属性二元组,执行无效来源与重复属性的剔除规则,再按本体、数量、格式与标准 4 条原则归一,只保留出现超过 20 次的事件类型。第二步是用音频对齐文本嵌入对全部唯一事件编码,做均值中心化后计算余弦相似度,按 0.3 分位确定阈值,对多事件音频取交集后随机采样 5 个缺席事件。

第三步是把每个事件填入 12 种提示词模板,用贪心解码在 4 个被测模型上生成是否回答,并记录是否两词的归一化概率。第四步是按事件数 1 到 5 分组计算真阳性率、假阳性率与条件误报,再计算提示词排序一致性与复杂度差距相关性。需要保留的关键超参数是频次阈值 20、相似度分位 0.3、每段音频采样 5 个缺席事件、正确答案为是在场为否缺席。

信息条件方面,必须使用与原文相同的问句与指令措辞,不能加入额外解释要求。资源方面,本次未能确认代码链接可达,因此应按正文描述自行实现抽取与评估脚本,并记录随机种子与输出解析规则。由于四事件与五事件样本很少,建议报告分组样本量与置信区间,避免只报告均值。若要补验证,优先补阈值敏感性、另一编码器的替换实验,以及开放式问答是否呈现相同趋势。

何时值得借用这套做法,还需补哪项验证?

当任务涉及多声音叠加的可靠性,例如家庭录音、街景或会议转写中的存在性判断,这套做法值得借用:先把自由描述收敛为来源加属性的可比单元,再用听感相近的嵌入过滤缺席查询,最后用是否问句分离漏检与幻听。它的价值不在于给出某个模型的绝对分数,而在于提供随复杂度变化的曲线与跨措辞的带宽,让选型时看到最优措辞的代价。

常见误解是把低误报直接等同于模型更好,实际上若该低误报来自偏向答否,其召回可能已大幅受损。另一个误解是把五事件点的数值当作精确承诺,而该处样本最少、估计最不稳定。还需补的验证包括更大规模复杂场景的覆盖、阈值与编码器选择的系统消融,以及从是否判断到开放描述的一致性检验。

只有补足这些,才能判断当前观察到的双向漂移是音频理解的根本短板,还是特定查询构造与解码方式放大的现象。对于刚入门的研究者,更可行的起点是先复现单事件与双事件分组的曲线,确认提示词带宽与回答偏向的存在,再向更复杂的三至五事件分组扩展,避免一开始就陷入稀有组的噪声解释。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总