英文题目:A Semantic-Anchor-based Method for Open-Vocabulary Sound Event Detection

会议身份:conference:interspeech:2026:conference-paper-id:liu26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#注意力机制 #数据增强 #零样本 #音频事件检测

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jun Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Pengfei Cai:机构信息未能从会议 PDF 纯文本可靠映射
  • Yanfeng Shi:机构信息未能从会议 PDF 纯文本可靠映射
  • Qing Gu:机构信息未能从会议 PDF 纯文本可靠映射
  • Nan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Lirong Dai:机构信息未能从会议 PDF 纯文本可靠映射
  • Yan Song:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

开放词汇声音事件检测以长音频为输入,以任意文本或音频描述为查询,输出多类重叠事件的帧级起止与片段级存在概率,难点在于罕见类训练不可见且文本查询与音频特征存在模态失配。该方法先用对比语言音频预训练编码器将文本或音频查询映射为事件查询向量,再将其与可学习语义锚点拼接并经掩蔽自注意力解释为锚点组合,随后由双向交叉注意力实现查询到音频与音频到查询的互检索并经上下文网络时序建模,最后与分类器向量点积得到帧级预测。与仅算查询特征相似度的双流范式不同,语义锚点提供稳定语义参照,双向交互同时增强事件相关音频特征,因而缓解跨模态失配。在AudioSet-Strong开放词汇设置下,DASM音频查询条件的PSDSr指标为32.7,高于文本查询条件的PSDSr指标23.3。跨数据集泛化亦得益于该稳定参照,使模型在未见声学域中仍能解释新事件。该结论限于强标注英文事件与十类家用场景,细粒度重叠、长尾声学变体与实时约束尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么闭集不够用?

这篇论文研究的任务是声音事件检测。输入是一段音频,里面可能同时出现多种声音,例如狗叫、警报声和雷声相互重叠。目标是要判断每种关心的事件是否出现,以及它在时间轴上的起止边界。初学者可以把输入想象成一段 10 分钟的家庭录音,输出是每种事件的时间标签列表,标出哪几秒有狗叫、哪几秒有警报。

传统做法是闭集检测,也就是训练时见过多少类,测试时就只能检这多少类。论文指出这种假设在真实声学场景中会失效,因为现实中新事件不断出现,而大模型和智能家居等应用又希望模型能感知周围未预定义的事件。开放词汇检测因此被提出,允许用户在测试时用任意文字描述或音频样例作为查询,模型要对这些可能从未训练过的类别做检测。

理解这个转变对后文很关键。闭集模型本质是固定分类器,开放词汇模型本质是基于查询的检索器。检索器的难点不只是算相似度,还要真正理解查询语义并对齐到音频帧。本文后续所有设计都是围绕让查询向量先被语义锚点解释清楚,再与音频特征做充分交互来展开。

已有开放词汇路线各自解决了什么,还缺什么?

论文把相关工作分成两条线。第一条是音频文本预训练,例如 MS-CLAP 和 LAION-CLAP 通过大规模音频文本对比学习得到可对齐的编码器。第二条是把开放词汇思想搬到检测上,例如先算查询文本与音频特征相似度的做法,以及引入模态共享码本的 MGA-CLAP、带特征解码调制的 FlexSED 和显式加入时序建模的 DASM。

论文对这些方法的评价是具体的。只算相似度的方法容易受模态失配影响,保留双流结构和片段级对比训练的方法缺乏针对定位的时序建模,即使加入时序建模和跨模态模块,其对事件的理解仍受限于 CLAP 文本编码器。换句话说,已有方法把查询向量主要当检索键使用,没有让模型在语义层面理解事件,因此对新类的泛化受限。

这个判断直接引出本文的定位。作者不是再换一个更大的 CLAP,而是增加一组可学习的语义锚点作为中间参考,并用双向注意力加强查询与特征的交互。学习时要记住这个对照逻辑,后文实验中与 LAION-CLAP、MGA-CLAP、FlexSED 和 DASM 的比较都是为了验证这两个增量是否真的缓解了语义理解不足和跨模态错位。

论文把开放词汇检测形式化成什么可操作的问题?

论文把开放词汇声音事件检测形式化为基于查询的检索任务。输入有两部分,一部分是待分析的音频片段,另一部分是若干个事件查询。查询可以是文字形式,例如狗叫的自然语言描述,也可以是音频形式,例如多段包含目标事件的音频样例。输出是对每个查询事件给出片段级是否存在和帧级何时存在。

举例来说,假如 1 次输入 3 个查询,分别是狗、警报和雷声,模型要对每个查询独立输出整段概率和每帧概率。这里的例子只是帮助理解任务形式,不代表论文用这 3 个类做了特定数值实验。关键是查询数量是可变的,类别在训练时未必见过,模型不能依赖固定类别编号。

这种形式化决定了方法必须解决 3 个子问题。第一是如何把文字或音频查询编码成统一的事件查询向量,第二是如何让这些向量理解未见语义,第三是如何把它们与音频时间特征对齐并定位边界。后文的查询编码器、锚点引导双向解码器和上下文网络正好一一对应这 3 个子问题。

整体流水线如何从声谱图和查询走到两级预测?

沿着一个样本走完全流程有助于建立整体感。音频侧把梅尔声谱图送入音频编码器,得到按时间排列的音频特征序列。查询侧把文本或音频查询送入查询编码器,得到每个事件的查询向量,再与一组可学习的语义锚向量拼接成最终查询。接着锚点引导的双向解码器让查询与音频特征相互精炼,分别得到精炼查询向量和精炼特征。最后精炼查询经多层感知机得到片段级预测,精炼特征经上下文网络建模时序后与分类器向量匹配得到帧级预测。

下图是理解该流水线的唯一像素依据,请先按导读顺序观察整体连接,再对照后文解释每个模块的输入输出。

看图路径: 1. 先沿左上文本与音频输入经查询编码器、左下梅尔谱经音频编码器进入中间黄色解码器的主箭头走一遍;2. 再看图下方面板如何把可学习语义锚向量与事件查询向量拼接后送入解码器;3. 对比右下面板中查询到音频与音频到查询两层交叉注意力的查询与键值标注方向;4. 确认右侧片段级预测与帧级预测两条输出分支分别接了哪个多层感知机与上下文网络

原论文 Figure 1:Our method enables detection of arbitrary sound events described in either text or audio form.

论文图 1。原论文 Figure 1:“Our method enables detection of arbitrary sound events described in either text or audio form.”。

该图分为 3 个面板。上面板显示从梅尔声谱图到音频编码器再到锚点引导双向解码器,以及从查询编码器进入同一解码器,最后分出片段级预测和经上下文网络与上采样得到的帧级预测。下面板左侧显示查询编码器内部既有音频分支的平均池化路径,也有文本分支经大语言模型生成多条详细描述再随机采样送入编码器的路径,末端与可学习语义锚向量拼接。

下面板右侧显示解码器由自注意力、查询到音频交叉注意力、音频到查询交叉注意力和前馈网络堆叠两层构成,顶部输出更新后的锚点、精炼查询和精炼特征。训练时才做大语言模型增强,推理时文本统一用固定模板编码,这一点在图中已有注明。

查询编码器怎样把文字和音频统一成查询向量?

查询编码器的职责是把不同模态的查询变成同一维度的事件查询向量。论文采用预训练的 MGA-CLAP 提供的音频编码器和文本编码器,利用其已有的跨模态对齐能力。对于音频描述的事件,把多段含目标事件的音频送入编码器,沿时间平均池化得到一个向量。对于文本描述的事件,先用大语言模型做文本增强,为每个事件生成 6 条详细且风格不同的描述,训练时每次随机抽一条送入文本编码器。

随机采样的设计值得单独理解。它不是数据量翻 6 倍,而是每次只用一条,迫使模型关注事件本身的声学语义而非某句话的表面措辞。论文明确指出这种策略有助于泛化和表示鲁棒性。为了效率,训练中所有类的文本和音频查询向量可离线预存。推理时不再调用大语言模型,每个类统一转成自然语言句子模板后编码。

输出端把语义锚向量与事件查询向量拼接,记为锚点加查询的序列。拼接不是简单加长,而是为后文自注意力提供让查询去参考锚点的机会。初学者可以记住,查询编码器解决的是表示统一和文本多样性,语义理解留给解码器中的锚点机制。

语义锚点如何让未见事件被解释为已知语义的组合?

语义锚点是本文的核心增量。白话说,它是一组可学习的向量,数量在实现中取 400,维度为 384,记为从第一个到第 K 个锚点的集合。它们不对应具体类别名称,而是作为语义级参考标记,在训练中沉淀常见声音的共性成分。推理时遇到未见事件,模型可以把它理解为这些参考的组合,而不是硬套训练类别。

语义锚向量 × 事件查询向量: 语义锚向量是模型学习得到的一组语义级参考标记,负责沉淀训练中见过的声音共性;事件查询向量是由 CLAP 对当前查询文本或音频编码得到的具体事件表示,负责携带本次要检事件的特征;二者搭配的理由是单个查询向量难以泛化到未见类,而锚点提供中间语义层,组合意义是查询向量通过自注意力去关注相关锚点,把新事件解释为锚点语义的组合后再参与检索。

具体实现依赖查询自注意力层的掩码设计。事件查询向量之间互不可见,每个查询只能关注语义锚向量。这种设计防止不同查询之间泄露信息,迫使每个事件都必须经过锚点来解释,从而让锚点学成稳定有意义的参考。论文还引入多样性正则,惩罚锚点之间的余弦相似度,避免多个锚点坍缩成同一个方向。该思想受语音自监督中码本多样性损失启发,公式中把余弦相似度重缩放到零到一之间再平均。

需要区分的是,锚点不是分类原型,也不是 CLAP 的文本嵌入。原型通常绑定训练类别,锚点则是开放的中间语义层。消融实验显示去掉锚点后稀有类指标大幅下降,这支持了锚点确实提供了语义级引导的判断,但具体每个锚点对应什么声音,论文没有给出可解释的逐个分析,这是复现时不应过度解读的部分。

双向注意力与两级预测如何完成检索与定位?

双向解码器堆叠两个相同的块,每块包含查询自注意力、音频自注意力、查询到音频交叉注意力、音频到查询交叉注意力,以及分别作用于两条流的前馈网络,每层都有残差和层归一化。查询到音频方向以查询为查询、音频为键值,把目标事件所在帧的特征聚合进查询,得到精炼查询向量并更新锚点。音频到查询方向反过来以音频为查询、查询为键值,让音频特征融入查询信息,抑制无关内容,得到精炼特征。

查询到音频交叉注意力 × 音频到查询交叉注意力: 查询到音频交叉注意力以查询向量为查询、以音频特征为键值,负责把含目标事件的帧特征聚合进查询得到精炼查询;音频到查询交叉注意力反过来以音频特征为查询、以查询向量为键值,负责让音频特征吸收查询信息以增强事件相关部分;二者搭配是因为单向只优化一侧仍留跨模态错位,组合成双向注意力后两侧同时精炼,检索时查询更准、特征更具事件特异性。

得到精炼表示后进入 2 级预测。精炼查询经两层多层感知机加 Sigmoid 得到片段级概率。同一精炼查询还经 3 层映射多层感知机生成分类器向量。精炼特征先经由两层 Conformer 构成的上下文网络建模时序依赖得到输出,再与分类器向量做点积加 Sigmoid 得到检索分,最后乘以片段级概率得到帧级概率。乘法的作用是全局约束局部,整段判断为无则帧得分也被压低。

片段级预测 × 帧级预测: 片段级预测由精炼查询向量经两层多层感知机加 Sigmoid 得到整段是否含该事件,负责提供全局可靠判断;帧级预测由上下文网络输出与分类器向量的点积加 Sigmoid 得到每帧概率,负责定位边界;搭配理由是帧级检索易受局部噪声影响,组合时用片段级概率相乘约束帧级分数,使无事件片段的帧得分被压低。

大语言模型文本增强 × 随机采样: 大语言模型文本增强负责为每个事件生成 6 条聚焦声学特性、风格多样的详细自然语言描述,以充分利用 CLAP 对自然语言的编码能力;随机采样负责在每次训练实例中只抽一条描述送入编码器;搭配原因是若只用固定模板则文本变化太少,组合后模型被迫关注事件语义而非表面措辞,从而提升文本查询的鲁棒性和泛化。

初学者容易混淆的是上下文网络与解码器的分工。解码器负责跨模态交互和语义精炼,上下文网络负责音频内部的时间依赖和边界平滑。上采样模块负责把解码器输出恢复到帧预测所需的时间分辨率。整体上这是一个先对齐语义再建模时序的流水线,而不是把时序建模和跨模态检索混在一层完成。

训练用什么监督、损失加权和优化安排?

训练监督来自强标签数据的帧级标签和片段级标签。损失由三项组成,帧级损失对每个事件每帧计算,片段级损失对每个事件计算,两者都采用非对称焦点损失以应对多标签不平衡,再加上锚点多样性损失。最终损失是帧级求和加片段级加权与多样性加权,论文给出的权重是片段级系数为 0.5,多样性系数为 0.1。

优化安排按证据交代如下。音频编码器采用预训练的 PaSST 或 HTS-AT,训练时前 20000 步冻结音频编码器,之后再联合更新。每个周期训练 40000 步,批量为 32,优化器为 AdamW,音频编码器学习率为 1.5×10⁻⁵,其余部件为 2×10⁻⁴。文本增强使用 ChatGPT,提示要求只聚焦声学特性、不提及其他事件、用口语化语言、每条 5–10 词且 6 条互不相同。在 DESED 上微调时采用平均教师半监督策略并用中值滤波后处理。

未报告的细节需要明确指出。论文没有给出多样性损失梯度是否截断锚点之外的路径,也没有报告不同随机种子下的方差和显著性检验。冻结仅说明前 20000 步冻结音频编码器,未说明查询编码器中 CLAP 参数是否全程可训。复现时应先按上述已报告的冻结步数、学习率和损失权重搭建,再把缺项当作待确认变量记录,而不是从模型名称推定实现。

数据划分、评估设置和指标口径是什么?

论文在两个基准上评估。AudioSet-Strong 是大规模强标签集,论文报告训练集有 93927 段、评估集有 14203 段,共 407 类。开放词汇划分不是按官方稀有划分,而是按训练集中总时长以 6 分钟为阈值分成 308 个常见类和 99 个稀有类,训练只用常见类,评估测全部类,稀有类在训练中未见,因此稀有类指标更能反映开放词汇能力。DESED 是专为声音事件检测设计的数据集,含 10 类,训练含弱标签、强标签、合成强标签和无标签四部分,验证集有 1168 段强标签。

指标采用声音事件检测常用的 PSDS。在 AudioSet-Strong 上使用 PSDS1 但去掉类别方差惩罚项,理由是该惩罚针对更均衡的数据集,报告总体 PSDS 和稀有类 PSDSr 并以稀有类为主要指标。在 DESED 上使用标准 PSDS1。实现上 PaSST 分支用注意力池化压缩频率维,语义锚向量数经消融定为 400,维度 384。

公平性方面需要注意三点。第一,与 LAION-CLAP 和 MGA-CLAP 比较时,论文说明因二者未在 AudioSet-Strong 训练过而做了微调,FlexSED 和 DASM 则引用其论文结果。第二,文本查询与音频查询分开训练和评估,音频查询因与输入同模态通常更占优。第三,资源状态证据显示未发现来源绑定且完成验证的资源,因此不能声称代码模型或数据已公开,复现应以论文文字和官方原图为准。

开放词汇主结果在什么条件下比较了谁?

要回答的核心问题是,在只见常见类、测试含未见稀有类的条件下,新方法是否比已有开放词汇模型更准。比较对象包括微调后的 LAION-CLAP 和 MGA-CLAP,以及论文报告的 FlexSED 和 DASM。指标方向是 PSDS 和 PSDSr 越高越好,其中稀有类是主要依据。文本查询更难,因为存在文本与音频的跨模态错位,音频查询通常分数更高。

下表提炼了 HTS-AT 主干下的关键对照,表中数字与单位保留原文写法,裸数值的指标含义按表头与正文交代为准。

模型主干查询PSDSPSDSr
LAION-CLAPHTS-ATText36.016.1
MGA-CLAPHTS-ATText39.722.9
DASMHTS-ATText48.830.1
OursHTS-ATText50.132.3
OursHTS-ATAudio50.534.9

上表显示本文方法在总体和稀有类上均高于所列对照,文本查询稀有类达到 32.3,音频查询稀有类达到 34.9。论文还报告 PaSST 主干下文本为 49.7 和 31.8、音频为 50.8 和 34.7。更值得关注的是跨模态差距,论文指出 DASM 在 PaSST 下音频稀有类 32.7 降到文本 23.3,差距约 9.4,而本文方法把差距缩小到约 2.9,这支持了双向注意力和文本增强确实缓解了错位的解释。未胜出的一面是音频查询仍高于文本查询,说明错位只是缓解而非消除,且该表未包含统计显著性和推理开销,部署代价需另行测量。

开放词汇检测 × 跨数据集检测: 开放词汇检测指在 AudioSet-Strong 上只用常见类训练、测试全部类并重点看未见稀有类,负责检验对新语义的理解;跨数据集检测指把在 AudioSet-Strong 预训练的模型直接零样本或微调后测 DESED,负责检验跨域稳定性;二者搭配是因为只测同分布稀有类不能说明换数据集仍可用,组合起来才能同时回答语义泛化和域泛化两个问题。

换到 DESED 后零样本和微调各说明什么?

第二个要回答的问题是,在 AudioSet-Strong 预训练后换到 DESED,模型是否还能泛化。评估分零样本直接测试和在 DESED 上微调两种阶段,查询类型中 None 表示闭集模型。指标方向仍是 PSDS1 越高越好。零样本更能说明泛化,微调则说明预训练表示是否有利于下游适配。

下表整理跨数据集对照,数值保留原文裸值写法,指标为标准 PSDS1。

模型主干查询zero-shot PSDS1finetune PSDS1
DCASE BaselineCNNNone–36.4
DASMHTS-ATText42.258.6
DASMHTS-ATAudio37.858.8
OursHTS-ATText44.159.7
OursHTS-ATAudio38.759.5

上表报告本文文本查询零样本达到 44.1,高于所列开放词汇对照,并高于 DESED 监督的 DCASE 基线的微调 36.4。论文把这一优势主要归因于语义锚点提供了稳定的语义参考,使未见数据集的新事件仍可被解释。文本零样本好于音频零样本,论文解释为文本模态更具通用性而音频跨数据集域偏移更大。微调后本文方法达到 59.7 和 59.5,高于所列闭集的 PaSST 和 ATST 微调结果以及开放集对照。限制是零样本 44.1 仍低于微调后的高分,说明跨数据集直接部署与充分适配之间仍有差距,且 DESED 只有 10 类,不能推广到任意开放词汇规模。

拿掉锚点、双向注意力和文本增强各发生什么?

消融的目的是验证 3 个增量各自是否必要。实验统一用 HTS-AT 加文本查询,基线本文方法总体 50.1、稀有类 32.3。去掉语义锚向量后降到总体 43.2、稀有类 12.6,稀有类下降幅度远大于总体,支持锚点主要贡献于新类理解的判断。去掉双向注意力即去掉音频到查询交叉注意力以及音频流的自注意力和前馈,降到总体 49.0、稀有类 30.8,下降相对温和但稳定,支持双向交互缓解模态失配的解释。去掉文本增强改用固定模板后降到总体 49.2、稀有类 31.1,同样支持增强改善查询质量和随机采样提升泛化的说法。

理解这些数字时要注意对照条件。消融只报告了 HTS-AT 文本分支,没有报告 PaSST 或音频查询下去掉各模块的变化,因此不能断言每个分支上效应相同。多样性损失系数、锚点数量 400 的选择依据在正文中只说由消融设定,没有给出完整扫描曲线,复现时应把锚点数当超参数重新验证。失败条件方面,论文没有报告锚点坍缩时的具体表现,也没有给出文本增强生成质量差时的负例,这些边界在原文中属于未评测部分。

综合来看,锚点是决定稀有类成败的最大因素,双向注意力和文本增强是进一步缩小文本与音频差距的辅助因素。三者缺一都会回落,但回落幅度不同,这与方法全景中先语义解释再双向对齐的依赖顺序是一致的。

哪些结论有直接证据,哪些还只是可能?

直接报告的部分包括开放词汇稀有类分数、跨数据集零样本与微调分数,以及三项消融的下降幅度,这些都有具体数字支持。有限解释的部分包括把零样本优势归因于语义锚点、把文本好于音频零样本归因于模态通用性差异、把差距缩小归因于双向注意力和文本增强,这些解释与数字趋势一致,但论文没有提供锚点语义可视化或逐层对齐度量,因此只能写成支持而非证明。

未验证的推测需要明确标为待验证。例如锚点是否真的学到可复用的声音基元,换用其他大语言模型或提示是否同样有效,以及在噪声更大或类别更多的真实场景中是否保持优势,原文都没有测量。缺失证据不是技术错误,但不能把相关性当因果,也不能承诺延迟、误判率或计算成本得到改善,因为原文未报告推理开销、输出帧率与实际延迟。

另一个限制是指标口径。AudioSet-Strong 上去掉了类别方差惩罚项,DESED 用标准 PSDS1,两者不可直接跨数据集比大小。数值相同也不是同一指标的证据,百分点与相对百分比也不同。阅读时应始终把数据集、模型主干、查询模态、实验阶段和聚合对象一起核对,而不是只看单个数字高低。

要复现先做什么,需要哪些超参数和信息条件?

复现的第一步是重建数据划分。按训练集总时长 6 分钟阈值把 407 类分成 308 个常见类和 99 个稀有类,只用常见类训练,评估测全部类并重点看稀有类。音频编码器二选一为 PaSST 或 HTS-AT,查询编码器用 MGA-CLAP 的音频与文本编码器。语义锚向量设 400 个、维度 384,解码器堆叠两层双向块,上下文网络用两层 Conformer。

第二步是重建训练流程。文本分支为每类生成 6 条描述并每次随机采样一条,提示约束已在训练节列出。损失权重取片段级 0.5、多样性 0.1,批量 32,每周期 40000 步,前 20000 步冻结音频编码器,AdamW 学习率音频编码器取较小值、其余部件取较大值,具体数值见训练节。推理时文本统一用固定模板编码,不再调用大语言模型。DESED 微调采用平均教师半监督并加中值滤波后处理。

第三步是明确缺项与核对清单。由于本次资源状态为未发现可验证资源,不得默认代码权重可下载,应以论文文字为准手写实现。需要补做的验证包括不同种子下的方差、锚点数量的扫描、音频查询与文本查询的完整消融,以及推理延迟与显存的实测。只有补齐这些,才能把论文报告的收益转化为可部署的结论。

何时值得尝试这种方法,如何一句话记住它?

当任务允许用户用任意文字或音频样例查询未见事件,并且文本与音频错位是主要误差来源时,这种方法值得尝试。它的记忆点是先用一组可学习的锚点把新事件翻译成已知语义的组合,再用双向注意力让查询与音频互相精炼,最后用全局片段判断约束局部帧定位。文本增强与随机采样是让翻译过程更鲁棒的配套手段。

不适合的情况也要记住。如果类别完全固定且训练数据充足,闭集模型的简单分类器可能更高效,不必引入锚点和双向解码的额外复杂度。如果推理预算极紧,400 个锚点与两层双向块的开销必须实测后再决定,因为原文没有给出延迟数据。跨数据集直接部署前,建议先在目标域做小规模零样本试测,再决定是否微调。

回到初学者的学习路径,建议按输入到表示到组件到目标到输出的顺序复述一遍,遇到术语先说白话再说英文名,遇到数字先核对数据集、主干、查询模态和阶段,再判断趋势是否支持结论。这样既能讲清方法,也能守住准确性优先于修辞的要求。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总