英文题目:Exploratory analysis of yellow mongoose vocalization: detection from in-the-wild recordings and call classification

会议身份:conference:interspeech:2026:conference-paper-id:hovsepyan26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#信号处理 #生物声学 #音频分类 #音频事件检测

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Sevada Hovsepyan:机构信息未能从会议 PDF 纯文本可靠映射
  • Imen Ben Mahmoud:机构信息未能从会议 PDF 纯文本可靠映射
  • Vanessa Rüegg:机构信息未能从会议 PDF 纯文本可靠映射
  • Marta Manser:机构信息未能从会议 PDF 纯文本可靠映射
  • Mathew Magimai Doss:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

黄獴(Yellow Mongoose,YM)野外录音混杂噪声与异种叫声,输入为连续长音频与孤立叫声片段,输出要求检出疑似发声段并划分 9 类幼崽叫声类型,难点在于类别极不平衡与未定义类归属不明。方法链分三步推进:先将叫声降采样并做短时傅里叶变换(Short-Time Fourier Transform,STFT)压缩为 16 帧乘 24 通道的谱时模板,再用随机森林(Random Forest,RF)完成分类并以置换重要性回溯判别频时区,最后用鲁棒语音活动检测(robust Voice Activity Detection,rVAD)与 WhisperSeg 在野外录音上做检出加时域合并后处理。与直接端到端卷积神经网络(Convolutional Neural Network,CNN)相比,关键差异在于显式音节尺度谱时参数化先验,而非从波形学习全部表示。在940条幼崽叫声语料的5折分层交叉验证评测下,手工特征加随机森林的准确率为0.684 ± 0.016,高于卷积网络的准确率0.61 ± 0.029。该结论仅适用于小样本高不平衡的黄獴幼崽数据与 29 段野外录音的辅助标注场景,未验证跨群体跨物种与成体主导场景的外推能力。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解决的黄獴叫声难题从哪里来?

这篇论文的输入是两批真实采集的黄獴声音,目标是回答两个可操作的问题。第一,幼体叫声能不能自动分成已知类型,模糊的未定叫声到底是标错了还是新类型。第二,野外长时间录音里能不能自动圈出黄獴叫声,让标注员少听几小时噪声。论文开头就交代,黄獴是兼性群居的食肉动物,不像高度群居物种那样被充分研究,而社会复杂性假说关心发声复杂性是否随社会性变化,因此需要从幼体到成体的叫声本体数据。

难点在于社会情境依赖强,必须在群体自然状态下录音,录完还要反复听、清洗、按类型和情境归类。作者因此把目标定为可扩展的半自动分析,不是宣称全自动识别已经解决。输出是两套可核对的证据,一套是分类准确率、混淆矩阵和特征重要性图,一套是野外检测的灵敏度与精度及合并后处理的效果。读者要保留的关键信息是数据规模与采集条件,幼体干净集 940 段分 9 类,野外集 29 段共 1948 个黄獴发声标注,用 48 千赫 24 比特的枪式话筒在南非卡拉哈里录制。

理解这个起点后,才能明白为什么后文一面谈分类,一面谈检测,以及为什么检测宁可要高误报也要保召回。

已有路线走到哪:为什么还缺黄獴专用工具?

论文把相关工作分成 3 条线。第一条是动物声学分类的通用深度学习,引用了狨猴、狐獴等灵长类与小型哺乳动物的特征表示与序列结构工作,说明从原始波形学表示是可行路线。第二条是语音活动检测与分割工具,明确点名无监督的 rVAD 和在人声加多种动物声上预训练的 WhisperSeg,前者适合无标注噪声环境,后者想靠迁移解决数据少的问题。第 3 条是手工音节特征,源自语音感知的神经计算模型,把音节看作基本交流单元,曾用于帕金森嗓音等副语言任务。

论文的判断是这些通用方法都有,但针对黄獴的工具仍然缺失,尤其缺对模糊叫声的系统处理和对野外枪式话筒录音的实测。学习依赖上,读者需要先接受两个前提,一是动物叫声与人类音节可能共享谱时结构,二是野外录音的噪声与异种叫声会严重拉低精度。本文的增量不是提出全新网络,而是做探索性适配,用同一批黄獴数据同时检验手工特征加随机森林、卷积网络直接分类、rVAD 与 WhisperSeg 直接检测 4 种现成思路,为以后端到端检测加分类铺路。

问题到底怎么定义:分类与检测各测什么?

论文把任务拆成互补的两半,输入输出与成功标准都不同。分类问题的输入是已切好的单段幼体叫声,每段有权威专家给的 9 类标签之一,其中 8 类是定义清楚的已知类,第 9 类是无法自信归类的未定幼体叫声。输出是预测的类别,成功标准是五折分层交叉验证准确率,以及在三七划分测试集上的精确率、召回率与 F1,还要看未定类是被分到已知类还是自成一团。

检测问题的输入是连续的野外长录音,混有幼体与成体黄獴叫声、背景噪声与其他物种叫声,输出是一组起止时间戳,成功标准是重叠率或灵敏度,即真实 1948 个发声中有多少被覆盖,以及精度,即检出片段中有多少真为黄獴,还有检出片段之间的间隔时长。论文特别说明检测的目标是帮标注员圈候选段,因此可以接受高误报,只要精度也还可用,并且误报多为短而聚集的碎片,可用合并后处理压缩。

举例来说,假如一段长录音里黄獴实际发声时长有限,模型圈出多个短片段,标注员只需听这些片段而不用听整段,这就是论文所说的减负逻辑,但前提是漏检要少。

方法全景:一段叫声走完两条路线的全过程

先沿一个幼体叫声样本走完全流程。假设输入是一段 0.4 秒的 krr 叫声波形,走手工路线时先降采样到 20.5 千赫,用短时傅里叶变换得到功率谱,再把频率平均压缩成 24 个通道,把时间切成 16 段,得到 16 乘 24 的谱图,转分贝、标准化、拉平成 384 维向量,送入 100 棵树的随机森林投票出 9 类概率。走深度路线时同一段波形降采样到 16 千赫,直接送入 4 组卷积加批归一化加池化加激活的网络,经自适应平均池化压成定长,再经两层全连接输出 9 类概率,用交叉熵训练。

再看野外检测路线,输入是一段数小时的连续录音,不做黄獴专用训练,直接调用 rVAD 或 WhisperSeg 输出候选起止时间,再按 0.1 秒、0.5 秒、1 秒阈值把距离过近的候选合并,减少碎片误报。两条路线共用同一批野外标注做评测,但分类只用干净幼体集训练与测试,检测不做黄獴训练只做推理加后处理。这样的安排让读者能分开判断表示是否有效、检测是否可用,而不会把分类的高分误读为野外端到端已解决。

表示与分类器:384 维谱时向量与两种学习器如何分工?

手工特征的计算动作是具体可复述的。对每段叫声算短时傅里叶变换,用 librosa 实现,降采样到 20.5 千赫,把功率谱在相邻频率上平均成 24 通道,在时间上分成 16 窗,标准化后转分贝再拉平,得到 1 乘 384 向量。24 乘 16 的选择意味着频率分辨率粗、时间分辨率也粗,保留的是音节级包络与能量起伏,而非精细谐波。随机森林用 100 棵树、随机种子 42 实现,输入就是该向量,输出类别。卷积网络的结构在原文表 1 中给出,四块卷积核分别为 5、5、3、3,滤波器数为 20、40、40、40,每块后接批归一化、池化核 2 步长 2 与激活,最后自适应平均池化到尺寸 1,再经隐层 10 单元与输出 9 单元的全连接。训练用 PyTorch 与交叉熵损失,可处理变长输入。

手工谱时特征 × 随机森林: 手工谱时特征负责把每段叫声压成固定的 16×24 谱图向量,保留频率与时间上的能量分布;随机森林负责在 384 维上学类别边界并给出置换重要性。搭配理由是样本仅 940 条且极不平衡,固定表示加集成树比直接学波形更稳,组合新增的作用是可解释哪块时频对哪类叫声最关键。

卷积神经网络 × 原始波形: 原始波形是 16 kHz 下变长的 1 维信号,卷积神经网络负责直接从波形经 4 组卷积加池化再经自适应平均池化得到定长表示。搭配理由是省去手工分频分帧,想让模型自己发现判别结构,组合新增的作用是检验端到端在小样本动物叫声上能否超过手工特征,本研究显示其均值 0.61 低于手工路线。

从复现角度,手工路线要固定降采样率、窗数与通道数,深度路线要固定表 1 的核与滤波器数,否则 384 维含义与感受野都会变。论文未报告卷积训练的学习率、轮数与优化器细节,这是缺项,复现时只能按常规另行记录,不能从模型名推定。

有没有训练:分类练了什么,检测又没练什么?

本研究的训练只发生在幼体叫声分类,不发生在野外检测。分类侧,随机森林在五折分层交叉验证下训练,每折保持 9 类比例一致,另做 1 次七三分的训练测试划分以便算混淆矩阵与置换重要性。卷积网络同样在五折下用交叉熵从原始波形训练,但原文未给出优化器、学习率、早停与数据增强,梯度路径与参数更新节奏无法核对,只能确认输入是降采样到 16 千赫的波形、损失是交叉熵、框架是 PyTorch。检测侧,rVAD 是无监督方法,无需黄獴标注训练,直接在 29 段野外录音上推理。

WhisperSeg 是已在人声与多种动物声上预训练的监督模型,本研究未做黄獴微调,只是拿来直接检测黄獴。这意味着检测结果反映的是现成工具的零样本或跨种迁移能力,不能理解为针对黄獴优化后的上限。

rVAD × WhisperSeg: rVAD 是无监督鲁棒语音活动检测,负责在无黄獴标注训练下按能量与分段规则圈出疑似发声;WhisperSeg 是有监督的语音 Transformer 迁移模型,负责用已学的人声与动物声知识做检测。搭配理由是对比免训练与预训练迁移在强噪声野外录音上的适用性,组合意义是看清谁更适合做高召回的初筛工具。

后处理不是训练,而是规则计算,把间隔小于阈值的候选合并,阈值取 0.1 秒、0.5 秒、1 秒三档,目的是压碎片误报。理解有无训练的分界很重要,否则会误把 rVAD 的高召回当成学到了黄獴专属模板。

实验条件:数据、划分、指标与可比性如何固定?

分类数据是 940 段高质量专家标注幼体叫声,分 9 类,8 类已知加 1 类未定。已知类包括 krr、乞食叫、chime 等,未定类 261 例为第二大类,krr 叫 375 例为最大类,极小类如 rattle 仅 6 例、splitkrr 仅 3 例,高度不平衡。野外数据是 29 段枪式话筒录音,含幼体与成体叫声、背景噪声与异种叫声,共 1948 个黄獴发声起止标注,总时长数小时。分类协议用五折分层交叉验证保证每类均衡出现,另用三七划分算混淆矩阵与重要性。指标方向是准确率、精确率、召回率、F1 越高越好,检测侧灵敏度越高漏检越少,精度越高误报越少。

比较条件上,手工加森林与卷积网络在同一五折下比,检测侧 rVAD 与 WhisperSeg 在同一 29 段与同一 1948 标注下比,合并阈值只改变后处理不改变模型本身,因此灵敏度不变而精度变化可归因于合并。

下面这张时长分布图先帮读者建立对类别不平衡与时长重叠的直觉,再去看分类数字才不会只记住平均分。

看图路径: 1. 先看横轴时长秒与纵轴频数,确认大部分叫声集中在 0.5 秒以内;2. 再看图例中 krr 叫声 375 例与未定类 261 例的样本量对比;3. 比较蓝色 krr 分布与橙色未定类分布的峰位左右关系;4. 注意右侧 1.0 秒以上拖尾的稀疏长时样本归属哪类颜色

原论文 Figure 1:Vocalization duration distribution for yellow mon- goose pup vocalizations.

论文图 1。原论文 Figure 1:“Vocalization duration distribution for yellow mon- goose pup vocalizations.”。

从像素看,横轴为时长秒,纵轴为频数,蓝色 krr 峰在 0.3 到 0.5 秒且高而窄,橙色未定类峰更靠左且拖尾更长,右侧 1.0 到 1.8 秒仍有零星橙色与绿色样本。这显示仅靠时长无法分开类别,也解释了为何需要谱时联合特征。资源状态方面,本次未发现来源绑定且完成验证的代码模型数据链接,不得声称已公开,复现需按原文库与参数自行实现。

数据细节对照:两批数据的规模与标注口径能否对上?

为防止把不同阶段的数字混用,这里把数据规模单独对 1 次。幼体集是 940 段高质量单段录音,9 类标签由专家给出,未定类 261 例本身就是标注不确定性的显式记录。野外集是 29 段连续录音,1948 个起止标注覆盖幼体与成体,采集链路为枪式话筒加录音机,总时长数小时。分类的聚合对象是段,检测的聚合对象是事件与文件,两者分母不同,不能直接比 0.684 与 0.81 谁更大。

要核对规模与口径,先看下表把两批数据的来源、规模与用途并列,表后再说明混用数字的常见误解。

数据集规模标注口径用途采集条件
幼体干净集940 段9 类专家标签分类训练与测试高质量单段
幼体未定子集261 例无法自信归类模糊分析同上
野外连续集29 段1948 个起止戳检测评测枪式话筒野外
野外时长数小时混幼体成体加噪声减负场景同上
最大类 krr375 例已知类性能主导项同幼体集

上表提醒读者,940 与 1948 分属分类与检测,29 是文件数而非事件数,375 与 261 解释了为何 krr 与未定的混淆主导了矩阵观感。若把野外检出率当成分类型准确率,就会误读任务难度。复现时必须同时核对数据集、阶段、指标与聚合对象,数值相同也不代表同一指标。

主结果:手工特征为何小胜,野外检测代价是什么?

分类主结果是手工加随机森林在五折下均值 0.684,标准差 0.016,卷积网络均值 0.61,标准差 0.029,前者在各折稳定领先。测试集三七划分下总体准确率 0.67,加权平均 F1 约 0.66,但宏平均仅 0.38,说明大类撑起均值、小类几乎全错。分类型看,krr 精确率与召回率均为 0.75,乞食叫精确率 0.91 但召回率 0.64,幼体 whine 召回率 0.86,chime、downwhine、peepkrr、rattle、splitkrr 等小类多为 0。混淆矩阵显示 krr 的 113 个测试样本中 85 分对、28 被判为未定,未定 78 个中 50 分对、21 被判为 krr,另有少量分到乞食与 whine。这支持论文的判断,手工特征抓住了可判别的谱时模式,模糊样本一部分能归入已知类,一部分自成一团,提示可能存在新类,但不构成发现新类的确证。

要比较两种学习器是否在同条件下分出高下,先看下表提出的公平问题与指标方向,表后再解释收益与代价。

条件指标卷积网络随机森林加手工特征比较对象
五折分层交叉验证幼体 9 类平均准确率0.610.684同划分下手工路线更高
第 1 折单折准确率0.630.67手工路线领先
第 2 折单折准确率0.610.699手工路线领先
第 3 折单折准确率0.590.674手工路线领先
第 5 折单折准确率0.640.709手工路线领先

上表显示手工路线在均值与各折上一致领先,收益是小样本下更稳,代价是宏平均仍低,小类未被解决,不能把 0.684 读成每类都可用。未胜出项是卷积网络,其直接从波形学习在 940 例下未超越固定表示,边界是未报告训练超参数与增强,不能断定加数据或调参后必然反超。

灵敏度 × 精度: 灵敏度负责衡量 1948 个已标注黄獴发声中有多少被圈中,精度负责衡量模型圈出的片段中有多少真是黄獴。搭配理由是论文目标不是全自动切分而是帮标注员减负,宁可误报多也不能漏掉,组合意义是解释为何接受 rVAD 未合并时 0.81 灵敏度配 0.19 精度的 trade-off,并用合并策略只提精度不掉灵敏度。

检测主结果是 rVAD 全面高于 WhisperSeg,但以低精度为代价。未合并时 rVAD 灵敏度 0.81、精度 0.19,合并 1 秒后灵敏度仍 0.81、精度升到 0.37。WhisperSeg 未合并灵敏度 0.16、精度 0.09,合并 1 秒后 0.17 与 0.18。按叫声类型看,rVAD 在多数成体与幼体类上检出比例接近 1.0,而 WhisperSeg 多在 0.2 以下。

要判断合并是否只压误报不伤召回,先看下表在同模型同标注下的灵敏度与精度变化,表后再谈实用含义。

条件指标rVAD 未合并rVAD 合并 1 秒WhisperSeg 合并 1 秒
29 段野外录音 1948 标注灵敏度0.810.810.17
29 段野外录音 1948 标注精度0.190.370.18
阈值 0.1 秒精度0.220.370.10
阈值 0.5 秒精度0.300.370.15
跨叫声类型平均检出比例趋势多数接近 1.0保持多数低于 0.2

上表的主要收益是简单时间平滑把 rVAD 精度从 0.19 提到 0.37 而灵敏度不动,说明误报多为短而聚集的碎片。具体代价是即便合并后仍有约六成误报,仍需人工复核。未胜出项是 WhisperSeg,其跨种迁移在黄獴野外条件下灵敏度明显不足,不能用通用动物模型直接替代。

反证与解释:未定类与重要性图能说明什么、不能说明什么?

论文用置换重要性做机制反证。对每个已训好的森林,打乱某一个时频格再看该类性能掉多少,掉得多说明该格重要。对样本多的 krr、乞食、未定与 whine 画出 16 乘 24 的重要性图,颜色越黄越重要。结果显示不同叫声依赖不同的时间窗与频率带,这支持分类不是靠单一能量阈值,而是靠谱时组合。结合混淆矩阵,未定类 21 例被判为 krr、5 例被判为 whine,另 50 例仍判为未定,说明未定集合内部不一致,一部分声学上接近已知类,另一部分自成一团。论文明确说这不构成新类的确证,只是为重审标注提供客观依据。

未定幼体叫声 × 置换重要性: 未定幼体叫声是专家无法自信归入 8 个已知类的 261 例集合,置换重要性是通过打乱某一时频格再看分类性能下降来度量该格贡献的方法。搭配理由是直接看混淆矩阵只能知道被分到哪类,看重要性图才能知道靠哪段频率与时间做的判断,组合新增的作用是为重审模糊标注提供客观依据并提示可能的新类。

下面这张混淆矩阵与重要性图的像素需要按行列与色标细读,不能只看对角线很蓝就下结论。

看图路径: 1. 先确认横轴为预测类、纵轴为真实类,对角线为分对数;2. 再看 krr 行 85 对 28 与未定行 21 对 50 这两组最大混淆;3. 检查样本极少的 rattle、splitkrr 等行是否整行接近空白

原论文 Figure 2:Confusion matrix with handcrafted feature sets and RF classifier.

论文图 2。原论文 Figure 2:“Confusion matrix with handcrafted feature sets and RF classifier.”。

从像素看,85 与 50 两格深蓝最显眼,28 与 21 两格浅蓝次之,其余小类格几乎白色,右侧色条 0 到 80 确认颜色映射的是个数而非比例。这提醒读者大类数字主导视觉,小类 0 分在图中不显眼但同样重要。

看图路径: 1. 先确认横轴为 16 个时间窗、纵轴为 24 个频率通道;2. 再看右侧颜色条黄色为高重要性、深色为低或负贡献;3. 对比不同叫声面板中亮黄格出现的时间位置是否不同

原论文 Figure 3:Feature importance map with RF permutation test.

论文图 3。原论文 Figure 3:“Feature importance map with RF permutation test.”。

从本次收到的像素看,该图为两个面板的热力图,横轴为时间窗,右侧色条为特征重要性,黄色亮格稀疏散布在不同时间位置,底色多为绿色与深色。这支持不同叫声的关键时段不同,但因本次像素裁剪未完整显示频率轴数值与全部 4 类面板,不硬写具体频率赫兹值,只按原文说频率与时间窗共同决定判别。

限制在哪里:不平衡、误报与跨年龄差异带来什么风险?

论文自述三点限制。第一,数据不平衡,krr 占 375 例而 splitkrr 仅 3 例,分类器天然偏向大类,小类精确率与召回率多为 0,平均分高估了小类可用性。第二,rVAD 误报率高,即便合并 1 秒后精度 0.37 仍意味着大量非黄獴片段被圈出,需要噪声抑制或混合模型。第三,分类只用幼体干净集,检测却混有成体叫声,年龄与录音条件差异带来额外变异,不能把幼体分类的特征重要性直接推广到成体。

还有未报告项,卷积训练超参数、野外各文件时长分布、统计显著性检验均未给出,推理开销与延迟也未测量,因此不能承诺实时或省时多少。相关性不等于因果,手工特征在黄獴上有效不证明黄獴交流就是音节结构,只能说在该表示下呈现出类似音节块的判别性。复现时若只采平衡小样本或只测干净集,会低估野外误报风险。

复现先做什么:按原文能重跑的最小闭环是什么?

复现应分两条闭环。分类闭环先按原文重建 384 维特征,对每段降采样到 20.5 千赫,用 librosa 算短时傅里叶变换,功率谱平均成 24 通道、时间分成 16 段,标准化转分贝拉平,再用 100 棵树、随机种子 42 的随机森林做五折分层交叉验证,对比均值 0.684 与 0.61 的相对关系,而非单点复刻。卷积闭环按表 1 重建四块卷积加自适应平均池化,输入降采样到 16 千赫,用交叉熵训练,注意原文未给学习率与轮数,需自行记录并做多次种子平均。

检测闭环在 29 段录音与 1948 标注上直接运行 rVAD 与 WhisperSeg,不做黄獴微调,算灵敏度与精度,再按 0.1 秒、0.5 秒、1 秒合并邻近候选,验证灵敏度不变、精度上升的趋势。数据侧需保留 3 类信息,幼体 940 的 9 类分布、野外 29 段的混合噪声条件、48 千赫 24 比特枪式话筒链路。

下面这张按叫声类型拆分的检出图是复现检测时最该对照的,它能告诉你哪些类天然好检、哪些类依赖模型。

看图路径: 1. 先看左侧散点为每段录音的重叠率,蓝色 rVAD 普遍高于橙色 wSeg;2. 再看右侧柱状为每类叫声的检出比例,比较实心蓝柱与空心橙框高度;3. 注意虚线分隔左右两部分的不同聚合对象

原论文 Figure 4:Performance for rVAD and wSeg across audio files and call types.

论文图 4。原论文 Figure 4:“Performance for rVAD and wSeg across audio files and call types.”。

从像素看,左侧为每文件的重叠率散点,蓝色点多在 0.8 以上,橙色点多在 0.3 以下,右侧为每类的检出柱,蓝色实柱多顶到 1.0,橙色空框多矮小。这支持 rVAD 跨类型更稳,但也提示若只看平均会掩盖个别文件的低重叠点。何时值得尝试,若你的目标是帮标注员圈候选且能承受人工复核,rVAD 加 1 秒合并是实际可运行策略。若要全自动低误报,则还需补验证。资源上本次无可用链接,不可写已公开,需自备录音与标注。

收束:这篇工作留给新手的行动清单是什么?

回到起点,论文要解决的是标注负担,不是炫技。分类侧的行动是先用固定谱时特征加集成树建立可解释基线,再用混淆矩阵加置换重要性去清洗未定标注,而不是急于调大网络。检测侧的行动是先用无监督 rVAD 做高召回初筛,再用合并邻近片段这种零参数后处理压碎片误报,把省下的时间花在复核上。两类细节值得带走,一是时长分布重叠严重,单靠时长分不开 krr 与未定类,二是合并阈值从 0.1 秒放到 1 秒,rVAD 精度从 0.22 经 0.30 升到 0.37 而灵敏度保持 0.81,这是论文中最干净的代价收益证据。

未验证的推测是音节样结构与新叫声类型,前者是解释性类比,后者需更多平衡样本与行为情境才能定论。下一步验证应补三项,采更多小类样本重测宏平均,测不同噪声与成幼比例下的检测稳定性,记录推理耗时与人工复核时长。只有补完这些,才能从探索性分析走向可部署的半自动标注管线。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总