英文题目:RT-ASDNet: Unified, Real-Time Active Speaker Detection

会议身份:conference:interspeech:2026:conference-paper-id:kopuklu26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#端到端学习 #实时处理 #音视频 #语音 #说话人分离标注

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Okan Köpüklü:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

主动说话人检测(Active Speaker Detection,ASD)的输入是连续视频片段与同步原始音频波形,输出是关键帧中全部人脸框与说话或非说话标签,难点在于唇动与语音细粒度同步、多人遮挡小脸以及逐人裁剪导致的延迟随人数线性增长。本文方法链分三步:音频流用Sinc卷积加深度可分离卷积从原始波形提取紧凑嵌入并广播到空间网格,视觉流用三维卷积骨干加特征金字塔与可变形融合提取四分之一分辨率时空特征,融合检测头用热力图分类定位加宽高与偏移回归一次性输出框与状态。与既有先检测再逐脸分类的多阶段管线相比,该机制取消外部人脸检测器与逐人前向,使单帧计算量恒定并支持端到端优化。在AVA-ActiveSpeaker验证集上288分辨率32帧配置取得平均精度均值(mean Average Precision,mAP)77.3%,显著低于离线最强基线95.6%的分类上界。该结论仅适用于以预测框计算的联合检测分类口径,不可直接外推到基于真值框的分类评测或拥挤小脸场景。原文未披露训练硬件与训练时长。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留哪条主线?

本文的输入是一段配有声音的视频片段,包含连续视频帧和对应时间段的原始音频波形,目标是在指定的关键帧上同时回答两个问题:脸在哪里,以及每张脸当前是否在说话。关键帧被原文定义为输入视频片段中的最后 1 帧,系统以滑动窗口方式运行,每次只对该帧输出检测结果。这种定义把时间上下文都放在历史帧中,自然满足因果要求,也为固定延迟推理打下基础。

对于刚进入语音音乐音频领域的研究生,需要先建立的学习依赖是:说话判断不能只听声音,因为多人场景下声音无法告诉你声源对应哪张脸;也不能只看图像,因为张嘴动作可能是吃饭或微笑。只有当音频中的语音活动与某张脸的嘴部运动在时间上同步,才判为该人在说话。这就是音视频主动说话人检测的核心依据。

本文要保留的主线是把定位与分类统一为 1 次检测。传统路线是先用现成的人脸检测器找出所有脸,对每张脸裁剪放大,再分别提取视觉特征并与音频融合分类。原文明确指出这种路线有 3 个代价:计算量随人数线性增长,跨阶段误差会传播,以及依赖外部检测器导致无法端到端优化。后续所有方法设计和实验都要围绕是否消除了这三点来核对。

主动说话人检测 × 人脸检测加分类: 主动说话人检测负责回答画面中谁在说话,需要同时给出位置和说话状态;人脸检测加分类是把该任务拆成先找脸再判断每张脸是否说话的两步做法,分工清晰但会引入级联误差和随人数增长的计算量,RT-ASDNet 把两者合并为 1 次检测就是为了去掉这种拆分。

本解读的输出是一套可复述的方法流程和可核对的实验条件。阅读时请始终区分论文直接报告的数字、论文给出的有限解释,以及我们作为教学补充的例子。凡是标为例子的内容都不是论文原结论,不应作为复现依据。

已有路线为什么快不起来,本文把它们分成哪两类?

原文把已有主动说话人检测结构按时间假设和部署目标分成离线方法和因果方法两类。对照维度是同输入、同目标、同监督和同运行阶段,而不是只看验证集分数高低。离线方法以最大化基准性能为目标,常用多阶段流水线,分别处理人脸检测、特征提取、音视频融合和长时时序建模。代表性技术包括图神经网络和注意力机制,前者把音视频线索建模为图节点以捕捉时空关系,后者做细粒度的跨模态对齐。原文指出前者计算开销大,后者参数量大,还有轻量循环神经网络变体虽然计算高效,但在复杂多说话人环境下判别能力不足,需要额外的人际关系建模。

因果方法声称具备实时能力,但原文强调其因果往往只意味着不用未来帧。例如把离线结构改造为因果版本,通常会因缺少未来上下文而掉点。更重要的是,文中点名的两类因果系统仍然依赖外部人脸检测,并对每个检测到的人分别做视觉特征提取,因此计算量仍随人数线性增长,在拥挤场景下很容易违反延迟约束。它们还保留了多阶段设计,继承了误差传播和不能端到端优化的问题。轻量化骨干或简化时序模块只能降低常数,不能改变随人数增长的复杂度阶数。

因果结构 × 实时运行: 因果结构指预测当前帧时只用当前和过去帧,不用未来帧,是实时系统的必要条件;实时运行还要求每帧延迟足够低且不随人数增长,原文指出已有因果方法仍对每张脸单独提特征,因此因果不等于实时,这正是本文要补的缺口。

举一个教学例子:假设 1 帧中有 5 张脸,传统流水线需要运行 1 次人脸检测器,再运行 5 次人脸视觉编码器,最后做 5 次分类。人数翻倍,视觉编码次数也翻倍。这就是原文所说的推理时间随场景复杂度变化。RT-ASDNet 的目标是无论 1 帧中有一张脸还是多张脸,都只做 1 次全帧前向,这是理解后文固定计算量的关键。

本文要解决的具体问题与显式主张是什么?

具体问题是如何在不依赖外部人脸提议、不对每张脸单独处理的前提下,对关键帧同时完成人脸定位和说话分类,并保证每帧推理成本恒定。输入是视频片段加对应音频,输出是关键帧上若干边框,每个边框附带说话或非说话标签和置信度。评价时既看边框是否与真值重叠足够,又看说话标签是否正确。

原文的显式主张有 3 条:结构是端到端训练的,性能不依赖外部人脸检测器;推理时间固定,不随视频流中说话人数量变化;结构是模块化的,可以按复杂度需求把组件替换为更省资源的变体。原文还声明,据作者所知,这是第一个在主动说话人检测任务上做单阶段联合检测与分类的结构。核对时应注意,该新颖性声明是作者自述,本解读只转述,不做独立考证。

需要提前说明的边界是:本文报告的平均精度是在联合检测口径下计算的,而对比的离线和因果方法大多直接使用真值人脸框只计算分类正确率。两者任务难度不同,不能直接把分数相减理解为方法优劣,后文结果部分会专门保留这一条件差异。

RT-ASDNet 让一个样本走完全程:从音视频到边框加标签

先沿一个样本走完全程。假设输入是一个包含 32 帧的视频片段和同步的原始音频,目标帧是该片段的最后 1 帧。视频分支用 3 维卷积骨干提取 4 个尺度的时空特征,时间维度分别下采样,空间分辨率逐级降低,再通过自顶向下的多尺度融合恢复到输入 1/4 分辨率的视觉特征图。音频分支用原始波形骨干提取一个紧凑向量,在空间上广播到与视觉特征图相同的宽高,再与视觉特征在通道维拼接。

融合特征送入类别热图头,视觉特征单独送入尺寸头和偏移头。热图上的局部峰值即候选说话人,每个峰值的位置、类别置信度、回归的宽高和偏移共同解码为最终边框和说话标签。

无锚检测 × 中心点热图: 无锚检测指不预设大量候选框而直接预测目标位置和尺寸;中心点热图是其实现方式,即在下采样特征图上为说话和非说话两类分别预测每个位置是人脸中心的概率,峰值位置再结合尺寸和偏移还原边框,搭配理由是 1 次前向同时解决定位与分类。

下图是理解上述主路径的唯一像素依据,阅读时先看整体从左到右的流向,再看上下分支在哪里汇合。图注明确说明图中展示的是 3 维残差网络 18 层骨干在 8 帧和 288 乘 288 分辨率下的示意,实际实验还用了 16 帧、32 帧、64 帧以及二百二十四和三百五十二分辨率,示意尺寸不代表所有实验配置。

看图路径: 1. 从左侧视频输入和音频输入出发,沿中间箭头找到多模态融合节点;2. 观察视频分支中 block-1 到 block-4 尺寸不断缩小,再经 MSF 逐级放大的路径;3. 查看右侧 HEADS 三个并列输出,区分偏移、宽高与类别热图的分工;4. 对照最右侧输出帧上绿色说话框与红色非说话框的含义

原论文 Figure 1:RT-ASDNet architecture. For illustration, feature maps from the 3D-ResNet-18 backbone are shown…

论文图 1。原论文 Figure 1:“RT-ASDNet architecture. For illustration, feature maps from the 3D-ResNet-18 backbone are shown for an input clip of 8 frames at a spatial resolution of 288 × 288.”。

该图左侧上方是堆叠的视频输入,标注为 8 乘 3 乘 288 乘 288,下方是音频波形输入。视频经过初始卷积和 4 个残差块后空间尺寸逐步缩小,图中可见 4 乘 64 乘 72 乘 72 等中间尺寸标注。右侧橙色多尺度融合块把粗特征上采样后与细特征合并,最终得到六十四乘 72 乘 72 的视觉特征。

音频经音频特征提取器得到 32 乘 1 乘一向量,经重复扩展为三十二乘 72 乘 72,再与视觉特征拼接为三十二加六十四乘 72 乘 72 的融合特征。最右侧 3 个并行头分别输出偏移、宽高和类别热图,最终在关键帧上用绿色框表示说话、红色框表示非说话。该图支持了单次前向同时定位与分类的主张,但图中未显示损失、训练流程和延迟测量方法,这些需回到正文核对。

音频流、视觉流与融合检测头各自做什么?

音频流以原始波形为输入,采样率为 16 kHz。骨干采用轻量的正弦卷积网络变体,动机是直接从波形提取代表性音频特征,避免显式滤波器组。结构上先用 80 个核长为二百五十一的正弦滤波器做卷积,再做对数压缩,非线性形式为对绝对值加一取对数。随后是 6 个深度可分离卷积块加泄漏修正线性单元,除最后一个块外均为 160 通道,最后经自适应平均池化压缩时间维,得到 32 维音频嵌入。该分支从零开始训练,不使用外部预训练权重。

视觉流以视频片段为输入,记为三乘时间乘高乘宽。骨干产生 4 个层级的特征图,时间下采样因子和空间下采样因子逐级增大。在做多尺度融合前,先用时间核尺寸与特征时间维匹配的 3 维点卷积把时间维压掉。自顶向下路径从最粗特征出发,逐级上采样并与更细特征经多尺度融合块合并。融合块先对粗特征做双线性上采样以匹配细特征的空间分辨率,两者分别经过可变形卷积后在通道维拼接,再经过 1 次可变形卷积得到与细特征相同通道数的输出。最终视觉特征图为输入 1/4 分辨率。

SincDSNet × 3 维卷积视频骨干: SincDSNet 负责从原始波形直接提取紧凑音频嵌入,分工是提供整段音频有没有语音及其特征;3 维卷积视频骨干负责从视频片段提取多尺度时空特征,分工是提供脸在哪以及嘴部运动线索,两者在融合前分别压缩为空间对齐的特征图,搭配后才能在同一位置判断视听同步。

融合与检测头部分先把音频嵌入在空间上广播,即与全一空间张量做外积,使每个空间位置都获得相同的音频向量,再与视觉特征在通道维拼接。随后遵循无锚检测范式设置 3 个头:热图头在融合特征上操作,输出说话与非说话两类的置信图,经 Sigmoid 归一化到零到一;尺寸头只在视觉特征上操作,回归边框宽高;偏移头同样只在视觉特征上操作,回归因下采样引起的亚像素偏移。推理时取热图局部峰值作为候选,每个峰值的位置加偏移确定中心,宽高确定尺寸,类别通道确定说话状态。

多尺度融合块 × 可变形卷积: 多尺度融合块负责把粗尺度特征上采样后与细尺度特征合并,逐级恢复到 1/4 分辨率,分工是兼顾大脸细节和小脸上下文;可变形卷积负责在融合时自适应调整采样位置,分工是处理不同姿态和尺度带来的人脸不对齐,两者组合使融合后的视觉特征对位置偏移更鲁棒。

此处需核对一个实现细节:热图使用音视频融合特征,而尺寸和偏移只用视觉特征。原文的安排理由是位置回归主要依赖视觉几何信息,类别判断才需要视听同步。该分工在复现时不应随意更改,否则热图与边框的监督来源会发生变化。

训练如何组织:数据监督、损失权重与优化设置是什么?

训练数据监督来自人工标注的人脸框和二值说话标签。热图头用逐像素逻辑回归加焦点损失监督,尺寸头和偏移头用只在真值中心位置计算的 1 阶回归损失监督。总损失是三项加权求和,权重分别为热图权重一、宽高权重 0.1、偏移权重一。检测阶段对热图输出用 3 乘 3 最大池化做非极大值抑制,以提取局部峰值,该操作遵循无锚检测的已有做法。

优化器采用自适应矩估计,初始学习率为十万分之一,迭代 40000 次后衰减为原来的十分之一。音频骨干从零训练且音频嵌入维度为 32。视频骨干尝试了 3 维残差网络 18 层,以及更省资源的 3 维移动网络和 3 维混洗网络。残差网络版本在动力学和时刻数据集上预训练,轻量版本仅在动力学数据集上预训练。视觉融合通道数按各骨干最细金字塔层的通道数选取。原文未报告批量大小、总迭代数、数据增强、学习率调度之外的正则化、梯度裁剪和分布式训练细节,这些属于具体缺项,复现时需要自行记录并做对照。

需要区分的是,端到端训练指音频流、视觉流、融合与检测头联合优化,不依赖外部检测器提供的提议。但视频骨干使用了分类预训练权重,因此并非所有参数都从随机初始化开始。复现时应保留该信息条件:冻结还是微调预训练骨干会影响收敛速度和最终精度,原文未明确说明是否冻结,应在复现报告中补记实际做法。

在什么数据、什么指标和什么硬件条件下评测?

数据集采用野外采集的大规模音视频主动说话人检测基准,包含 262 个电影片段,每个约 15 分钟,帧率二十五到三十分辨,共 3650000 帧人工标注,得到 38.5 小时带对应音频的标注人脸轨迹,划分为 120 个训练视频、33 个验证视频和 109 个测试视频。由于测试集标签不可用,原文所有评价都在验证集上进行。复现时必须使用相同划分,否则分数不可比。

主要指标是交并比阈值为 0.5 时的平均精度。定位部分用召回率衡量,即正确检测到的人脸占真值人脸总数的比例;分类部分计算正确检测到的人脸中说话状态预测的准确率。这种拆分有助于判断增益来自找得更准还是分得更准。实时性用实时因子衡量,定义隐含为处理时间与音频时长的比值,越小越快,测量硬件为英伟达 RTX 6000 显卡。原文未给出延迟的均值方差、批量设置和预处理是否计入,也未报告不同人数下的延迟分布,这是复现实时声明时需要补测的边界。

资源状态是正文开源声明的唯一依据。本次未发现来源绑定且完成安全验证的资源,因此不得声称代码、模型或数据已公开。复现应按论文文字重写流程,数据集需按官方渠道获取,预训练权重需记录具体版本。

骨干网络的精度与速度如何权衡?

要回答的问题是:在相同音频骨干和 16 帧 288 乘 288 输入下,不同视频骨干的参数量、计算量、平均精度和实时因子如何变化,指标方向是平均精度越高越好,实时因子越低越快,公平条件是音频分支和输入尺寸固定,评价口径为交并比阈值 0.5 下的平均精度。该比较只覆盖 3 种视频骨干,不涉及其他分辨率或帧数,表前说明到此结束,下面给出整理表。

视频骨干参数量计算量平均精度实时因子
3D-ResNet-1833.2M54.475.80.009
3D-MobileNetV2-1.0x1.5M3.575.30.011
3D-ShuffleNetV1-1.0x0.9M1.870.90.013

表后解释如下:3 维残差网络的平均精度为 75.8,移动网络变体为 75.3,混洗网络为 70.9;参数量分别为 33.2M、1.5M 和 0.9M,计算量分别为 54.4、3.5 和 1.8,实时因子分别为 0.009、0.011 和 0.013。原文指出,尽管残差网络最复杂,但其实时因子最低因而运行最快,原因是运行时间不仅取决于浮点运算量,还受内存访问开销和并行度影响。原文结论是应按系统需求在效率与精度之间权衡选择骨干,后续评价均采用残差网络作为视频骨干,因此后文数字不适用于轻量骨干,未覆盖超过该输入配置的情形。

与只做分类的离线方法相比,分数能直接比吗?

要回答的第 3 个问题是:在相同验证集上,统一检测口径的实时方法与使用真值人脸框的离线和因果方法分数差异多大,比较条件是否一致,指标方向是平均精度越高越好。必须先强调条件不一致:实时方法报告的是包含定位误差的联合精度,其他方法直接用真值人脸做分类,任务明显更容易,原文明确指出后者计算使任务相当容易。表前说明到此结束,下面整理原文对照。

方法类型方法平均精度
offlineMSSG95.6
offlineMuSED95.6
offlineD2Stream95.6
offlineTalk-NCE95.5
offlineLoCoNet94.9
causalLR-ASD causal93.4
causalStreamingASD93.0
real-timeRT-ASDNet r35277.5
real-timeRT-ASDNet r28877.3
real-timeRT-ASDNet r22475.5

表后解释如下:离线方法中 MSSG 为 95.6、MuSED 为 95.6、D2Stream 为 95.6、Talk-NCE 为 95.5、LoCoNet 为 94.9,因果方法中 LR-ASD causal 为 93.4、StreamingASD 为 93.0,本文实时方法 r352 为 77.5、r288 为 77.3、r224 为 75.5。差距主要来自任务定义不同,而非单纯模型能力,原文强调实时方法建立了联合检测与分类在实时约束下的基线,并提供恒定单帧推理成本。原文还按可见人数和人脸尺寸细分:可见脸为 1、2、3 张时本文方法分别为 81.2、75.8、66.4,大中小脸分别为 42.1、66.8、84.1,趋势为脸越大、人越少越好。原文解释为离线方法在放大的真值裁剪上分类,而本文处理固定分辨率全帧,小脸有效像素很少,这是部署时需要重点补验证的场景。

时间长度和空间分辨率分别带来什么,代价是什么?

要回答的第二个问题是:片段长度和输入分辨率如何分别影响联合精度、定位召回和分类准确率,条件是骨干固定为残差网络加正弦音频网络,指标方向均为越高越好,代价是计算量随长度线性增长、随分辨率快速增长,检测只在最后关键帧上进行。表前说明到此结束,下面按原文报告整理,维度列仅用于区分两种实验条件。

维度条件平均精度定位召回率分类准确率
片段长度8 frames73.395.687.7
片段长度16 frames75.895.489.2
片段长度32 frames77.395.789.6
片段长度64 frames77.395.689.8
分辨率224 × 22475.594.389.3
分辨率288 × 28877.395.789.6
分辨率352 × 35277.595.989.9

表后解释如下:从 8 frames 增加到 32 frames,联合精度从 73.3 变化到 77.3,分类准确率(%)从 87.7 变化到 89.6,在 32 frames 到 64 frames 趋于饱和,64 frames 时联合精度为 77.3;定位召回在 95.4 到 95.7 之间几乎不随帧数变化,原文解释为检测只在最后关键帧上进行,更长历史主要改善分类所需的视听同步判断。分辨率方面,从 224 × 224 提升到 352 × 352,联合精度从 75.5 变化到 77.5,定位召回从 94.3 变化到 89.9 区间上移,分类准确率(%)从 89.3 变化到 89.9,说明细粒度面部细节有助于检测,但计算代价增长更快。原文后续采用 32 frames 作为折中,未评测超过 64 frames 的长上下文和非正方形分辨率,复现时不应外推。

哪些结论尚未验证,哪些场景可能失效?

首先是口径差异带来的解释限度。原文明确说明其他方法用真值检测计算平均精度,因此表间差距不能作为同条件胜负。缺失的对照是在同一联合检测口径下重跑离线基线,或给本文方法外接真值框只测分类,两者原文均未提供。在补做之前,只能说实时统一基线已建立,不能说实时方法在分类本身上落后多少。

其次是小脸和拥挤场景。按人数和尺寸细分的数字显示,3 张脸和中小脸条件下性能下降明显,小脸平均精度仅 42.1。这与全帧固定分辨率处理直接相关。原文未报告在夜间、低分辨率、遮挡或快速头部运动下的表现,也未报告误判率随信噪比的变化。对于视频会议等近景少人场景,该限制影响较小;对于远景多人监控或电影广角镜头,需要额外验证。

再次是延迟与资源的测量完整性。实时因子在特定显卡上测量,未说明预处理、视频解码、音频同步和后处理是否计入,也未给出不同人数下的延迟分布。虽然设计上单次前向与人数无关,但实际系统中数据搬运和后处理仍可能随检测数变化。训练资源、推理显存占用和不同硬件上的帧率均未系统报告,因此不能把实时因子直接承诺为端到端系统延迟。

最后是生成式人工智能使用声明。原文说明生成式工具仅用于编辑和润色,作者对科学声明负全责。该信息与方法正确性无关,但提示文字表达经过润色,复现时应以公式、结构和数字为准,而非措辞强度。

若要复现,应先做什么并保留哪些关键设置?

复现的第一步是固定数据与评价口径。获取官方划分的一百二十训练、三十三验证、一百零九测试视频,只在验证集上报告交并比 0.5 的平均精度,同时记录定位召回和分类准确率的拆分。关键帧取片段最后 1 帧,滑动窗口步长和音频视频对齐方式需与原文一致,若原文未详述,应在复现记录中明确自己的选择。

第二步是按原文搭建 3 个分支。音频分支用 80 个核长二百五十一的正弦滤波器、16 kHz 采样、对数压缩、6 个深度可分离卷积块和自适应平均池化,输出 32 维嵌入;视觉分支用预训练的 3 维骨干加多尺度融合,输出 1/4 分辨率特征;融合时音频广播后拼接,热图用融合特征,尺寸和偏移只用视觉特征。损失权重取一、0.1、一,优化器用自适应矩估计,初始学习率十万分之一,40000 次迭代后降为十分之一。骨干预训练来源要如实记录,是否冻结需自行对照。

第三步是做最小可运行验证。先用 16 帧二百八十八分辨率跑通残差、移动和混洗 3 种骨干,核对参数量、计算量、平均精度和实时因子的趋势是否复现;再扫 8 到 64 帧和二百二十四到三百五十二分辨率,确认定位基本不变、分类随上下文改善、64 帧趋于饱和的现象是否出现。延迟必须在目标硬件上重测,并分别记录模型前向、预处理和后处理耗时,以及 1 人、多人场景下的分布,不能只报平均实时因子。

关于可用性,当前没有经验证的公开代码与权重依据,因此应按无公开实现来规划工作量。还需补的验证包括同一联合口径下的离线基线、小脸增强策略、噪声和混响下的鲁棒性,以及长时间运行的稳定性。

何时值得尝试这种统一实时路线?

当应用要求每帧延迟固定且不随人数增长,例如多人视频会议、机器人交互或实时剪辑,且可以接受联合精度低于离线分类上限时,该路线值得尝试。它的核心收益是省去外部人脸检测器和逐脸编码,用 1 次全帧前向同时给出位置和说话状态,并支持端到端优化和模块替换。若场景以近景少人为主,且硬件能容纳 3 维残差骨干,优先用 32 帧和二百八十八或三百五十二分辨率;若资源受限,可换移动网络骨干,但要接受约 0.5 到数个百分点的精度损失,并重测实际延迟而非只看计算量。

当任务只要求对给定真值人脸轨迹做离线分类,或追求基准最高分而不考虑延迟时,不必采用该路线,传统多阶段加长时建模仍是更直接的选择。当场景以远景小脸和高度拥挤为主时,应先补小脸和遮挡验证,再决定是否部署。

回到学习依赖:先确认任务是视听同步判断而非纯语音活动检测,再确认运行阶段是因果实时而非离线,最后才比较分数。记住口径差异:本文的 77.5 是在更难的联合任务上取得的基线,离线方法的九十五左右是在给定真值框下只做分类的结果。复现时保留帧数、分辨率、骨干版本、损失权重和硬件条件,才能让数字真正可比。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总