英文题目:Speaker-Filtered Heterogeneous Graph Network: Toward Privacy-Preserving Multimodal Emotion Recognition

会议身份:conference:interspeech:2026:conference-paper-id:song26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#图神经网络 #隐私保护 #严格因果 #语音情感识别

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Heying Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Jing Han:机构信息未能从会议 PDF 纯文本可靠映射
  • Yandi Zheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Ziping Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多模态对话情感识别(Multimodal Dialogue Emotion Recognition,MDER)输入为对话中每轮话语的文本、音频和视觉特征,输出为情感标签,难点在于全局图传播易混入非目标说话人表示并引入未来上下文泄露。该工作提出说话人过滤异构图网络(Speaker-Filtered Heterogeneous Graph Network,SF-HGN),先用上下文感知图注入(Context-Aware Graph Injection,CAGI)在因果窗口内检索跨说话人线索并写入目标表示,再在单说话人异构图(Single-Speaker Heterogeneous Graph,SS-HG)上做关系感知的图传播,最后拼接三模态节点表示经多层感知机(Multilayer Perceptron,MLP)分类。与全局图方法不同,该链条把跨说话人语义接触限制为一次向量注入,后续消息传递隔离在说话人诱导子图内。在IEMOCAP上取得加权准确率(Weighted Accuracy,WA)68.76%与加权F1(Weighted F1,WF1)68.73%的总体最优,在MELD上取得WA 66.40%与WF1 65.65%的总体最优,方向为提升。该结论局限于两个英语表演型数据集,且IEMOCAP愤怒类塌陷、MELD多数类偏置明显,向多方强噪声或实时部署的外推尚未验证。原文未披露训练时长、硬件与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?为何不能只看当前一句话就判情绪?

本文的输入是一段按时间排列的对话,每句话带有说话人编号和 3 个模态的观测:文本词序列、语音声学信号、人脸视觉信号。目标是为每一句话输出一个情绪标签,在双人数据上是 6 类,在多人数据上是 7 类。初学者容易把任务理解为单句分类,即把当前句的 3 个模态特征拼接后直接分类。

论文强调对话情绪具有蔓延性,当前说话人的情绪会受前文和其他说话人的影响,因此需要建模上下文。但上下文建模带来两个具体风险。第一是隐私风险,若把所有说话人的原始音频、视频、文本表征放在一张全局图上做消息传递,非目标说话人的敏感表征会被直接聚合到目标节点。第二是时序泄露风险,若在离线全图上双向聚合,预测当前句时会无意使用未来话语,这在只能看到过去的实时客服场景中不成立。

第三是模态关系复杂,3 个模态噪声水平不同且未必对齐,简单拼接难以捕捉深层互补。本文的输出是每句话的情绪后验分布取最大者。学习依赖是先理解任务的因果约束与隐私约束,再理解方法如何拆分跨说话人语义注入与单说话人图传播。本文没有发现可验证的开源链接,读者只能依据正文描述复述方法,不能声称代码已公开。

已有路线在图建模、融合与隐私上各留下什么缺口?

第一条路线是会话情绪的序列与图建模。早期双序列长短时记忆网络与对话循环网络用循环结构跟踪说话人与上下文状态,但缺乏对非线性依赖的拓扑表达。随后对话图卷积网络把对话建模为有向图,关系感知图注意力网络与有向无环网络分别引入关系注意力与有向无环结构。

论文指出这类方法多依赖静态图与全局聚合,既带来计算冗余,又忽略实时场景的时序因果约束。第二条路线是多模态融合。从张量融合、多层注意力到跨模态图与注意力集成图卷积,目标都是做深层模态交互。但相关工作提醒,无差别的传播在高噪声下会触发负迁移与语义主导,即某一强模态压制其他模态。

第三条路线是隐私与掩码图学习。差分隐私解耦图卷积、聚合扰动、本地隐私图神经网络等工作研究了拓扑保护与噪声机制,但论文明确指出它们没有直接解决多模态对话在因果推理设置下的说话人级隔离。本文的定位是结构性隔离而非密码学或差分隐私证明,用单说话人诱导子图限制图操作范围,用因果掩码保证只能看过去,用成对跨模态结构减少噪声交互。

问题如何形式化?窗口与子图各约束什么?

设对话有 T 句话,参与者集合有 N 人,每句话的说话人有对应标记。每句话在时刻 t 有 3 模态特征向量,分别对应文本、音频、视觉。对于目标话语,模型只能使用从当前时刻向前数 W 句话的窗口内特征,以及属于该说话人的诱导子图来预测情绪类别。公式表达为在给定窗口特征与子图条件下最大化情绪后验。

窗口 W 在实现中取 12,含义是只看过去 12 句话,不看未来。子图的含义是节点只包含同一说话人的各模态节点,边也只在该集合内部定义。跨说话人的信息不是通过图边直接传播,而是通过上下文感知图注入模块先提炼为紧凑摘要,再只写入目标说话人当前话语的表示中。

随后所有图卷积都只在该子图上执行。这种 2 阶段划分是全文的学习主线:先解决需要他人信息的问题,再解决不能混合他人原始特征的问题。评估时优先看加权准确率与加权 F1,因为 2 个数据集都存在类别不均衡。

五步流水线如何走通一个目标话语?

沿着一个目标话语走一遍流程最容易建立整体感。第一步是多模态特征抽取,文本用预训练 RoBERTa,视觉用在 FER+ 上预训练的 DenseNet,声学用 openSMILE 抽取标准 IS10 特征集,得到每句话 3 个模态的初始向量。第二步是上下文感知图注入,在严格因果窗口内为每个模态独立计算目标话语与过去异说话人话语的注意力,取 Top-K 个邻居加权求和得到注入上下文,并构造冲突特征。

第三步是单说话人过滤,为每个说话人构建独立的异构图,节点是该说话人各话语的各模态表示,初始化为注入后的表示。第四步是异构图传播,按关系类型分别聚合再求和更新,并保留残差连接。第 5 步是情绪分类,把 3 模态节点表示拼接融合后送入轻量多层感知机与 Softmax 得到标签。关键点是跨说话人信号只以摘要形式进入第二步的写入操作,第三步之后不再有跨说话人边。

全局上下文聚合 × 说话人过滤: 全局上下文聚合的分工是把对话中所有说话人的节点放在一张大图上做消息传递,以换取更完整的上下文;说话人过滤的分工是在语义注入完成后只保留目标说话人的节点和边,物理切断非目标原始特征在图卷积中的直接传播。二者搭配的理由是情绪会受他人影响但不应为此混合他人原始表征,组合意义是先用紧凑摘要保留跨说话人影响,再用子图传播维持说话人级隐私边界。

下面这张架构图把上述 5 步划为 5 个区域,从左到右依次是特征抽取、上下文感知注入、单说话人异构图、交替图传播、分类输出,阅读时先看主干箭头再看分支汇合,图中标注的 5 个步骤与正文文字一一对应。

看图路径: 1. 从最左侧多模态数据出发,沿 Zone1 到 Zone5 自左向右追踪主路径;2. 观察 Zone2 中 Top-K Attention 与 Causal Window 如何汇入 Event Injection Bridge;3. 对比 Zone3 中 Speaker_A 与 Speaker_B 的子图是否完全分开、无跨说话人边;4. 查看 Zone4 残差连接与聚合算子如何得到融合向量再送入分类器

原论文 Figure 1:Architecture of SF-HGN. (1) Extract multimodal features from raw data.

论文图 1。原论文 Figure 1:“Architecture of SF-HGN. (1) Extract multimodal features from raw data.”。

从像素上看,Zone1 左侧显示 3 路编码器分别输出文本、音频、视觉嵌入,Zone2 显示 3 模态各自的说话人序列通过 Top-K 注意力汇入中间的事件注入桥并受因果窗口约束,中间的单说话人过滤漏斗把数据流切分为上下两条独立支路。每条支路内部又拆为 3 个成对图,Zone4 对每张小图做异构图卷积层加残差再经拼接求和得到融合向量,最后由全连接分类器输出情绪标签。该图支持的判断是隐私边界位于注入桥与子图构建之间,图传播阶段确实不再跨说话人混合;待验证的是这种结构隔离在形式化隐私度量下的强度,原文未给出差分隐私预算。

注入模块如何只从过去的他人话语中挑选线索?

上下文感知图注入要回答的是在不泄露未来的前提下,哪些过去的他人话语真正触发了当前情绪。对每个模态,模型对目标话语与过去话语分别做查询、键、值投影,计算缩放点积再加相对时间距离偏置,得到原始分数。该分数的输入是两句话在该模态的隐表示,目标是衡量过去话语对当前情绪的触发强度。

接着用二值掩码强制因果完整性,掩码把未来、超出窗口、同说话人及填充位置标记为无效,对应分数减去无穷大,相当于在归一化前彻底屏蔽。然后为抑制长尾噪声,只保留每个模态得分最高的 K 个邻居,K 在实现中取 2,对保留邻居做归一化得到权重并加权求和值向量,形成注入上下文向量。比如当前说话人突然道歉,前两句他人的质问在文本与音频上得分最高,则这两句的摘要被写入当前表示。

为显式建模转折,模块还对当前状态与注入上下文分别做层归一化,再计算线性映射下的差值拼接逐元素乘积,得到情绪动态特征。最后把原始状态、注入上下文与动态特征拼接并经线性映射,得到注入后表示,作为后继单说话人图的节点初始特征。

因果掩码 × 跨说话人注意力: 跨说话人注意力的分工是为目标话语在每个模态内独立计算与过去话语的相似度并加权求和;因果掩码的分工是把未来、窗外、同说话人及填充位置标记为无效并减去无穷大。二者搭配是因为不加约束的注意力会看到未来并引入自增强,组合后只允许严格过去窗口内的异说话人线索进入注入表示,保证时序因果一致。

该设计报告的效果是既保留跨说话人情绪线索,又避免未来泄露与同说话人自循环。复现时需注意注意力是按模态独立计算的,不能把 3 模态拼成一个向量算 1 次注意力;掩码必须在 Top-K 之前应用,否则会选到未来或同说话人节点。原文未报告查询键维度与位置偏置的具体参数化形式,复现时只能按常规缩放点积加可学习相对偏置实现并注明缺项。

情绪动态冲突特征 × 事件注入: 事件注入的分工是把检索到的跨说话人上下文向量写入目标话语表示;情绪动态冲突特征的分工是对当前状态与注入上下文做归一化差值与逐元素乘积再拼接映射,显式刻画不匹配。搭配原因是情绪转折常表现为与前文的不一致,组合后模型既有外部触发摘要又有内部失配度量,更易捕捉突变。

单说话人异构图如何组织时序与模态互补?

单说话人异构图要回答的是在不接触他人节点的前提下,如何同时利用时间演变与模态互补。对每个说话人,节点集合是该说话人所有话语乘以 3 个模态,每个节点代表某句话的某个模态,初始特征即上一步的注入表示。边分为两类,模态内边连接同一模态在同一时间窗口内的节点,用于传递该模态的情绪轨迹;模态间边连接同一话语的不同模态节点,且明确拆为 3 组成对结构,而非把 3 模态全连成一个超边。

论文称这种成对设计有助于减少过平滑,即避免多层传播后所有节点表示趋同。传播时按关系类型分别维护归一化邻接矩阵,对每种关系做邻接乘特征再乘可学习权重矩阵,经激活后跨关系求和,并加上本层输入作为残差。残差的作用在消融中显示为稳定训练与缓解深层过平滑。传播结束后,把同一话语的 3 个模态节点表示拼接为融合表示。

举例来说,某说话人的文本节点可以通过模态内边看到自己数句前的文本状态,也可以通过模态间边看到同一时刻的音频与视觉节点,但看不到另一说话人的任何节点。

异构图传播 × 模态间边: 异构图传播的分工是按关系类型分别做归一化邻接聚合再求和,区分时序边与跨模态边;模态间边的分工是把同一话语的文本减音频、文本减视觉、音频减视觉两两连接。搭配理由是简单融合无法处理模态噪声与不对齐,组合意义是在单说话人子图内同时保留模态内时序演变与模态间互补,减少无差别传播带来的过平滑与负迁移。

该图结构的隐私含义是结构性隔离:非目标节点的原始特征不参与目标子图的消息传递。需要区分的是这不等于差分隐私保证,原文未报告噪声规模或隐私预算,也未测量成员推断等攻击下的误判率,因此不能承诺满足某种隐私强度,只能说减少了直接传播。

监督信号从哪里来?优化与超参数如何设置?

训练阶段的监督来源是话语级情绪标签,损失为交叉熵加 L2 正则。设训练样本数为 M,类别数为 C,对每个样本的真实独热标签与预测 Softmax 分布计算负对数似然并平均,再加权重衰减系数乘以全部可训练参数的平方范数。预测头是轻量多层感知机,输入为融合表示,输出为类别逻辑向量。

优化器采用 Adam,学习率 10 的负 4 次方,丢弃率 0.1,隐维度 128,窗口 W 为 12,Top-K 的 K 为 2。原文未明确报告训练轮数、早停策略、批量大小、学习率调度、梯度裁剪与参数初始化方式,也未说明编码器特征是冻结还是联合微调,因此复现时必须把特征抽取视为缺项:若直接冻结预训练编码器,只训练注意力、图卷积与分类器,需在报告中注明该选择。

梯度路径按描述经过分类器、融合拼接、异构图卷积、注入映射、注意力权重回到投影矩阵,但原文未给出是否对注入上下文停止梯度,故不应猜测存在停止梯度,只能按端到端可导实现。评估指标包括准确率、F1、加权准确率与加权 F1,其中后两者为主要指标。

在哪些数据与划分上测?基线如何选?

实验在两个广泛使用的多模态对话情绪基准上进行,比较的问题是所提方法在相同话语划分与相同 3 模态输入下,是否在加权准确率与加权 F1 上优于序列、图与上下文增强 3 类代表性方法。指标方向均为越高越好,加权指标越高表示在不均衡下整体判对与少数类召回更好。基线包括序列类的 bc-LSTM、DialogueRNN、CMN,图类的 DialogueGCN、RGAT、MMGCN、LR-GCN、DialogueCRN,以及上下文增强的 CoMPM 与 COGMEN,共 10 个对照。

下表提出数据集规模与划分问题,公平条件是同一数据集的同一训练测试划分,指标方向不适用于此表,仅用于确认任务难度与类别数,表中对话数与话语数均为原文直接报告的规模。

数据集对话数话语数类别数训练比测试话语数
IEMOCAP1517,43365,810/1,623
MELD1,43313,708711,098/2,610

该表显示 MELD 在对话数与话语数上远大于 IEMOCAP,且为多人多说话人场景,类别数也多一类,因此跨说话人噪声更大、少数类更稀疏。IEMOCAP 的 6 类为高兴、悲伤、中性、生气、兴奋、沮丧,MELD 的 7 类包括中性、惊讶、恐惧、悲伤、喜悦、厌恶、愤怒。这一规模差异解释了为何后文在 MELD 上更强调少数交互敏感类别的鲁棒性,而在 IEMOCAP 上更关注双人冲突中的误判。原文未报告说话人无关划分或交叉验证方差,复现时应固定随机种子并多次运行报告均值与标准差。

主结果显示了什么收益?哪些类别并未胜出?

主结果要回答的是在可运行的相同基准下,单说话人过滤加因果注入是否带来总体收益。在 IEMOCAP 上论文报告总体最优,在 MELD 上同样报告总体最优,但在频繁类上并非最高。下表先聚焦 IEMOCAP 的总体与分类别对照,比较问题是总体加权指标是否提升、代价出现在哪些类别,公平条件是同一划分与同一 3 模态特征,指标方向为越高越好,表中数值为原文直接报告的百分比裸值。

方法HappyAngryExcitedWAWF1
DialogueCRN52.8663.8777.8268.2768.43
LR-GCN55.5069.0074.0068.5068.30
SF-HGN67.2446.9779.3168.7668.73

该表支持的判断是 SF-HGN 用总体约 0.26 至 0.46 个百分点的加权准确率提升换来了 Angry 类别约 16 至 22 个百分点的下降,这是一个具体代价。可能的解释是单说话人过滤减少了跨说话人噪声,但也削弱了愤怒常依赖的对方挑衅信号,而情绪动态特征未能完全补偿。在 MELD 上论文报告的总体数字同样为最优,但必须附带类别级反例,不能推广为所有情绪都更好。

加权准确率 × 加权 F1: 加权准确率的分工是按类别样本量加权后的总体判对比例,反映大类主导下的整体正确性;加权 F1 的分工是按类别样本量加权的精确率与召回率调和,反映不均衡下少数类的漏检代价。二者搭配是因为 2 个数据集都存在明显类别不均衡,组合报告才能同时看到多数类偏置与少数类鲁棒性,避免只看准确率掩盖少数类失效。

为进一步看误判结构,需要检查混淆矩阵的像素细节,重点是多数类对少数类的吸引,上图为 IEMOCAP 6 类、下图为 MELD 7 类,横轴为预测标签、纵轴为真实标签,颜色越深表示该格占比越高。

看图路径: 1. 先确认上图为 IEMOCAP 六类、下图为 MELD 七类,横轴为预测、纵轴为真实;2. 比较对角线深色格数值,找出高召回类与低召回类;3. 观察 Angry 行向 Neutral 列、Fear 行向 Neutral 列的大幅偏离格;4. 结合颜色深浅判断多数类 Neutral 对少数类的吸引效应

原论文 Figure 2:Confusion matrices on IEMOCAP (top) and MELD.

论文图 2。原论文 Figure 2:“Confusion matrices on IEMOCAP (top) and MELD.”。

从像素读数看,上图 IEMOCAP 矩阵显示 Excited 行在 75.1 处深色集中,对角线清晰,而 Angry 行仅 43.1 落在对角,37.5 落入 Neutral 列,形成明显的横向泄露。下图 MELD 矩阵显示 Neutral 行 76.5 高度集中,Fear 行 56.0 被判为 Neutral、仅 16.0 判对,Disgust 行 55.9 被判为 Neutral、仅 20.6 判对,Sadness 行也有 35.6 落入 Neutral。这些像素支持正文关于类别不均衡导致多数类偏置的解释,也表明即使总体加权指标最优,少数类召回损失依然严重。阅读时不应把对角线平均值当作总体加权准确率,因为后者还需按样本量加权。

拿掉每个组件后下降多少?开销又降了多少?

消融要回答的是每个模块是否必要,以及高效是否以精度为代价。比较问题是去掉事件注入、说话人过滤、情绪动态、残差连接后,加权指标下降幅度各为多少;计算比较问题是在相同设置下参数量、推理时间与显存是否更低。公平条件是同一数据划分与同一超参数,仅改动目标模块。指标方向为精度类越高越好,开销类越低越好。

下表同时给出精度消融与复杂度对照,精度部分表头中 WA 与 WF1 为原文直接报告的裸值,复杂度部分参数量单位为百万、推理时间单位为毫秒、显存单位为兆字节,表中数字均为原文直接报告,未做四舍五入。

条件IEMOCAP WAIEMOCAP WF1MELD WAMELD WF1
完整模型68.7668.7366.4865.50
去掉事件注入66.5266.4864.1263.25
去掉说话人过滤67.1066.9565.0564.18
去掉情绪动态67.8567.7265.4064.62
去掉残差连接65.4565.1263.2862.15

该表显示去掉残差连接下降最大,去掉事件注入次之,说明二者分别稳定传播并提供跨说话人线索。说话人过滤的下降支持其防止特征污染的作用,情绪动态的下降幅度较小但在 2 数据集上一致。需要指出的边界是消融表中完整模型在 MELD 上的数字与主结果文字报告的总体数字不完全一致,引用时必须保留两种写法并注明冲突,不能自行调和。

复杂度方面原文报告 DialogueGCN 参数量 2.09、推理时间 893.5、显存 56,DialogueRNN 参数量 15.35、推理时间 141.2、显存 72,而 SF-HGN 参数量 1.19、推理时间 51.3、显存 18,支持低开销的判断。但训练资源、推理开销与实际延迟应分别讨论,总体趋势不等于每步都成立,且原文未说明硬件与批量大小,复现时需在相同条件下重测。

哪些结论不能下?隐私与泛化的边界在哪里?

首先是隐私边界。论文用单说话人诱导子图建立结构隐私边界,减少非目标特征的直接传播,但这属于隔离设计而非差分隐私证明。原文引用的差分隐私图工作仅作为动机,未报告隐私预算、噪声机制或攻击实验,因此不能声称满足某种隐私强度,也不能承诺泄露量得到量化改善。

其次是因果边界。因果掩码阻止了未来信息泄露,适合实时推理,但这也意味着模型无法利用未来话语消解歧义,在离线转写场景中可能不如双向模型。原文未做在线与离线条件的对照,复现时若放开未来窗口,需单独报告以避免不公平比较。

第三是类别边界。IEMOCAP 的 Angry 频繁误判为中性,MELD 的恐惧与厌恶大量被吸入中性,说明在低唤醒冲突与极端不均衡下方法仍失效。论文将前者归因于隐性低唤醒冲突与训练样本稀缺,将后者归因于中性类占比高的多数类偏置,这些属于有限解释而非因果证明,待验证。最后是资源声明缺项,未发现可验证的开源链接,因此不能写代码或模型已公开,只能说复现需自行实现。

若要复现,应按什么顺序核对哪些细节?

第一步核对数据与划分。按 IEMOCAP 的 151 段对话、7433 句话、6 类、5810 比 1623 划分,以及 MELD 的 1433 段对话、13708 句话、7 类、11098 比 2610 划分准备数据,确认说话人编号与 3 模态时间对齐方式。原文未说明视觉缺失帧与音频静音段的处理,遇到缺项应记录为未知而不猜补零或插值。

第二步核对特征抽取。文本用 RoBERTa、视觉用 FER+ 预训练 DenseNet、声学用 openSMILE 的 IS10 特征集,需明确冻结还是微调,原文未报告,首次复现建议冻结编码器以减少变量。第三步实现因果 Top-K 注入。窗口 W 设 12,K 设 2,注意力按模态独立,掩码在 Top-K 前屏蔽未来、窗外、同说话人与填充,位置偏置编码相对距离,冲突特征用层归一化后差值拼接乘积。

第四步构建单说话人异构图。节点为说话人内话语乘模态,边为模态内时序边加 3 组成对模态间边,传播按关系分别聚合再求和加残差,隐维度 128。第 5 步训练分类器。用 Adam 学习率 10 的负 4 次方、丢弃率 0.1、交叉熵加 L2 损失,以加权准确率与加权 F1 为主要依据,多次运行报告均值方差。常见误解是把说话人过滤理解为删除跨说话人信息,实际上跨说话人信息已通过注入摘要保留,删除的只是原始特征的直接图传播。

何时值得尝试这种先摘要后隔离的顺序?

当任务同时满足 3 个条件时值得尝试:对话为多说话人且含敏感音频视频,不希望非目标原始特征参与目标节点的图聚合;推理只能看到过去,需要严格因果;模态噪声大且不对齐,需要区分模态内时序与模态间互补。此时可先实现因果 Top-K 注入加单说话人子图的最小版本,再逐步加入情绪动态与残差。

若任务允许使用未来上下文或对愤怒等依赖对方挑衅的类别要求极高召回,则需谨慎,因为过滤可能削弱关键触发信号。若需要形式化隐私保证,还需补充差分隐私机制与攻击评估,不能仅凭结构隔离做出承诺。记住它的方法是先把他人的话提炼成一句话摘要塞给当前句,再把每个人关进自己的小图里各自更新,最后只用自己的 3 模态状态判情绪。这种先摘要后隔离的顺序是全文的核心,也是与全局图方法最根本的区别。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总