英文题目:Modeling Turn-Taking with Semantically Informed Gestures
会议身份:
conference:eacl:2026:conference-paper-id:2026.findings-eacl.106
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #混合专家模型 #多模态学习 #轮次切换
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Varsha Suresh:机构信息未能从会议 PDF 纯文本可靠映射
- M. Hamza Mughal:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Theobalt:机构信息未能从会议 PDF 纯文本可靠映射
- Vera Demberg:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多方对话需在停顿边界判断同一说话人保持还是交出话轮,输入为文本语音与上身运动,输出为保持/交出二分类,难点在于含糊过渡处词义与韵律信号弱且语义手势与话语结构对齐弱、标注主观性强。该工作先在多方桌游运动语料上补充表意隐喻指示话语四类语义手势标注并按200毫秒静音阈值切分停顿单元得到约12k实例,为后续建模提供语义监督与评测单元。接着用预训练句子嵌入与Wav2Vec2抽取文本与音频表征,并用向量量化变分自编码器加语义分类器学习手势表征,使手势编码携带类型语义。然后以门控混合专家网络按上下文动态加权三路专家输出并经线性层预测,门控权重显式建模互补性。与拼接或低秩融合固定处理多模态不同,语义对齐使手势与语音文本更易对齐调用,从而在语音模糊处补足意图信号。在DnD Gesture++测试集任务下,Text+Audio+Gesture模型的宏平均F1指标为69.9,高于Text+Audio基线的67.9。该结论适用边界受限于游戏域内停顿单元二分类,尚未验证会议任务型对话跨文化场景及重叠语音与在线流式决策,训练成本对应硬件为单块NVIDIA V100上批量32训练20轮。
🔗 开源与复现资源
- 第三方资源:https://archive.mpi.nl/tla/elan — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/m-bain/whisperX — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文的输入是固定的 3 类证据加官方原图像素,不引入外部评价。目标是让刚进入语音音乐音频方向的研究生能复述方法并核对实验条件。必须保留的信息包括数据规模与划分、标注类别与一致性、模型输入表示与融合公式、训练超参数与硬件、主结果与消融的比较条件。
输出是 1 篇中文技术解读,按学习依赖从任务到方法再到实验展开。多方对话的轮次管理是本文的起点。日常对话里谁接着说、何时继续、何时交出话轮,依赖词汇内容、韵律以及手势和注视等多通道线索。参与人越多,预判边界越难。已有计算模型多用词法和韵律,本文要补的是语义手势这一路。
白话说,语义手势就是跟着意思走的手势,英文叫 semantic gestures,包括描绘具体物体的图标手势、表达抽象概念的隐喻手势、指向参照物的指示手势,以及组织话语结构的话语手势。与之相对的是节拍手势,英文叫 beat gestures,它跟着语音节奏打拍子,与音频里的韵律高度重叠。
语义手势 × 节拍手势: 语义手势指与说话内容意义对齐的手势,负责携带指称和话语结构信息,节拍手势指与韵律节奏对齐的手势,负责标记重音和节奏,二者搭配的理由是论文只想补文本和音频之外的意义信号,所以排除已与音频重叠的节拍手势,组合意义是用语义分支提供互补的保持或让渡线索。
论文的判断是节拍手势的信息音频里已经有了,再加 1 遍意义不大,而语义手势携带的是词汇和韵律之外的意义和结构信息,可能在语音线索模糊的过渡处起作用。教学例子仅为例子:比如一个人说到列举时摊开双手,这类组织话语的动作可能暗示话还没讲完或准备交接。但论文不把单个例子当证明,真正的证据要看受控对比中加入语义手势后指标是否稳定提升。
同输入同目标的前人路线与本文的差别在哪?
轮次预测的前人路线可以按输入和运行阶段对照。早期对话系统用固定静音阈值切边界,输入只有语音活动检测,目标是找到停顿即切分,运行阶段是规则判断。后来数据驱动方法加入句法和语用线索,输入是对话转写文本,目标是预测下一个动作是保持还是转换,代表工作有用大语言模型思路的 TurnGPT。
接着多模态方法加入韵律和面部特征,输入是文本加音频加视觉,目标仍是 2 分类或话语结束预测,融合方式有用拼接和低秩融合等。手势方向的前人工作多在单人或脚本数据上做语义类型标注,例如 SAGA 和 BEAT,输入是表演性动作加语音,目标是生成或分类,缺少自然多方互动。
DnD Group Gesture 数据集提供了 5 人桌游的全身动作、手指细节、同步音频和转写,输入自然且多方,但缺少语义类型标签。本文的差别是同一输入同一目标下的增量:在同一多方自然对话上补密集语义标注,再在同一文本音频专家下对比是否加入语义手势,不把类别差异当同条件胜负。相关工作还提示话语手势常与让渡相关,表征性手势常与保持相关,但那是语言学观察,不是本文模型的因果结论。
轮次预测在这里被定义成什么可计算问题?
本文把连续多方对话转成离散的预测实例。做法是按静音切出语间停顿单元,英文叫 Inter-Pausal Units,简称 IPUs,指被静音包围的连续语音段,每个单元的结尾被视为过渡相关位置,英文叫 Transition Relevance Place,简称 TRP,指可能发生说话人变化的位置。
标注规则是看停顿后谁先说话:若同一说话人继续则记为保持,英文叫 hold,若另 1 位参与者接着说则记为让渡,英文叫 yield。切分用 200 ms 静音阈值,过短的单元与相邻话语合并。
保持 × 让渡: 保持指当前说话人在停顿后继续说,负责维持话轮不换人,让渡指下一段由另 1 位参与者接话,负责发生说话人切换,二者搭配的理由是多方对话的每个停顿点都必须 2 选 1,组合意义是把连续对话转成可评测的 2 分类预测任务。
这样定义后,任务就是给定当前轮次的文本、语音和手势,预测下一个标签是保持还是让渡。数据结果是约 12000 个轮次,其中保持约 7000 个,让渡约 5000 个,训练验证测试按 70 %、10 %、20 % 划分。类别不平衡是后续解读必须记住的条件,多数类基线天然偏向保持,少数类让渡的分数更能反映融合是否真正改善了难例。
3 路专家如何分工,门控如何融合?
方法全景可以沿 1 个样本走 1 遍。假设当前轮次有 1 句话的转写、1 小段语音波形和同一时段的上身关节点序列。文本分支先用预训练句子嵌入得到向量,音频分支用 Wav2Vec2 得到向量,手势分支用语义手势编码器得到向量。然后 3 个向量各自经过 1 个多层感知机或变换器构成的专家,得到文本专家输出、声学专家输出和手势专家输出。
门控网络看 3 路上下文算出 3 个权重,加权求和得到融合表示,最后经线性分类器输出保持或让渡。
混合专家模型 × 门控网络: 混合专家模型指文本专家、声学专家和手势专家各自处理 1 种模态,负责给出各自的轮次证据,门控网络指根据当前上下文算出 3 个模态权重的模块,负责动态决定听谁的,二者搭配的理由是不同轮次可靠的线索不同,组合意义是得到加权融合表示再送入 2 分类器判保持或让渡。
下面这张总览图把 3 条路径和门控回路画在了一起,读图时先走主路径再看权重线,才能理解动态加权的含义,该导读覆盖左侧输入区到右侧融合输出的完整链路。
看图路径: 1. 沿左侧输入经中间编码器到右侧专家的 3 条横向主路径走 1 遍;2. 确认文本经句子嵌入、语音经声学嵌入、手势经语义手势编码器的分工;3. 看下方门控网络用虚线回连到融合加号的权重控制线

论文图 2。原论文 Figure 2:“MoE modeling of turn taking”。
从像素看,左侧粉色大框是输入区,自上而下是转写、语音波形和骨骼示意。中间是 3 个编码器方块,分别标有文本编码、声学编码和语义手势编码器,输出符号对应文本、语音和手势特征。右侧绿色大框是混合专家区,3 个专家上下排列,下方黑色条是门控网络,虚线向上连到每个专家,实线箭头汇到右侧的融合加号。教学含义是编码器负责把原始信号变成可比的向量,专家负责把向量变成轮次证据,门控负责按上下文分配话语权。这种设计让作者可以直接读门控权重来分析各模态的贡献,也为后文比较语义与非语义手势提供了同一框架。
手势表示怎样注入语义,融合公式如何计算?
手势组件分 2 步。步骤 1 训练向量量化变分自编码器,英文叫 VQ-VAE。输入是相对骨盆归一化并固定平移的上身关节点位置序列,目的是只建模手臂和手部动作。编码器用基于残差网络的卷积结构把动作压成连续词元,每个词元经码本量化成离散嵌入,再由解码器重构输入动作,训练目标包含重构均方误差。
步骤 2 注入语义:在量化嵌入上接线性分类器,用 4 类语义标注加 1 个无类做监督,无类包含节拍和其他非语义手势,训练时忽略无类的交叉熵,只让 4 类产生梯度。语义损失权重为 0.1,重构损失权重为 1。得到码本嵌入后,每个轮次的手势词元序列再送入 1 层变换器编码器,前馈维度 128,4 头注意力,平均池化得到固定长度的手势专家表示。
向量量化变分自编码器 × 语义对齐: 向量量化变分自编码器指把连续上身关节点序列压缩成离散码本词元再重构的编码器,负责学到可重用的动作表示,语义对齐指在量化嵌入上加手势类型线性分类的交叉熵损失,负责把动作词元推向可区分的语义簇,二者搭配的理由是纯重构只保动作形状不保意义,组合意义是让手势专家输出能与文本和音频对齐的语义表示。
下面这张手势编码图展示了重构闭环与语义分支的位置,读懂它就能复述梯度来源,该导读覆盖从左侧输入骨骼到右侧重构输出的双路监督结构。
看图路径: 1. 从左侧骨骼序列经蓝色编码器到中间量化模块再到右侧解码重构的闭环;2. 看上方手势码本中离散编号色块与量化前后符号的对应;3. 看下方语义对齐虚线框中线性分类器指向 4 类手势的箭头

论文图 3。原论文 Figure 3:“Learning semantically-aligned gesture repre- sentations.”。
从像素看,最左侧是 4 帧骨骼动作输入,最右侧是 4 帧重构输出,中间蓝色竖条是编码器、粉色竖条是解码器。顶部虚线框是手势码本,多个色块表示离散编号。中间白色框是向量量化,把连续符号变成量化符号。下方虚线框是语义对齐,绿色框是线性分类器,箭头指向话语、指示、隐喻和图标 4 类,绿色虚线表示量化嵌入分出 1 路去做分类。这种画法对应 2 个监督来源:重构保形状,分类注语义。
融合计算的目标是对 3 个专家输出做上下文加权。记模态为 m,输入特征为 xm,专家输出为 fm(xm),门控权重为 wm,融合表示为加权和。符号含义是 xm 是各模态编码后的向量,fm 是各专家映射,wm 是经 softmax 归一化的非负权重,和为 1,目标是让可靠模态在当前样本占更大比重。原文给出的实现是先拼接再经 softmax 算权重,然后加权求和,最后送线性分类器。
\[hfused = PM m=1 wm · fm(xm).\]该公式只描述融合时刻的前向加权,不规定门控网络内部结构和梯度是否截断,原文未给出门控的具体层数和是否停止梯度,因此复述时不应脑补。文本和音频特征来自冻结的预训练嵌入再经可训练的多层感知机投影,手势变换器和门控与分类器联合训练,这些是原文明确的更新范围。
标注和训练按什么顺序操作,参数如何设置?
训练 1 词在这里包含 2 类构造:数据标注构造和模型参数训练。先讲标注构造,因为它是语义监督的来源。原 DnD 数据有 4 个记录会话共 6 小时,5 位英语参与者。标注员在 ELAN 中按人分轨,结合小组对话语音和多视角视频判断谁做了手势并标出起止与类型,工具当前可用,转写用 WhisperX,工具当前可用。2 名英语学生标注后作者抽样核验并清洗冲突。
结果是 2663 个语义实例,约每小时 444 个标签,密度高于 BEAT 的每小时约 288 个。类别分布是指示最多,话语和图标居中,隐喻最少。一致性平均 Cohen kappa 为 0.52,话语类最低,因为它按交际功能而非形状定义,主观性强。
下面这张标注示意图把时间轴标注与 4 类示例对应起来,是理解标注依赖语音上下文的关键,该导读覆盖左侧 ELAN 界面与右侧示例小窗的对应关系。
看图路径: 1. 先看左侧多人围桌远景与下方时间轴上按人分轨的标注条;2. 再看右侧 4 个小窗的手势截图与对应语音转写短语;3. 核对 4 类标签名与示例动作的对应关系

论文图 1。原论文 Figure 1:“Gesture Type Annotations. Time-aligned la- bels contain semantic gesture types, that are determined by speech context.”。
从像素看,左侧是大窗口的多人围桌远景和 ELAN 界面,下方时间轴有多条按人命名的手势轨道,红色箭头指出某段标注区间。右侧自上而下 4 个小窗分别是图标、隐喻、指示和话语示例,旁边配有语音转写短语。底部红色问题句点出研究问题。解释是标注员必须同时看动作形状和听到的话,才能区分指向动作是指示还是组织话语是话语类,这也解释了为何话语类一致性低。复现时应保留同一标注流程和双模态依据,不能只看骨骼坐标就定类型。
再讲参数训练。手势 VQ-VAE 训练 120 轮,残差块数编码器解码器各 2,嵌入维度 256,码本大小 256,学习率 3e-4,优化器 AdamW,批大小 512。手势变换器为 1 层。混合专家训练在 1 张 NVIDIA V100 上,批大小 32,训练 20 轮,学习率从 1e-4、5e-5、1e-5 中调优,选 5e-5 最好。结果平均自 3 个随机种子。原文未报告搜索之外的权重衰减、早停 patience 和解码器细节,复现时应标为缺项而不猜测。
数据划分、基线条件和指标方向是什么?
实验按问题组织。第 1 个问题是加入身体运动是否超越文本加音频,第 2 个问题是语义监督是否优于原始动作特征。比较条件是同一混合专家框架下只换模态组合或只换手势表示,保证文本音频专家不变。基线包括多数类、1 模态文本音频手势、2 模态组合和文本加音频加手势组合。
融合对照包括拼接融合和低秩融合等已有方法,用同一专家以保证公平。指标是准确率和宏平均 F1,以及保持和让渡各自的 F1,方向都是越高越好,但由于保持占多数,宏平均和让渡 F1 更能反映对少数类的改善。统计上报告了 p 小于 0.05 的显著性,聚合是 3 种子平均。
为核对数据规模,先整理标注与轮次划分的宽表,表前提问是语义监督的原料是否充足且划分是否可复现,公平条件是同一 6 小时来源和同一 2 分类定义,指标方向是样本数越多监督越稳定但不直接等于性能。
| 模态组合 | 准确率 | 宏平均 F1 | 保持 F1 | 让渡 F1 |
|---|---|---|---|---|
| 文本 | 68.8 ±0.5 | 66.6 ±0.4 | 75.1 | 58.2 |
| 音频 | 67.1 ±0.5 | 63.2 ±1.6 | 75.1 | 51.3 |
| 手势 | 66.2 ±0.2 | 61.2 ±1.6 | 75.1 | 47.4 |
| 文本加音频 | 69.7 ±2.1 | 67.9 ±1.2 | 74.9 | 61.1 |
| 文本加音频加手势 | 71.5 ±0.3 | 69.9 ±0.1 | 76.7 | 63.1 |
| 文本加音频加手势无语义 | 70.4±0.4 | 68.7 ±0.5 | 75.9 | 61.5 |
该表显示文本是 1 模态中最强,手势单独最低,3 模态语义版最高,语义版高于无语义版。代价是手势单用提升有限,说明它是互补而非替代。未胜出项是手势无语义版在融合中仍低于语义版,这是后文讨论语义对齐价值的边界。
为核对可复现性,再整理轮次与训练预算的宽表,表前要问的是计算成本与划分是否交代清楚,条件是同一 200 ms 切分和同一硬件,指标方向是轮次越多估计越稳、预算越透明越可比。
| 数据划分 | 轮次数量 | 类别构成 | 训练预算 | 硬件与优化 |
|---|---|---|---|---|
| 标注总量 2663 | 图标 724 隐喻 151 | 指示 1155 话语 633 | 语义损失权重 0.1 | 重构权重 1 学习率 3e-4 |
| 标注密度每小时 444 | BEAT 每小时约 288 | 一致性 kappa 0.52 | 变换器 1 层前馈 128 | 4 头注意力平均池化 |
该表说明类别不平衡和划分比例,复现时应先按同一阈值切 IPUs 并合并短单元,再按同一比例划分,否则标签分布变化会直接改变多数类基线。训练成本分 2 段,手势表示训练较重而融合训练较轻,推理延迟和实时帧率原文未测量,不能承诺实时性。
3 模态是否稳定超过文本加音频,语义监督带来多少增益?
主结果的测法是同一框架下比较 1 模态、2 模态和文本加音频加手势组合。与谁比的条件已在上一节交代,关键是保留文本加音频这一最强 2 模态基线和可运行的文本加音频加手势策略。原文报告文本是 1 模态中最强,其次音频,手势单独最低且语义与非语义差别很小,说明手势是互补而非替代。在融合中加入手势后性能持续提升,文本加音频加手势组合最高,语义对齐版本显著优于非语义版本和文本加音频版本。
下面这张权重图解释了增益的机制归因,读图前要明确比较问题是语义监督是否改变了门控分工,公平条件是同一测试样本上的平均权重,指标方向是权重越高表示该模态被更信任,该导读覆盖 3 组柱子与 2 种颜色的比较顺序。
看图路径: 1. 先确认横轴 3 个模态分组与纵轴平均权重的含义;2. 比较每组内蓝色非语义与橙色语义 2 根柱子的高低;3. 重点看手势柱在语义监督后是否抬高、音频柱是否回落

论文图 5。原论文 Figure 5:“MoE modality weight contributions for se- mantic vs w/o semantic gesture representations”。
从像素看,横轴是文本、音频、手势 3 组,纵轴是平均权重,范围 0.0 到 0.4 以上。每组有蓝色非语义和橙色语义 2 根柱子。可见音频在非语义时最高超过 0.4,语义后回落到 0.4 左右。文本橙色略高于蓝色。手势橙色明显高于蓝色,从约 0.17 升到约 0.21。解释是语义对齐让手势和文本更可信,门控把一部分权重从音频转给手势和文本,这支持了跨模态对齐改善融合的判断,但只是相关性证据,不是手势导致文本变好的因果证明。
按手势类型的细粒度结果用原表呈现,表前的问题是不同语义类型是否提供不同轮次线索,公平条件是同一文本加音频加手势模型按测试样本中出现的类型分组评保持和让渡 F1,指标方向同上越高越好。
| Gesture | Type hold | yield |
|---|---|---|
| Discourse | 78.3 | 74.1 |
| Deixis | 78.2 | 65.4 |
| Iconic | 72.5 | 58.3 |
| Metaphoric | 89.5 | 66.7 |
| Overall | 76.7 | 63.1 |
表后解释是话语类在让渡上相对更强而隐喻类在保持上很高,指示和图标居中,总体保持高于让渡。这支持了语言学观察中话语手势偏让渡、表征性手势偏保持的趋势,但必须说明代价和反例:隐喻样本仅 151 个,其 89.5 的高保持分可能受小样本波动影响;话语类标注一致性最低,其分数含噪声上限;图标类的让渡相对最低,说明并非所有语义手势都同等有用。未评测边界是该表未给出无手势时的同组对照,不能单独据此说某类手势必然导致保持或让渡。
换掉融合方式或拿掉语义后会发生什么?
消融按可运行策略组织。融合方式消融固定文本加音频加手势 3 路专家,只换融合算子,对比拼接融合、低秩融合与本文混合专家。原文报告混合专家的总体更均衡,尤其少数类让渡的 F1 高于另外 2 种,而拼接和低秩在保持上略高但让渡偏低,呈现类别不平衡下的取舍。若只看总体准确率可能掩盖这种不平衡,因此复述时应同时给出 2 类的 F1。
手势表示消融对比语义对齐与非语义版本。1 模态手势时两者接近,融合后语义版本稳定领先,说明语义监督的价值体现在跨模态对齐而非 1 模态判别。原文还用嵌入可视化佐证语义版本形成更分开的簇,但像素细节未提供可辨数值,只能定性引用,不猜簇间距离。
失败条件是原文未做更表达力强的时序联合建模,也未测试去掉文本或音频后语义手势能否独立支撑,这些是明确的未测项,不能脑补拿掉后必然怎样。从复现角度,消融的可运行性要求保留必要基线:任何新融合方法都应与文本加音频、文本加手势、音频加手势以及文本加音频加手势非语义版同表比较,否则无法判断增益来自融合还是来自语义。搜索最优和事后最优要另行标明,不能代替可部署收益,本文用 3 种子平均而非挑最优种子,这一点值得保留。
哪些结论出界了,噪声和领域会如何限制推广?
直接报告的是在 DnD 桌游 6 小时数据上语义手势带来一致增益,有限解释是门控权重和嵌入聚类支持对齐变好,未验证推测是其他场景也一定有效。领域特异性是首要限制,自然的游戏互动虽比脚本数据真实,但任务型对话、会议、远程交流和跨文化场景未测,桌游中的指向和列举动作分布可能与会议不同。
标注噪声是第 2 限制,平均 kappa 为 0.52 属中等,话语类更低,因其按功能而非形状定义,主观性强。这种噪声会压低可达性能上限,增加更多标注员可能缓解但原文未做。方法局限是只研究基于 IPUs 的 2 分类是否互补,未联合建模轮次结构和模态间时序交互,未来可用更表达力的融合与时序模型。
未测量误判率、延迟和成本时,不承诺这些量得到改善,训练资源与推理开销应分开讨论。总体趋势不等于每组每步都成立,例如图标类让渡偏低就提醒语义手势内部存在差异,不能把平均增益推广为所有类型在所有轮次都有效。
要复现先做什么,需要哪些信息条件?
复现先做数据管线。按 200 ms 静音切 IPUs,标保持或让渡,合并短单元,得到约 12000 轮次并按 70 %、10 %、20 % 划分。检查保持约 7000、让渡约 5000 是否接近,若差别大先查语音活动检测和合并规则。标注侧用 ELAN 按人分轨并结合语音上下文标 4 个类型,工具链接当前可用,转写用 WhisperX 链接当前可用,保留同一双模态依据。
模型侧先训 VQ-VAE 再训混合专家。VQ-VAE 输入为相对骨盆归一化的上身关节点,残差块 2、嵌入 256、码本 256、学习率 3e-4、AdamW、批 512、120 轮、语义损失权重 0.1、重构权重 1,忽略无类的分类损失。融合侧批 32、20 轮、学习率 5e-5、1 卡 V100。
文本用句子嵌入、音频用 Wav2Vec2、手势用 1 层变换器加平均池化。评估用准确率、宏平均 F1 和 2 类 F1,3 种子平均,保留文本加音频和非语义文本加音频加手势基线。缺项是门控内部层数、权重衰减和早停策略未报告,需在复现报告中标为待确认,不从模型名推定实现。
何时值得尝试语义手势,还需补哪项验证?
当已有文本加音频基线且在过渡模糊处出错时,值得尝试加入语义手势,尤其是有指示和话语组织动作的多方场景。尝试顺序是先加原始动作特征看是否有互补,再加 4 个类型语义监督看是否进一步提升,同时监控让渡 F1 而非只看准确率。若手势单独很弱不必惊讶,原文 1 模态手势本就最低,它的价值在融合中体现。
还需补的验证是跨领域测试、更多标注员的一致性提升、以及更强的时序融合对照。论文特有的误解是把按类型 F1 高低直接读成因果,例如认为隐喻手势必然导致保持,实际上那是小样本分组统计,受标注噪声和样本量影响。另一误解是把门控权重升高当成该模态 1 模态性能变强,实际上权重是上下文分配,不能等同于 1 模态准确率。
保留关键超参数和信息条件后,这份解读可作为复述方法的底稿:输入文本加音频加手势、表示用语义对齐的量化嵌入、融合用门控加权、目标是保持或让渡 2 分类。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses