英文题目:iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis
会议身份:
conference:speechprosody:2026:conference-paper-id:kakouros26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集 #数据集构建 #韵律 #语音 #语音情感识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Sofoklis Kakouros:机构信息未能从会议 PDF 纯文本可靠映射
- Fang Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为网球大满贯赛后发布会长视频,输出为按运动员与记者分离的短语音片段、转写文本及词级对齐与情感标签,难点在于多人轮替、重叠说话、背景噪声与自发情感标签缺失并存。处理链先抽取音轨并标准化为单通道PCM,再以说话人分离标注区分说话轮次并结合重叠检测与语音活动检测剔除非目标与重叠干扰,得到的纯净轮次送入Whisper Large生成英文转写并汇总为多层标注。转写与原始音频再送入蒙特利尔强制对齐器产生词级与音素级时间边界,最后按累计说话时长最长者为运动员的启发式完成角色映射与片段切分,形成可与微手势标注同步配对的语料。与表演式语料的关键机制差异在于情感来自真实比赛胜负而非剧本诱发,因而保留的韵律与时间边界能反映受社会规范与压力塑造的自然情感编码,具有多模态配对研究的实际意义。在iMiGUE-Speech语料的胜负分组基准任务下,获胜组的Valence得分为0.5361,高于失利组的Valence得分0.5025。会话层聚合还显示失利组主导情绪为悲伤的比例为85.2%,获胜组主导情绪为悲伤的比例为64.7%且快乐与中性占比抬升,呈现结果驱动的情感分化。结论的适用边界仅限于英语赛后采访的胜负二分代理情感,尚未验证跨语言、跨运动与采访内时变预测的外推能力,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的自发情感问题有多难?
这篇解读的输入是 Speech Prosody 2026 的论文正文与本次收到的官方原图像素,目标是让刚进入语音与情感方向的研究生能核对并复述 iMiGUE-Speech 的做法。必须保留的信息包括数据来源与规模、加工流水线的每个计算动作、两个基准任务的模型选择与评估对象、以及胜负分组下的关键数字与适用边界。输出按学习依赖展开,先讲任务与路线,再讲方法全景与组件,最后讲实验条件与结果限制。
论文要解决的是自发情感语音稀缺的问题。实验室常用的做法是请人表演高兴、愤怒、悲伤,录音干净、标签明确,但与真实高压情境下的表达差距大。韵律是白话说法,指说话时音高、响度、节奏和音色随时间的变化;英文是 prosody。后文统一简称韵律。
真实赛后采访里,运动员受赛果、社会规范、疲劳和现场互动影响,音高范围、强度、语速和停顿会出现表演数据里少见的细微偏移。研究者希望在这种自然情境下检验情感如何在语音中编码,并为模型提供更难的评估。
语音情感识别 × 基于文本的情感分析: 语音情感识别只看声学信号,检验音高、强度、语速等韵律线索是否携带胜负相关的情感;基于文本的情感分析只看转写词句,检验用词与叙事是否反映积极或消极评价;两者搭配的理由是同一采访同时有怎么说和说什么,组合后才能判断声学趋势与语义趋势是否一致,而不是把一种模态的结论推广到另一种。
原 iMiGUE 数据集本身是身份无关的微手势视频库,特点是遮挡或去除人脸以保护隐私,但保留声音。它带有片段级微手势类别和视频级积极或消极标注,消极与积极按比赛胜负给出。本文要做的不是重新采集,而是把其中语音信号变成可直接用于语音研究的语料,并补上说话人、文本和对齐信息,同时保留与原手势标注同步配对的可能。
已有路线在测什么:表演语音与维度描述各留下什么缺口?
情感语音研究长期沿两条路线展开。一条是离散类别路线,把语音映射到高兴、愤怒、悲伤等可名状类别,优点是与日常语言和早期数据集兼容,缺点是难以表达程度差异。另一条是维度路线,用效价描述愉悦或不愉悦的程度,用唤醒度描述平静或激动的程度,有时再加优势感描述自信或受控的感觉,优点是能刻画连续波动,缺点是不同维度对声学线索的敏感度不同,其中唤醒度的声学关联相对更稳健。
在声学侧,已有工作报告高兴常伴随更高的基频、更宽的音高范围、更活泼的语调和较快的语速,愤怒常伴随语速加快与相对中性语音更强的强度。但论文强调这些是多线索组合的倾向,不是单一阈值规则,也不是在所有说话人与情境下都成立。把表演语音上得到的阈值直接搬到发布会,很可能因为口音、噪声、发言长度和互动结构而失效。
在方法侧,自监督语音表示已成为情感识别的常用起点,例如用大规模语音预训练后再在情感语料上微调。文本情感分析则常用在评论和社交媒体上微调过的语言模型。本文的对照思路不是提出新结构,而是检验这类现成表示能否迁移到体育采访这种自发、嘈杂、发言长短不一的领域。理解这一点很重要,后文所有数字都是迁移能力的探测,而不是新模型结构的胜利。
问题如何界定:从原始发布会到可用语音片段缺哪几步?
原始发布会录像不能直接用于建模,缺的是说话人归属、可用语音定位和文本时间锚点。具体来说,一段几分钟的录像里混有运动员长回答、记者短提问、重叠说话、静音和背景噪声,而原 iMiGUE 只给运动员的微手势标注,没有谁在何时说话的说话人轮次标注。直接把整段音频送入情感模型,会把记者的声音也算成运动员的情感,造成标签污染。
论文把问题界定为构造任务:设计一条自动音频处理流水线,从视频中抽出单通道音频,依次完成语音检测、说话人切分、重叠标记、转写和词级对齐,再按角色把片段分成运动员与记者两个不相交集合。举例来说,一个教学例子是某场发布会的前 2 分钟包含记者提问 20 秒、运动员回答 90 秒和 1 次 2 人同时开口 3 秒,流水线需要标出 3 秒重叠、丢掉静音、把 90 秒归给运动员并切成若干回答片段,而不是把 2 分钟整体打一个标签。这个例子只是帮助理解流程,不代表原文报告过该场的具体时长。
评估侧的问题界定同样具体。所有基准只用切分后的受访者音频及其对应转写,不混入记者部分。语音侧分维度回归与离散分类两个范式,文本侧做积极或消极的二分类,标签的分组依据是比赛胜负,作为积极与消极情感状态的代理。这种代理假设后文需要谨慎对待,胜负不等于说话人每 1 秒都高兴或悲伤。
全景如何走通:一个回答片段经历了哪些加工站?
先沿一个运动员回答走完全程。输入是原始发布会视频,输出是归属于运动员的若干音频片段、段级英文转写、统一时间轴标注和词级边界,外加角色映射与顺序编号。中间依次经过音频标准化、语音与说话人分析、文本生成、时间整合、词级对齐和角色分离。每个站只解决一件事,下游只消费上游已落盘的时间与标签,不回头修改上游切分。
阅读下图时先看主路径再看分支汇合,图中绿色箭头表示加工方向,矩形框表示计算模块,底部两路表示角色分离结果,圆柱体表示数据存取起点与终点。
看图路径: 1. 从顶部粉色视频库沿绿色箭头向下追踪到单通道音频提取框;2. 核对中间并排的四个模块名称是否齐全;3. 观察音频与文本两条分支如何汇入强制对齐再分叉为受访者与采访者;4. 确认最底部绿色库标注是否为最终语料落点
论文图 1。原论文 Figure 1:“iMiGUE-Speech processing pipeline.”。
从像素可见,顶部粉色圆柱标注为原始视频库,向右经绿色箭头进入灰色单通道音频提取框,再向下进入包含 4 个并排子框的大框,4 个子框分别标为语音活动检测、说话人日志、转写和重叠检测。继续向下分成蓝色音频分支与黑色文本分支,两路再汇入标有强制对齐的长框,最后分叉为受访者与采访者各一套音频加文本,并汇入底部绿色语料库。
这个走向与正文描述一致:先并行做语音定位与文本生成,再用对齐把两者绑到同一时间轴,最后按说话时长启发式做角色分离。教学上的关键是记住分支含义,音频分支管哪些时间可用,文本分支管说了什么,对齐管词落在何时,角色分离管归谁所有。
语音定位组件做什么:如何留下语音并标出谁在说话?
第一组动作是音频标准化。用工具从每个视频抽出音轨并转成一致格式,例如单通道、固定采样率的脉冲编码调制波形。这一步不做情感判断,只保证后续模型看到的通道数与采样率 1 致,避免因格式混杂引入虚假差异。
第二组动作是用语音处理工具包并行做三件事。说话人日志把录音切成同质片段并打上匿名标签,例如某说话人零、某说话人一,解决切分与聚类问题。重叠检测标出多人同时说话的区间,解决归属不清与后续过滤问题。语音活动检测去掉静音与背景噪声,只保留含语音的区间,解决计算聚焦问题。三者的输出随后被合并到同一个 Praat 兼容的多层标注文件,每种标注占一层,分别是说话人层、重叠层、语音活动层和段级转写层,可以在同一时间轴上查看与编辑。
说话人日志 × 语音活动检测: 说话人日志负责把连续录音切成按匿名说话人标记的时间段,解决谁在何时说话的问题;语音活动检测负责区分语音与静音或背景噪声,解决哪段值得处理的问题;两者搭配的理由是发布会录音混合了记者、运动员、重叠和噪声,必须先留下可用的语音再归属说话人,组合后才得到干净的候选片段供转写和角色判定使用。
角色分离用的是累计时长启发式。论文假设在采访情境下受访运动员回答更长、记者提问更短,因此累计说话时间最长的匿名说话人被映射为运动员,其余归为记者。按时间顺序给运动员片段编号,例如片段零零一、零零二,同时保留记者片段形成另一个不相交集合。这种做法简单可复现,但依赖时长假设,若某场记者话多或多人轮问,映射可能出错,复现时应抽查时长分布而不是默认假设恒成立。
文本与对齐组件做什么:转写和词边界如何生成?
转写用的是大尺寸 Whisper 模型,并把语言标志显式设为英语,以在口音与噪声下仍得到一致的英文转写。输出是与语音段对齐的段级文本,存入多层标注文件的转写层。这一步的输入是标准化后的音频与语音活动区间,输出是可读文本,中间不引入情感标签,因此转写错误会向下游传播,需要在评估文本情感时意识到口语不规范与识别错误的叠加影响。
词级对齐用的是蒙特利尔强制对齐器,输入是原始音频与 Whisper 生成的转写,输出是每个词乃至音素的时间戳,存为另一个独立的多层标注文件。它的作用是把段级文本细化到词时刻,使手势与单个词或音节的同步分析成为可能,也为韵律特征按词聚合、停顿与填充词研究提供时间基础。
自动语音转写 × 强制对齐: 自动语音转写负责把语音变成英文文本,解决 linguistic 内容从无到有的问题;强制对齐负责把已有文本中的每个词锚定到音频时间轴,解决文本与时间如何对应的问题;两者搭配的理由是仅有段级文本无法做手势同步或韵律细分析,组合后才得到可用于对话分析与多模态配对的词级时间边界。
维度情感 × 离散情感: 维度情感用唤醒度、优势感、效价等连续量描述情感的强度与性质,适合捕捉自发语音的细微起伏;离散情感用悲伤、高兴、中性等类别给出高层标签,便于与传统情感识别文献对照;两者搭配是因为同一段语音既有程度变化又有可名状倾向,组合后能从连续水平和主导类别两个视角检验胜负是否带来系统性差异。
从复现角度看,这两个文本动作与前面的声学动作是解耦的。即使更换转写模型,只要仍输出段时间与文本并送入同一对齐器,整体目录结构与下游基准仍可跑通。论文未报告转写词错率与对齐边界误差,也未做人工校对规模的说明,这是复现时需要补记的缺项,不能从模型名称推定转写一定准确。
有训练吗:本研究真正优化了什么、冻结了什么?
本研究的数据构造部分没有训练新的神经网络。音频标准化、说话人日志、重叠检测、语音活动检测、Whisper 转写和强制对齐都是调用已有工具或已有模型做推理与标注,没有报告梯度更新、优化器、学习率或早停。角色映射是基于累计时长的规则,没有可学习参数。因此不能把流水线说成端到端训练,也不能从调用了预训练模型推定输出是确定性的,同一音频在不同版本工具或阈值下仍可能得到不同切分。
基准部分的模型同样不是在本文语料上从零训练。维度回归用的是在大规模语音上预训练、再在播客情感语料上微调过的语音表示 backbone,用于提取对发布会声学变化鲁棒的上下文表示。离散分类用的是面向离散情感识别微调过的自监督语音框架变体,文本情感用的是在多种英文情感数据上微调过的大型语言模型。论文只说明调用这些已微调表示来预测本语料,没有给出在本语料上继续微调的层冻结、学习率、批量大小或训练轮数等细节。按证据应理解为以现成表示做迁移评估,缺失的训练超参数不应自行脑补。
真正的计算发生在聚合与统计侧。对每段先得到模型预测,再按会话标识聚合:段预测平均得到会话整体水平,段预测的标准差得到会话内波动,然后在胜组与负组内再平均。这种 2 级聚合决定了后文表格的含义,读数时必须区分段级与会话级,不能把会话均值当成每段都如此。
在什么条件下测:数据、划分、聚合与指标方向是什么?
数据底座是原 iMiGUE 的大满贯赛后发布会视频,覆盖多名男女球员与多个国家,附带微手势类别与按胜负给出的视频级情感状态。扩展后新增的是语音侧元数据,包括标准化音频、说话人标签、重叠区间、语音活动区间、段级英文转写、统一多层标注文件、词级对齐文件、角色映射与按时间排序的说话人专属片段集。评估只用运动员侧音频与对应转写,记者侧仅用于分离与对话结构分析,不进入情感基准。
为核对语料规模,先把论文连续正文给出的数量整理成宽表,表中数字与单位保留原文写法,千分位与括号形式不改动。该表回答的问题是底座有多大、男女与国家覆盖如何、手势标注密度如何,公平条件是所有数字都来自同一原始发布集合,指标方向是规模越大、可配对模态越多,越适合研究语音与手势动态。
| 数据范围 | 视频总数 | 球员总数 | 性别组成 | 国家数 | 微手势标注 |
|---|---|---|---|---|---|
| 原始发布会集合 | 359 videos | 72 players | 36 male, 36 female | 28 countries | 18,499 annotated micro-gesture samples across 32 distinct categories |
上表显示底座不是小样本表演库,而是有数百场发布会与上 10000 条手势标注的自然语料,性别 balanced 且国家覆盖广。代价是原始录音含噪声、口音和重叠,加工链任何一环出错都会污染下游,因此后文基准应视为在自动切分与自动转写条件下的迁移表现,而不是在人工精标语音上的上限。未报告切分准确率与转写词错率是明确的评估边界。
基准协议按会话聚合而非按段直接对比胜负。每段先由预训练模型给出维度值、离散类别或文本情感分,再聚合成会话级表示:整体水平取段均值后再组内平均,波动取段内标准差后再组内平均;离散类别取会话主导类别后统计组内占比;文本情感取段分平均后判会话极性再统计占比。指标方向是效价、优势感、唤醒度越高表示越积极、自信或激活,离散占比与情感极性占比越高表示该倾向在组内越常见。论文未报告显著性检验方法与置信区间,比较时只能说报告值显示某种倾向,不能断言统计显著或因果。
声学维度看到什么:胜者更积极但波动模式有何不同?
维度回归比较的问题是胜组与负组在整体水平与会话内波动上是否不同,公平条件是同一语音 backbone 与同一会话聚合流程,指标方向是数值越大表示该维度越强。论文报告胜者在效价与优势感的整体水平上高于负者,唤醒度两组接近,负组在效价波动上略大。结合效价与唤醒度的分工看,这支持胜负主要改变愉悦与自信色彩,而不必然带来持续的高激活,这是理解自发情感不能只看激动程度的关键。
效价 × 唤醒度: 效价描述情感愉悦或不愉悦的性质,唤醒度描述生理激活或能量高低,两者在本文中都是连续回归目标;它们分工不同,一个管方向,一个管强度,搭配的理由是胜负可能同时改变愉悦感和兴奋度,组合后才能区分是更积极、更激动,还是仅积极而不更激动,本文结果正是前者差异更明显而后者接近。
原文对聚合的定义需要复述清楚。整体水平是对每个会话先平均段预测,再在组内平均,反映一场采访的典型状态;会话内波动是对每个会话先算段预测标准差,再在组内平均,反映一场采访内部是否起伏。两者一个管位置,一个管稳定,缺一不可。若只看均值,会误以为负组全程低落;波动提示负组内部也存在段间变化,只是整体位置更低。
局限同样要讲。维度值来自在播客语料上微调过的模型,直接迁移到发布会可能存在领域偏移,论文未给出在目标域上的人工维度标注对照,也未报告误差棒。因此这些数字是模型感知的情感倾向,不是人类标注的真值,支持胜负相关的声学差异,但不能证明每位败者每段都更消极。
离散类别看到什么:悲伤主导为何两组都高、差异在哪里?
离散分类比较的问题是在会话主导类别分布上胜负两组是否分开,公平条件是同一离散情感模型与同一会话主导判定规则,指标方向是某类别占比越高表示该类别作为主导色在组内越普遍。下表直接选用原表矩阵,行是胜负分组,列是各离散类别占比,数值保留原文精度与百分形式,不做差值或四舍五入。
| Group | Angry | Sad | Happy | Surprise | Fear | Disgust | Contempt | Neutral |
|---|---|---|---|---|---|---|---|---|
| Lose | 0.0 | 85.2 | 5.9 | 0.0 | 2.0 | 0.0 | 0.0 | 6.9 |
| Win | 0.0 | 64.7 | 15.5 | 0.0 | 0.8 | 0.0 | 0.0 | 19.0 |
表后解释要同时讲收益与代价。收益是区分度清晰:负组悲伤主导占比达到 80% 以上,仅伴随少量高兴、恐惧与中性,呈现高度集中的消极轮廓;胜组悲伤主导明显回落,高兴与中性占比上升,呈现更分散、更积极或更中性的轮廓。这与维度侧胜者效价更高的结论互相印证,说明声学离散与连续视角指向同一胜负倾向。代价与反例同样明确:愤怒、惊讶、厌恶、轻蔑在两组主导分布中均为零,恐惧占比也很低,模型几乎只在悲伤、高兴、中性之间选择。
这可能反映发布会得体规范压制了激烈外显情绪,也可能反映模型在该领域的类别偏置,未胜出的类别提醒我们不能把该基准当成全谱情感识别。
另一个边界是悲伤在胜组依然是占比最高的类别。这说明胜不等于全程高兴,会话主导只是相对倾向,胜者采访里仍有大量被模型判为悲伤的段。若把组均值推广为每个胜者每段都积极,就会误读表格。复现时应保留段级分布直方图,而不是只存会话主导标签。
换到文本视角还成立吗:用词的积极性能否对上声音?
文本情感比较的问题是只看转写词句时胜负差异是否与声学侧一致,公平条件是同一文本模型与同一先段平均后判会话极性的聚合,指标方向是消极占比越高表示组内负评价会话越多,积极占比越高表示正评价会话越多。下表直接选用原表矩阵,数值保留原文 1 位小数与百分含义,不另加单位列。
| Group | Negative (%) | Positive (%) |
|---|---|---|
| Lose | 12.9 | 87.1 |
| Win | 4.6 | 95.4 |
表后解释先讲一致性再讲不对称。负组消极占比高于胜组,胜组积极占比更高,方向与声学侧的效价与离散结果一致,支持用词评价与声音色彩同向变化。但两组绝对值都不对称:即使负组也有近九成会话被判积极,胜组积极比例更高。这说明赛后采访的语言本身偏得体、前瞻与职业化,模型看到的更多是措辞克制而非直白抱怨。若只看相对差会夸大对立,若看绝对值则看到天花板效应。
未评测的边界包括转写错误对情感分的传导、填充词与口误的处理、以及长回答与短回答在平均时权重是否相同。论文未做去掉低置信转写或按长度加权的对照,因此文本侧结论应表述为在自动转写与简单平均条件下的倾向,待验证是否在人工校对文本下依然成立。
哪些结论不能下:标签代理与自动流水线带来什么风险?
第一个限制是标签代理。积极与消极按比赛胜负给出,这只是结果层面的分组依据,不是逐段人工情感标注。运动员可能在输球后仍幽默得体,也可能在赢球后仍疲惫克制。把胜负直接等同于高兴或悲伤会犯类别错误,论文的措辞是情感状态的代理与整体倾向,复述时应保留这种谨慎,不说模型测到了真实内心。
第二个限制是自动流水线的误差传导。说话人日志可能把记者长追问误归给运动员,重叠区间可能切不准,转写可能在口音与噪声下出错,强制对齐可能在错误转写上给出错误边界。这些误差没有在本文给出量化评估,意味着所有基准都是在含噪自动标注下的表现。若复现者更换工具版本或阈值,切分数量与时长分布会变化,数字不宜跨版本直接对比。
第 3 个限制是统计与泛化。论文只报告组均值与占比,未报告显著性、置信区间、按性别或轮次的分层,也未在其他赛事或语言上验证。总体趋势不等于每组每段都成立,更不等于可部署系统的准确率承诺。未测量误判率、延迟与人力校对成本时,不应声称该流程更省或更快。
关于可获得性,论文正文给出一个代码库链接,但本次解读未完成该链接的可用性验证,因此不能声称数据或代码当前已公开或可运行。需要使用的读者应以原文链接为准自行核对可达性,并在复现记录中注明访问时间与版本。
要复现先做什么:按什么顺序检查才能对上原文?
第一步是还原数据底座与目录。按原文拿到原始发布会视频后,先抽单通道音频并固定格式,再跑语音活动检测、说话人日志与重叠检测,生成统一多层标注文件。接着用大尺寸转写模型在英语标志下生成段级文本,再用强制对齐器基于音频与转写生成词级边界。最后按累计时长最长者为运动员的规则做角色映射,输出运动员与记者两个不相交片段集并按时间编号。每一步落盘后抽查时长分布与重叠比例,确认运动员确实是时长最长者。
第二步是跑通基准推理。准备 3 个现成微调模型:面向维度情感的语音表示、面向离散情感的语音框架、面向英文情感的语言模型,分别对运动员段音频与转写做段级预测。严格复用原文聚合:维度取会话均值与会话内标准差再组内平均,离散取会话主导类别再统计占比,文本取段分平均后判会话极性再统计占比。不要自行改成段级直接对比或加权平均,否则数字口径不再可比。
第三步是记录缺项与环境。记下工具包版本、转写模型版本、对齐词典、角色映射中时长最长者的占比、被丢弃的重叠与静音比例,以及推理硬件与耗时。原文未报告这些超参数与预算,复现者补记后才能判断差异来自模型还是流水线。还需补一项验证是人工抽检转写与切分质量,至少报告抽检规模与错误类型,为后续工作留下可比的起点。
何时值得尝试这个语料:带走哪三条可操作的判断?
当研究目标是自发韵律而非表演情绪时,这个语料值得尝试。它的价值不在标签干净,而在情境真实:胜负带来的情感是自然发生的,发言长度、互动结构与噪声都是真实分布,适合检验实验室结论在发布会领域的稳健性。同时它保留了与微手势标注同步的可能,适合研究语音与手势的情感动态,这是单做语音或单做文本的库难以替代的。
带走的第一条判断是先看效价与优势感,再看唤醒度。原文显示胜负差异主要在愉悦与自信维度,唤醒度接近,若自己的模型只在唤醒度上优化,可能复现不出胜负区分。第二条是离散侧要接受类别坍缩,愤怒等类别在主导统计中缺席是正常现象,不应强行调阈值凑出全类别分布,而应报告这种保守表达本身。第三条是文本侧要同时看相对差与绝对高积极率,前者证明方向一致,后者提醒语言得体带来的天花板。
收束时回到方法的可核对性。复述者应能说出从视频到单通道音频,再到语音活动、说话人日志、重叠检测、转写、多层标注、强制对齐、时长启发式角色分离的完整链条,并能指出聚合口径与未验证环节。这种讲法比背诵结论更重要,也是后续做消融或补人工标注时不会走偏的基础。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
