英文题目:The Second MLC-SLM Challenge: Multilingual Conversational Speech Diarization, Recognition, and Understanding

标签:#说话人分离标注 | #基准设计 | #语音识别 | #音频问答 | #多语言

评分:8.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露
  • Mingchen Shao:机构信息未在 arXiv HTML 中可靠披露
  • Zhennan Lin:机构信息未在 arXiv HTML 中可靠披露
  • Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
  • Hexin Liu:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露
  • Eng Siong Chng:机构信息未在 arXiv HTML 中可靠披露
  • Longshuai Xiao:机构信息未在 arXiv HTML 中可靠披露
  • Qiangze Feng:机构信息未在 arXiv HTML 中可靠披露
  • Daliang Wang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该挑战以完整双人多语言对话录音为输入,要求输出带说话人身份与时间边界的转写,并在同一语料上回答声学、语义与联合推理选择题,难点在于无oracle切分下的长时重叠、口音变体与跨轮次上下文依赖。组织方发布约2100小时覆盖14种语言、21种语言与口音变体的训练与开发数据并定义时间受限混合错误率与问答准确率协议,随后提供基于语音大模型的任务1与任务2基线以锚定难度,最后汇总91支队伍的端到端、级联与理解系统并提炼数据质量与长音频推理经验。与首届仅做转写相比,本届将重心从识别准确率转向说话人-时间-文本联合建模与音频依赖监督,强调定位证据与答案可控生成对理解任务的意义。在开发集上任务1基线平均混合错误率为79.15%,而决赛优胜系统在评测集上达到14.93%与93.9%的问答准确率,显示充分适配后提升巨大但基线本身几乎不可用。结论仅适用于安静室内手机采集的双人主题对话,尚无法外推至多人、高重叠、强噪声或自发领域场景。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?为什么自然双人对话比单句朗读难得多?

这篇论文是对 Interspeech2026 第二届多语言对话语音语言模型挑战的总结,目标读者是刚进入语音与音频方向的研究生。输入是完整的双人自然对话录音,采样率为 16 kHz,主要在安静室内用手机录制,覆盖不同年龄与性别,说话内容围绕随机分配的话题展开。与单句朗读不同,这类输入包含说话人轮换、打断、重叠、口音变化、环境差异和跨越很长时间的上下文依赖。也就是说,模型不能只认清一句话,而要在整场录音里持续跟踪谁在说话、何时开始结束、以及前后文如何呼应。

论文交代的总体规模是约 2100 小时的多语言对话语音,覆盖 14 种语言和 21 种语言与口音变体。相比第一届,本届新增他加禄语、乌尔都语和土耳其语,并扩展了加拿大法语、巴西葡萄牙语和墨西哥西班牙语等区域变体,英语还细分美国、英国、菲律宾、澳大利亚和印度英语。输出则分两条线。第一条线要求输出带说话人身份、时间边界和识别文本的转写。第二条线要求对整场对话的选择题给出唯一正确选项。理解这个输入输出设定,是后面理解基线与参赛方法的前提。

学习时要保留的关键信息是实验条件。训练集提供转写、 oracle 切分、时间戳和说话人标签,而评测录音不提供切分边界、时间戳、说话人标签和参考转写。规则要求系统必须基于大语言模型、语音大模型或多模态大模型构建,允许公开免费的外部数据与基础模型,允许加噪、混响、变速和变调等增强,但禁止把评测集用于训练调参,禁止多系统输出融合如 ROVER,允许由语音活动检测加日志加识别组成的单管线,商业接口只能用于构造任务二的训练问答,不能用于评测预测。

从第一届到第二届:研究路线发生了什么变化?

论文把背景放在大语言模型向语音扩展的趋势里。做法是把语音编码器与大语言模型接在一起,形成语音大模型,已在识别、合成、增强和对话系统里取得进展。但作者指出,多语言对话场景的真实语料仍然稀缺,尤其是包含轮转、重叠、口音和长距离依赖的自然交流。第一届 MLC-SLM 发布了大规模真实对话语料,定义了多语言识别与带说话人归属的转写任务,证明了语音大模型在多语言对话识别上的有效性。

第二届的动机是补上两块短板。第一是谁在何时说话仍然困难,特别是在复杂多语言对话里。第二是只看转写准确率不足以判断模型是否理解整场的声学事件、说话人关系和语义内容。因此本届把范围从转写扩展到说话人感知的识别与整体口语理解。任务一联合做多语言对话日志与识别,任务二用选择题考声学、语义和二者联合的理解。这种从转写到理解的扩展,是阅读参赛方法时要抓住的主线。

与同类工作对照时要注意输入、目标、监督和运行阶段是否一致。同样是识别,有的方法只做单说话人短句,有的方法做长对话但给定 oracle 切分,本挑战任务一在评测时不给切分与说话人标签,难度更高。同样是理解,有的方法只用文本转写回答,有的方法直接听音频,本挑战允许管线式与端到端两种路线,但评测时都不给切分与标签,因此能否定位相关证据成为关键差异。作者在结尾也提醒,跨系统比较是观察性的,因为模型规模、外部数据、合成监督和算力都不同,未来需要控制数据的赛道与按语言、重叠条件、问题类别报告结果。

两个任务到底要模型做什么?怎么算分?

任务一是多语言对话日志与识别。输入是完整双人对话录音,训练集有 oracle 切分与说话人标签,评测录音没有切分边界、时间戳、说话人标签等 oracle 信息。参与者必须生成包含说话人身份、时间边界和识别文本的转写,级联与端到端都允许。评价用日志错误率和时间受限最小置换词错误率或字错误率,日语、韩语和泰语用字错误率,其他语言用词错误率。具体做法是对同一说话人的假设与参考在说话人置换后拼接,再算词或字错误率,最终排名按时间受限最小置换混合错误率,越低越好。

任务二是多语言对话理解。每个评测样本是一段对话录音加一道选择题,候选答案 2 到 4 个,只有一个正确。题目覆盖声学信息、语义内容和联合声学语义 3 类,评测时同样不给切分、时间戳与说话人标签。任务二与任务一用同一批对话录音,但官方不发布专门的选择题训练集,参与者可基于已发布语音与开发集样例自建问答,管线式与端到端都允许。性能按回答准确率衡量,越高越好,分 2 阶段评测,只用第二阶段结果定最终排名。

举例来说,一段 5 分钟的双人对话可能包含频繁抢话与短停顿。任务一要求模型先切出谁在何时说话,再把每段话认对。任务二可能问某句话是谁说的、轮次顺序如何、或结合语气判断意图。教学例子仅用于帮助想象题型,不代表真实题目与难度分布。关键是 2 个任务共享长音频与无 oracle 评测条件,因此长时对齐与证据定位能力在 2 个任务里都会被考到。

参赛方法全景:三类架构分别解决什么问题?

论文把任务一的九支有技术报告的头部系统归为 3 类。第一类是端到端系统,直接从完整录音生成时间戳、说话人标签与转写,代表是 MOSS Transcribe Diarize、Cake by VPBank 和 roysun2006。第二类是级联系统,连接日志与识别模块,代表是 trasr、HINTT、SQZ、xdynamics 和 fangshuming。第 3 类是日志条件系统,由日志模型预测轮次与边界并转为离散说话人与时间标记,再交给下游语音大模型,代表是 SMIIP Lab。最好成绩同时出现在端到端与级联路线,说明成败不只取决于架构名称,还取决于说话人建模、时间对齐、训练数据质量和长音频推理。

任务二的五支系统按证据表示区分。hfchen 与 roysun2006 是音频原生端到端,直接把完整对话加问题与候选项送入模型。ClaudeAKE 也是音频原生预测,但在构造训练数据时用带时间戳的识别与语言模型定位相关事件。xdynamics 以带说话人归属的转写为主证据,再按问题类型动态选择全文转写、局部音频文本证据、说话人关联证据或全局采样音频。eloquence 探索多模态上下文学习,用冻结模型加平衡多模态示例回答。理解这张全景图后,再看组件细节就不会迷失。

沿一个样本走一遍有助于建立依赖关系。输入是一段无切分的双人对话。端到端路线把它编码后由大语言模型生成统一序列,里面交错出现说话人标记、时间标记与文本。级联路线先经语音活动检测切出有声段,再提说话人嵌入并聚类得到谁在何时说话,接着对每段做识别,最后按时间重叠把词挂到说话人段上。任务 2 路线则把对话或其转写与问题一起编码,输出选项字母或选项内容。先有表示与组件,再谈训练与推理,才符合学习依赖。

任务一如何分清谁在说话?隐式与显式两条路

说话人归属有隐式与显式两种做法。端到端系统在统一输出序列里用录音内局部说话人标记与时间戳、文本一起生成。为了防止模型记住固定说话人身份,MOSS Transcribe Diarize 在训练时随机重映射说话人标记。这种设计避免了日志与识别之间的硬错误传递,但要求生成模型在很长的录音里保持说话人身份与时间戳稳定。

说话人日志 × 语音识别: 说话人日志负责回答谁在何时说话,给出说话人身份与时间边界,语音识别负责回答说了什么内容,二者搭配的理由是多轮对话必须把文本挂到正确说话人与正确时间段上,组合后形成带说话人归属的转写,使后续按说话人拼接计算误差成为可能。

大多数级联系统用由局部到全局的日志流程。trasr 与 HINTT 在挑战数据上微调 DiariZen,再结合说话人嵌入与聚类。trasr 按时间重叠把识别词挂到说话人段上,无重叠时用最近段规则。SQZ、xdynamics 与 fangshuming 先做语音活动检测,再在短窗提说话人嵌入并做谱聚类,说话人数固定为二。论文报告的消融显示,域内日志适配与嵌入优化能明显降低最终识别错误,使日志成为级联系统里影响最大的组件之一。

端到端系统 × 级联系统: 端到端系统由一个生成模型直接输出时间戳加说话人标签加文本,避免日志与识别之间硬切分传错,级联系统先做语音活动检测与聚类得到分段再逐段识别,时间对齐更显式,二者搭配对照的意义是说明成绩差异更多来自说话人建模与长时对齐质量而非架构名称本身。

长音频带来的问题包括时间戳漂移、重复、幻觉和跨块说话人不一致。MOSS 在音频表示中插入周期性时间标记并用长上下文模型生成完整转写,检测到重复尾巴时回退到贪心解码。Cake by VPBank 多数录音单遍处理,较长录音用重叠块加投票对齐说话人身份。级联系统则更依赖显式时间处理,例如 trasr 用 CTC 头生成词或字级时间戳再与日志段对齐,其他系统用重复检测、语言约束解码、文本归一化、轮次合并与去重。总体判断是稳健的长时解码与说话人时间文本对齐,比单纯选择端到端还是级联更关键。

任务二如何表示证据?整场音频与局部证据的取舍

任务二的核心是证据表示。hfchen 用的 MOSS-Audio-8B-Thinking 结合音频编码器与 Qwen3-8B,用显式时间标记与跨层音频注入支持长语音推理,先生成中间推理轨迹再给出最终答案。roysun2006 用 Qwen3-Omni-30B-A3B 直接从完整音频回答,不经过中间转写。完整音频的好处是保留语气、重叠与轮次等声学线索,代价是长上下文建模压力大。

ClaudeAKE 在训练数据构造时定位相关事件,用带时间戳的识别与语言模型做事件检测,预测时仍用音频原生多模态模型处理局部事件段。这种做法把长对话切成与问题相关的证据,减少无关上下文干扰。xdynamics 则把带说话人归属的转写当主干,按问题类型动态路由到全文转写、局部音频文本证据、说话人关联证据或全局采样音频。其开发实验报告,加局部音频后准确率提升,而最终混合路由更高,支持按问题选证据的思路。

声学信息 × 语义内容: 声学信息分工是刻画可听特征如说话人身份轮次与事件,语义内容分工是刻画对话在说什么与意图关系,二者搭配的理由是真实问题常需联合判断例如谁在何时表达了什么,组合后形成联合声学语义问题,成为最考验音频依赖推理的部分。

eloquence 的做法不同,它用冻结的 Voxtral-24B 加平衡多模态示例做上下文学习,评估录音与问题之外再给固定短音频片段作示例。报告显示加 6 个多模态示例后第二阶段准确率明显提升,说明精心选择的示例可以在不更新参数时减少答案位置偏置。但论文也指出,其较小的微调模型存在更大的开发到评测落差,提示示例平衡与参数更新各有适用条件。

模型怎么练?基线与头部系统的训练动作有何不同?

任务一基线是在挑战训练集上微调微软开源的 VibeVoice-ASR。结构是用语音编码器编码输入音频,再用 Qwen2.5-7B 大语言模型生成包含时间戳、说话人标签与识别文本的转写。训练时冻结语音编码器,只对大语言模型的注意力与前馈层做低秩适配。评测时用 Meeteval 工具算时间受限误差,领宽度为 5 秒,日语韩语泰语用字错误率,其他语言用词错误率。该基线在开发集上的平均混合错误率为较高水平,说明直接微调统一模型仍难处理长对话的说话人与时间对齐。

头部系统的训练更分阶段。MOSS 先用大规模语音数据激活多语言识别能力,再做带说话人归属的监督微调,最后适配官方挑战数据。trasr 用 2 阶段低秩适配,第二阶段对弱势语言用更高秩并针对变速扰动,还做检查点平均。Cake by VPBank 把已有适配器合并回主干再训新的适配器,以减少参数漂移累积。HINTT 对日志与识别模型都做全量微调并用外部大语言模型对 N-best 做选择或最小修正。

roysun2006 结合低秩适配与指数滑动平均。SQZ 先监督微调,再用合成语音适配,最后用 GRPO 做带识别与幻觉感知奖励的强化学习,其消融显示监督微调贡献最大,合成数据与强化学习是较小增量。

语音大模型 × 大语言模型: 语音大模型分工是把长音频编码为语言模型可用的表示并保持声学细节,大语言模型分工是利用多语言与上下文推理生成转写或选项答案,二者搭配的理由是纯文本模型听不见语气与轮转,纯声学模型难做长距离语义组合,组合后才能同时处理声学事件与对话含义。

任务二基线基于 Qwen2.5-Omni-7B,用 Gemini2.5-Pro 从已发布训练对话生成覆盖声学、语义与联合的问题,再用 ms-swift 框架加 Megatron-LM 后端做低秩微调。推理时把完整对话、问题与候选项一起给模型直接生成所选选项,并用重试与采样策略改善答案抽取。任务二没有官方选择题训练集,因此各队自建监督成为关键。hfchen 从转写与说话人标签生成覆盖内容、身份、轮次、时序与意图的问题,并按可答性、答案唯一性、标签有效性与源对话一致性过滤。

ClaudeAKE 分开生成语义与声学问题,语义问题从局部事件用文本模型生成,声学问题直接用多模态模型听波形片段生成,经多阶段验证得到大规模数据,并用纯文本探针区分可仅靠文本回答的弱样本与必须靠声学的强样本。

数据划分、指标方向与基线条件如何对应?

数据方面,训练集是 7080 段自然双人对话,开发集有长对话与选择题,评测时不给切分与标签,任务二分 2 阶段评测只用第二阶段定排名。指标方面,任务一混合错误率越低越好,任务二准确率越高越好。聚合对象要注意,任务一是对每段录音按说话人置换后拼接再算错误率后平均,任务二是对题目算答对比例。百分点差与相对百分比是不同概念,读数时不要混淆。

时间受限最小置换混合错误率 × 回答准确率: 时间受限最小置换混合错误率分工是评价任务一的说话人归属加转写质量,允许说话人置换并用时间领容忍对齐,回答准确率分工是评价任务二的选择题答对比例,二者搭配的原因是前者测听清并分清谁说的,后者测是否理解整场声学与语义,组合才能覆盖从转写到理解的完整链路。

下表把论文连续正文里实际出现的规模数字整理在一起,便于核对数据条件。阅读时先确认是训练对话数、开发长对话数、开发题目数还是第二阶段题目数,再对应到具体实验阶段。

数据部分总时长训练对话数开发长对话数开发题目数与第二阶段题目数
本挑战发布语料约 2100 小时7080 段双人对话150 段长对话开发 4500 题,第二阶段 9470 题

表后需要说明适用边界。该表只交代规模与划分,不代表各语言分布均衡,也不代表重叠比例一致。论文未报告按语言、重叠条件与问题类别的细粒度结果,因此不能从总量推断某语言或某重叠条件下的表现。复现时应先按官方划分与 16 kHz 条件对齐,再核对是否使用了相同的切分与标签信息条件。

基线条件也要对应清楚。任务一基线冻结编码器只调大语言模型低秩适配,任务二基线用合成问答做低秩微调并在 300 题开发子集上报告结果。比较头部系统时要记住它们用了不同的外部数据、合成对话与增强策略,跨系统比较是观察性的,不能当成同条件胜负。

主结果显示什么?基线与可运行改进放在同一条件下看

任务一基线在开发集上的平均混合错误率处于高位,而头部系统在评测集上把该指标降到更低区间,显示域内适配与长时对齐带来实质改善。但论文正文连续句子里只给出了基线的开发集数值,头部系统的具体评测数值只出现在原结果矩阵中,本解读因缺乏逐字连续证据不转述那些矩阵数字,只做机制层面的归纳。支持的判断是端到端与级联都能达到较好水平,日志质量是关键杠杆。限制是不同系统的模型规模与外部数据不同,不能据此断言某架构必然更优。

任务二基线在 300 题开发子集上的总体与分类准确率如下表所示,表中单位均为百分比,方向是越高越好。阅读前要提出的问题是声学与语义哪类更难,公平条件是同一基线与同一子集,指标方向是准确率。

评估对象总体准确率声学问题准确率联合问题准确率语义问题准确率
任务二基线开发子集 300 题35.33%47.75%33.67%21.98%

表后解释是声学问题相对最好,语义问题最低,联合居中,论文据此指出对话级语义推理尤其具有挑战性。代价是该子集只有 300 题,不能推广到全部开发与第二阶段分布。未胜出项是语义推理,它提醒只靠转写文本可能不够,还需要长距离意图与关系建模。

为满足结果表必须包含可运行策略的要求,下表整理论文连续正文里实际报告的两组可复现改进,保留基线条件与改进后条件。表前问题是在相同 backbone 下加示例或加局部音频是否带来可测收益,公平条件是同一系统只改变证据或示例,指标方向仍是准确率越高越好。

系统与阶段证据或提示条件指标基线条件值改进后值
eloquence 第二阶段无示例到 6 个多模态示例准确率74.3%81.0%
xdynamics 开发实验纯转写主干到加局部音频到混合路由准确率92.69%94.22% 与 94.84%

表后解释是两组改进都支持证据质量比数量更重要。eloquence 在不更新参数时靠平衡示例减少位置偏置,代价是仍需精心挑选示例且对分布变化敏感。xdynamics 显示转写主干加局部音频优于纯转写,混合路由进一步提升,但其开发数值不能直接等同于第二阶段评测数值。反例是并非所有合成数据都有益,后文消融将说明过滤掉与音频无关的题目反而更关键。

拿掉哪一步会怎样?数据质量与监督相关性的对照

任务一的对照集中在数据质量。Cake by VPBank 发现官方标注有漏标的有声区,先找回可靠转写并把不确定区静音,还做短静音切除与加噪。HINTT 与 trasr 类似地屏蔽标注区间外的可听区。这些做法减少音频与监督的不匹配,有助于防止删除错误或虚假转写。论文的表述是数据质量与数量同样重要,这得到多队一致支持,但原文未给出统一的删除前后误差差值,因此只能定性为支持性证据,不能写成确定的因果量。

任务二的对照更系统。roysun2006 先生成约 210,000 题,再用静音音频反事实测试去掉不需要语音输入的题目,剩下约 67,000 题,再补约 60,000 题以匹配评测分布。累计结果从过滤前的 81.0% 到过滤后的 83.0% 再到分布匹配增强后的 85.0%,显示合成监督的相关性与音频依赖比原始规模更重要。ClaudeAKE 把弱样本用于监督微调、强音频依赖样本用于 GSPO,路由训练策略达到 90.92%,而未区分弱强的对照为 88.24%,支持按需分配监督的价值。SQZ 的消融则显示监督微调贡献最大,合成适配与强化学习是较小增量,提示不要把强化学习当成主要收益来源。

这些对照的限制是各自的开发集与评测分布不同,数值不能跨队直接比较。未评测的边界包括重叠语音比例、信噪比变化与少资源语言的单独表现,论文未报告这些细粒度切分。阅读时要把每组数字放回其原系统与原阶段,不能把开发集增益直接当成可部署收益。

还有哪些问题没有解决?比较本身的边界是什么?

论文在结论中明确指出跨系统比较是观察性的,因为模型规模、外部数据、合成监督与算力都不同。这意味着不能把排名直接读成架构优劣的证明。未来需要控制数据赛道,并按语言、重叠条件与问题类别报告结果,才能实现更细粒度可复现的比较。当前缺失的证据包括分语言误差、分重叠条件误差、分问题类别的完整矩阵,以及训练与推理成本、延迟与误判率的测量。

方法层面的剩余问题也很具体。长对话的时间戳漂移、重复、幻觉与跨块说话人不一致仍需稳健解码。任务一中标注漏检与噪声鲁棒性仍依赖启发式修复。任务二中对话级语义推理仍是最弱环节,基线语义准确率明显低于声学,说明长距离意图、关系与时序推理尚未解决。音频依赖监督的构造虽然有效,但合成问题的分布匹配与一致性过滤仍需人工审核保证唯一正确答案,成本较高。

表达上要区分 3 类陈述。论文直接报告的是规模、指标定义、基线配置与部分开发实验数值。有限解释是日志质量与证据选择对最终成绩影响大,这有多队结果支持。未验证推测是更大模型或更多合成数据必然继续提升,原文未给出受控证据,应表述为可能或待验证,不做承诺。

要复现先做什么?代码、数据与指标工具如何对应?

复现任务一先准备数据与工具。数据通过官方竞赛页获取,当前资源状态显示可用,训练集有 7080 段对话的转写与切分标签,评测时不使用这些 oracle 信息。代码方面,任务一基线仓库当前可用,任务二基线仓库当前可用,评价时间受限误差的 Meeteval 工具当前可用。按论文描述,任务一基线冻结语音编码器,对大语言模型注意力与前馈层做低秩适配,评测领宽度为 5 秒,日语韩语泰语用字错误率,其他用词错误率。先跑通基线再做域内日志适配,是成本最低的起点。

复现任务二先对齐无官方训练问答的条件。做法是从已发布对话与开发集样例自建问答,生成后做可答性、唯一性与一致性过滤,并用静音反事实测试保留必须听音频的题目。基线用完整对话加问题与候选项直接生成选项,并做重试与确定性解析以保证输出落在候选集内。若走训练免费路线,可参考按问题类型路由证据与平衡多模态示例的做法,注意示例标签平衡以减少位置偏置。

需要保留的关键超参数与信息条件包括 16 kHz 采样、双人对话假设、评测无切分无标签、任务一领宽度 5 秒、任务二只用第二阶段排名。论文未报告硬件预算、训练步数细节与推理延迟,因此不能承诺成本改善。区分代码开源、权重下载与系统可运行,仓库可用不等于权重可直接下载运行,复现前应核对仓库中的模型权重链接与环境说明。

何时值得尝试这些做法?给新手的三条行动建议

第一,当你的对话系统在长音频上出现说话人串话或时间戳漂移时,值得先做域内日志适配与嵌入优化,再调识别模型。论文支持日志是级联系统里杠杆最大的组件,端到端则要加周期性时间标记与重复回退。先沿一个样本检查时间重叠挂接是否正确,比盲目换更大识别模型更有效。

第二,当你要做整场对话理解时,值得把精力放在音频依赖监督与证据路由上。自建问答后先过滤掉纯文本可答的题目,再按声学、语义与联合分类构造,训练时区分弱强样本,推理时按问题类型选择全文转写或局部音频。论文中加局部音频与混合路由的增益,以及过滤后准确率的提升,都支持质量优先于数量。

第三,报告结果时要保留可运行基线与实际策略,避免用搜索最优或事后最优代替可部署收益。同时按语言与问题类别拆分报告,并说明外部数据与合成数据的用量。论文特有的误解是把排名当成架构定论,实际上端到端与级联各有胜场,关键是说话人时间文本对齐与可靠答案抽取。补上分条件评测与成本测量,才能把 1 次参赛经验变成可复用的研究结论。

📎 论文与评分元数据

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-24 语音/音乐/音频论文速递