📄 SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings

标签:#语音分离 #基准测试 #数据集 #音频理解 #Transformer

8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5

🔥 8.1/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音分离 | #基准测试 | #数据集 #音频理解 | arxiv

👥 作者与机构

  • 第一作者:王帅(南京大学)
  • 通讯作者:realtse.challenge@gmail.com(挑战赛公共邮箱)
  • 作者列表:王帅(南京大学)、钱子涵(南京大学)、柯张(香港中文大学(深圳))、韩江宇(布尔诺理工大学)、刘子楷(西北工业大学)、余晓阳(南京大学)、李浩宇(南京大学)、Marc Delcroix(NTT, Inc.)、余凯(上海交通大学)、谢磊(西北工业大学)、李明(香港中文大学(深圳))、李海洲(香港中文大学(深圳))

💡 毒舌点评

本文的核心贡献在于构建了一个评估维度更全面的TSE竞赛平台,并通过严谨的实验设计揭示了真实数据适配和多目标优化是比架构创新更关键的实际瓶颈。然而,其在赛后发现并更换官方评估指标(DNSMOS OVRL → P808)的行为,虽然体现了诚实,却暴露了其评估协议设计存在根本性脆弱点。一个对“指标攻击”抵抗力如此之弱的基准,其权威性和导向性令人存疑,它可能会鼓励社区为适应一个不稳定的评估器而进行“内卷式”优化,而非追求真正的感知质量提升。

📌 核心摘要

本文介绍了SLT 2026 REAL-TSE Challenge,一个针对真实世界对话录音中目标说话人提取任务的竞赛。旨在解决现有TSE评估依赖于模拟数据、无法反映真实场景复杂性的局限。核心方法是组织一个包含在线(低延迟)和离线两个赛道的竞赛,使用来自真实中英文对话的录音作为评估数据,并采用多维度指标(TER, SpkSim, DNSMOS, F1)进行评估。与现有模拟基准相比,新在评估数据源于真实录音,包含自然混叠、混响、噪声等;评估设置分为实时和离线;评估指标更全面。实验结果显示,参赛系统普遍通过真实数据适配和多目标优化取得了显著提升,但没有任何系统能在所有维度上占据绝对优势。本文的实际意义在于推动TSE技术向真实世界应用迈进,并提供了一个更贴近实际的评估框架。主要局限性包括:评估中发现的自动指标(DNSMOS OVRL)可靠性问题,以及赛后更换指标的决策;挑战赛结论主要基于参赛系统,可能无法完全代表该领域的所有最新进展;基线系统训练数据与评估数据存在显著域差异。

基线系统在EVAL-2上的结果(摘自论文Table V):

模型TER (↓)SIM (↑)DNSMOS P808 (↑)DNSMOS OVRL (参考)F1 (↑)
BSRNN_EMB0.8380.3572.851.800.830
BSRNN_EMB_CAUSAL0.8110.3702.721.670.831
BSRNN_TFMAP0.8390.3822.731.520.833
BSRNN_TFMAP_CAUSAL0.8080.3912.751.590.835

🔗 开源详情

  • 代码:论文中提及了以下代码仓库:
    1. 基线系统WeSep:https://github.com/REAL-TSE/wesep-real-tse
    2. 挑战赛官方工具包(用于提交检查和指标计算):https://github.com/REAL-TSE/REAL-TSE-Challenge
  • 模型权重:论文中未提及可用于直接下载的基线模型或提交系统模型的权重链接。
  • 数据集:挑战赛本身不提供训练数据,但评估数据(EVAL-1, EVAL-2)构成REAL-TSE基准。论文提及了以下用于训练或构成评估数据源的开源数据集:
    • 开发集来源数据集:REAL-T, AISHELL-4, AliMeeting, AMI, DipCo, CHiME6。
    • 提交系统常用训练数据:LibriSpeech/LibriMix, VoxCeleb, CN-Celeb, AISHELL, VCTK, EARS, WHAM!, MUSAN, DEMAND, DNS Challenge数据。 (注:以上为数据集名称,获取链接需访问其各自官方发布页,论文中未提供统一下载地址。)
  • Demo:论文中未提及在线演示或Demo链接。
  • 复现材料:论文提供了基线系统(基于WeSep)和官方工具包(用于评估和提交),并详细描述了基线系统的训练配置(如数据、训练轮数、模型变体),可用于复现。
  • 论文中引用的开源项目:
    1. WeSep(基线框架):https://github.com/REAL-TSE/wesep-real-tse
    2. REAL-TSE-Challenge(官方工具包):https://github.com/REAL-TSE/REAL-TSE-Challenge
    3. Zipformer(ASR骨干网络)
    4. WeSpeaker ResNet-34(说话人嵌入模型)
    5. FireRedVAD(语音活动检测)
    6. ECAPA-TDNN(说话人嵌入模型)
    7. TF-GridNet(提取器架构) (注:论文中提及了以上项目名称,但未直接提供其GitHub链接。)

🏗️ 方法概述和架构

本文的核心贡献并非提出一个新的模型架构,而是设计、实施并分析了一个面向真实世界目标说话人提取的完整评估框架(REAL-TSE Challenge)。其整体流程是一个从数据构建、任务定义、评估协议设计,到基线系统实现、组织竞赛、结果收集与分析的完整闭环。

主要组件/模块详解:

  1. 任务定义与赛道设置
    • 功能:明确评估任务和系统需满足的约束条件。
    • 结构/实现:定义了两个互补的赛道,以覆盖不同的应用场景。在线(Online)赛道针对延迟敏感型应用(如助听器、实时通信),要求系统以帧或块为单位处理,端到端算法延迟不超过100毫秒。延迟预算包括STFT/iSTFT、前瞻帧、块累积等引入的未来上下文,但不包括硬件计算和I/O时间,且通过扰动响应延迟测试进行验证。离线(Offline)赛道面向批处理场景(如会议转录),允许使用完整上下文、任意模型类别和无限制的推理成本。两个赛道的输入均为多说话人混合语音\(\mathbf{x}\)和目标说话人的注册语音\(\mathbf{e}\),输出为目标语音估计\(\hat{\mathbf{s}}\)
  2. 评估指标体系
    • 功能:从多个互补维度综合衡量TSE系统的质量,并用于系统排名。
    • 结构/实现:采用四个指标,并采用密集排名(dense ranking)后取平均的方式进行最终排名。
      • 可懂度—Token Error Rate (TER):使用Zipformer ASR骨干网络计算转录错误率,英文用词错误率,中文用字错误率,TER越低越好。
      • 说话人一致性—Speaker Similarity (SpkSim):计算输出\(\hat{\mathbf{s}}\)与注册语音\(\mathbf{e}\)的WeSpeaker ResNet-34嵌入的余弦相似度,分数越高越好。
      • 感知质量—DNSMOS:非侵入式语音质量评估器。论文最初考虑使用DNSMOS OVRL子分数,但赛后可靠性分析显示其易被过优化。最终采用对过优化不敏感的DNSMOS-P808作为官方指标,OVRL仅作参考。
      • 目标说话人活动—F1 Score:基于FireRedVAD检测的语音活动区域,衡量系统是否仅在目标说话人活跃时才输出语音,衡量时序精确率和召回率的调和平均。
  3. 数据集构建
    • 功能:提供真实、多样且具有挑战性的评估数据,以弥补模拟数据的不足。
    • 结构/实现:数据集分为三部分,共6991个试次,源自2309个混合语音,总时长11.3小时。开发集(DEV):源自REAL-T,基于AISHELL-4、AliMeeting等真实会议语料,包含1991个样本,用于调参,禁止用于模型训练评估集(EVAL):分为EVAL-1(域内,2000个样本,源数据同DEV)和EVAL-2(域外,3000个样本,新录制的会议室、咖啡馆、车内等场景对话)。EVAL-2的关键设计在于其多设备录制和跨信道配对。每个对话使用高质麦克风(H1/H2)、手机、头戴式麦克风同步录制,并收集了外部单说话人注册语音。这创造了如论文Table III所示的丰富信道配对(包括匹配与失配情况),专门用于测试系统在信道失配下的鲁棒性。数据包含中英文,具有真实的重叠率(约50%)和目标说话人活动率(约73%)。
  4. 基线系统
    • 功能:提供可复现的起点和对比基准。
    • 结构/实现:基于WeSep工具包实现4个BSRNN变体,全部在合成英文数据Libri2Mix-100上训练150个epoch。对比了两种注册条件注入方式:固定说话人嵌入 (ECAPA-TDNN)时频图(TF-Map)+上下文特征。同时对比了因果(Causal)非因果(Non-causal) 的BSRNN提取器。因果版本为满足延迟约束,将全局归一化改为特征轴归一化,双向LSTM改为单向。基线系统仅被视为下限参考,因其训练数据与真实评估数据存在巨大域差异。
  5. 竞赛组织与系统分析
    • 功能:收集参赛系统,分析技术趋势,提炼经验教训。
    • 结构/实现:这是报告的核心分析部分。论文通过对来自18个团队的24个有效提交系统的分析,提炼了影响性能的三个关键设计选择:(i) 数据策略:通过精心模拟(变化说话人数、信噪比、混响等)和真实数据自适应(如伪标签生成、多轮自训练)来逼近真实场景,被证明是提升性能最有效的方式。(ii) 提取器设计与条件注入:在线系统因延迟约束多为紧凑因果模型(BSRNN/TF-GridNet);离线系统探索更广泛的架构(如SSL、生成模型)。注册信息的注入方式多样,包括全局嵌入、帧级特征、TF-Map、前缀token等。(iii) 优化与后处理:普遍采用多目标损失(重建+说话人相似度+VAD等)和后处理(如增强、分支选择)。论文特别指出并分析了指标感知过优化的问题,包括在开发中使用官方验证脚本进行模型选择,以及极端情况下的对抗性扰动。

组件间的数据流:挑战赛组织者构建数据(DEV/EVAL)和开发基线代码与工具包 → 参赛团队开发系统 → 在隐藏的EVAL集上运行系统并向官方工具包提交结果 → 工具包统一计算四项指标并验证延迟 → 发布排行榜 → 组织者撰写分析报告,总结系统共性、进行条件级分析(设备、目标比例、场景等)并反思评估协议。

下图展示了在EVAL-2集上,不同录制设备对注册设备(enrollment-device)与混合语音设备(mixture-device)配对下的性能矩阵。

Figure 3: Enrollment-device by mixture-device performance matrix on EVAL-2.

该矩阵揭示了混合语音设备对性能的影响大于注册设备,其中使用H2麦克风(最远场)录制的混合语音在所有指标上均表现最差,说明了对远场信道鲁棒性的关键挑战。

关键设计选择及动机:选择真实对话录音而非模拟数据,是为了缩小与真实应用的差距,直面信道、混响、对话动态等挑战。选择多维度指标是为了全面评估,避免单一指标导致的系统偏向,但同时也暴露了多目标权衡的复杂性。设置在线/离线双轨是为了覆盖不同延迟需求的应用场景。采用开放训练数据策略(无官方训练集,但禁止使用评估数据的开发/测试分集)是为了鼓励利用多样化的开源数据和方法。

💡 核心创新点

  1. 构建面向真实世界的TSE评估基准:将TSE评估从依赖LibriMix等模拟读语音数据的范式,转移到基于真实中英文对话录音(REAL-TSE数据集)的范式。这解决了长期存在的评估环境与部署环境不匹配的根本问题,使评测结果更具实际参考价值。
  2. 多维度、多赛道评估框架:设计了同时评估可懂度(TER)、说话人一致性(SpkSim)、感知质量(DNSMOS)和活动检测(F1)的综合指标体系,并设立在线(低延迟)和离线(高精度)双赛道。这避免了单一指标优化,并允许对面向不同应用场景的系统进行公平比较。
  3. 揭示真实数据适配的关键作用:通过对参赛系统的分析,发现性能最强的系统并非依赖全新的模型架构,而是通过精心设计的数据模拟、真实数据自适应(如伪标签生成、多轮自训练)和多目标优化来使现有骨干网络(如BSRNN)适应真实场景。这为社区指明了一条比追求新架构更务实的提升路径。
  4. 主动识别并分析指标过优化问题:在竞赛结束后,论文敏锐地发现并公开分析了参赛系统对自动评估指标(如DNSMOS OVRL, SpkSim)的过优化甚至对抗性攻击现象。通过与主观MOS评分的相关性分析,论证了DNSMOS-P808的可靠性更优。这种对评估工具本身可靠性的反思,对社区健康、可持续发展至关重要。

📊 实验结果

论文作为SLT 2026 REAL-TSE Challenge的综述,其核心实验结果体现在对24个参赛系统的聚合分析与基线系统对比上。以下是论文中直接呈现的实验数据表格及关键结论。

下图分析了目标说话人在混合语音中的活动比例(Target Ratio)与系统性能(TER和F1)之间的关系。

Figure 4: Relationship between target ratio and F1/TER on EVAL-2.

结果显示,目标比例与活动检测F1分数呈强正相关,而与可懂度TER的相关性很弱,这表明目标比例是影响VAD性能的关键因素,但对提取语音的清晰度影响有限。

下图汇总了参赛系统在EVAL-2集不同场景下的平均性能。

Figure 2: Scenario-wise performance on the EVAL-2 set, computed by averaging all valid submissions separately for CN and EN and then taking a CN/EN macro average over shared scenarios.

图中可见,场景的难度排序并非直觉上的会议室>咖啡馆>车内,表明场景标签本身不足以预测TSE任务的真实难度,其内部的对话动态和声学条件变化更为关键。

下图以雷达图形式直观对比了在线和离线两个赛道中,排名前五的系统与基线系统在四个官方评估指标上的表现。

Figure 1: Metric balance of the top-5 valid systems in each track.

图中可见,尽管顶尖系统在所有指标上均显著优于基线,但没有任何一个系统能够在可懂度(TER)、说话人一致性(SIM)、感知质量(P808)和目标活动检测(F1)四个维度上同时取得最优,清晰地体现了真实世界TSE的多目标权衡特性。

基线系统性能

论文Table V报告了在合成英文数据上训练的四个基线系统变体在开发集(DEV)和两个评估集(EVAL-1, EVAL-2)上的详细结果。

表:基线系统在DEV、EVAL-1和EVAL-2上的结果(论文Table V)

集合模型TER (↓)SIM (↑)DNSMOS P808 (↑)DNSMOS OVRL (参考)F1 (↑)
DEVBSRNN_EMB0.6930.5012.821.660.841
BSRNN_EMB_CAUSAL0.7050.4922.691.630.829
BSRNN_TFMAP0.7030.5212.721.500.838
BSRNN_TFMAP_CAUSAL0.6520.5352.761.560.844
EVAL-1BSRNN_EMB0.8160.5072.911.910.827
BSRNN_EMB_CAUSAL0.8060.5002.761.780.807
BSRNN_TFMAP0.8370.5352.801.750.822
BSRNN_TFMAP_CAUSAL0.8010.5532.841.790.837
EVAL-2BSRNN_EMB0.8380.3572.851.800.830
BSRNN_EMB_CAUSAL0.8110.3702.721.670.831
BSRNN_TFMAP0.8390.3822.731.520.833
BSRNN_TFMAP_CAUSAL0.8080.3912.751.590.835

指标可靠性分析

论文Table VI对提交系统输出的人类MOS评分与DNSMOS各子分数进行了相关性分析,以评估自动指标的可靠性。

表:人类MOS与DNSMOS变体的相关性分析(论文Table VI)

范围样本数 (n)DNSMOS-OVRL LCCDNSMOS-OVRL SRCCDNSMOS-P808 LCCDNSMOS-P808 SRCCDNSMOS-PRO LCCDNSMOS-PRO SRCC
Track 1500+0.003+0.040+0.453+0.380+0.156+0.115
Track 2600+0.182+0.186+0.466+0.463+0.229+0.234
Overall1100+0.165+0.186+0.489+0.460+0.233+0.230

参赛系统性能

论文通过图示(Figure 1)展示了每个赛道排名前五的系统在四个官方指标上与基线系统的对比。论文未给出所有24个参赛系统的具体数值结果表格,但通过聚合分析报告了以下趋势:

  • 整体性能对比:排名前五的系统在所有四个指标上均显著优于基线系统。然而,没有任何一个系统能够在所有维度(TER, SIM, DNSMOS P808, F1)上同时领先,这表明真实世界目标说话人提取是一个多目标权衡问题。
  • 条件级分析(基于EVAL-2的聚合结果)
    • 设备与信道失配:混合语音的录制设备对性能影响大于注册语音设备。使用H2麦克风(最远场)录制的混合语音,其提取性能在所有指标上均最差,表明对远场信道的鲁棒性仍是关键挑战。总体而言,系统对混合语音与注册语音间的设备失配敏感性较低,但说话人相似度(SIM)指标对此失配较敏感,因为该指标以注册语音为参考。
    • 目标说话人比例:目标说话人在混合语音中的活动比例(Target Ratio)对活动检测F1分数有最显著的正面影响。对TER有微弱的负面影响,但相关性不强。
    • 场景难度:不同场景(会议室、咖啡馆、家、车内)的性能排序并不遵循直觉预期。论文指出,场景标签本身不足以预测难度,因为每个场景内的对话动态、说话人距离、局部噪声事件等变化巨大。

关键结论

  1. 真实数据适应是关键:参赛系统普遍通过精心模拟和真实数据自适应(如伪标签生成、多轮自训练)取得了显著性能提升,这被证明是优于仅使用合成数据训练的最有效策略。
  2. 多目标权衡:真实世界TSE是一个多目标问题,没有系统能在可懂度(TER)、说话人一致性(SIM)、感知质量(DNSMOS)和目标活动检测(F1)所有维度上同时占据绝对优势。不同应用可能侧重于不同指标。
  3. 指标可靠性问题:实验分析发现,最初考虑的感知质量指标DNSMOS OVRL与人类评分相关性很弱,容易在竞争中被过优化。而DNSMOS-P808与人类评分相关性明显更高,因此被采纳为官方指标。这凸显了在开发过程中直接优化公开评估指标的风险。
  4. 基线与上限:所有基线系统均在合成英文数据上训练,在真实评估集(特别是含中文和真实录音的EVAL-2)上表现较低(TER>0.8),可作为下限参考。参赛系统的大幅进步主要归功于数据策略和训练技巧,而非模型架构的根本创新。

🔬 细节详述

  • 训练数据未提供官方训练集。开放策略允许使用任何开源数据和预训练模型,但禁止使用DEV/EVAL数据的开发/测试分集进行训练。参赛者常使用的数据集包括LibriSpeech/LibriMix, VoxCeleb, CN-Celeb, AISHELL, VCTK, EARS, 以及噪声数据集(WHAM!, MUSAN等)和房间脉冲响应(RIR)数据。
  • 损失函数:论文总结参赛系统普遍采用多目标损失,但未给出具体公式。包括:
    • 重建损失(如SI-SDR/SI-SNR, 多分辨率STFT损失)。
    • 辅助损失:与官方指标对齐,如说话人相似度损失、DNSMOS相关损失、ASR/token级损失、VAD/活动检测损失。
  • 训练策略:论文总结参赛系统采用课程学习式的数据适配:从全重叠合成数据开始,逐步过渡到类会议混合数据,最后到真实远场录音。同时采用多目标损失和后处理。
  • 关键超参数未说明。基线模型使用了BSRNN结构,但具体参数(如学习率、优化器、批量大小)未提供。
  • 训练硬件未说明
  • 推理细节
    • 在线赛道:算法延迟需在20-100ms范围内,主要来自STFT/iSTFT帧移、前瞻帧、块累积等。论文使用扰动响应延迟测试进行验证。
    • 后处理:一些离线系统会使用增强模块(如vocoder重构)或生成多个分支(原始/增强),并根据说话人相似度等指标进行选择。
  • 正则化或稳定训练技巧未说明。但因果基线系统将双向LSTM改为单向,并用特征轴归一化替代全局归一化以满足因果性要求。

⚖️ 评分理由

  • 创新性 (1.5/2):系统层面构建了面向真实世界对话录音的TSE评估基准与竞赛框架,包含多赛道、多维度评估和真实数据集,推动了该领域评估范式的转移,并首次系统性分析了指标过优化问题,贡献明确且新颖。

  • 技术严谨性 (1.2/1.5):评估协议设计严谨,包含多维度指标、延迟验证(扰动测试)和指标可靠性分析(如DNSMOS OVRL与P808对比)。但赛后更换官方指标的行为,虽有数据支撑,仍暴露了评估协议设计的根本脆弱性。

  • 实验充分性 (1.2/1.5):提供了详细的基线系统结果、24个参赛系统的聚合分析、多维度的条件级结果分析(设备、目标比例、场景)以及指标可靠性的人类相关性实验。但基线系统训练数据(合成英文)与评估数据(真实中英文)的域差异过大,可能影响评估结论的精确性。

  • 清晰度 (0.9/1):论文结构清晰,任务定义、数据、基线、系统分析、教训各部分逻辑连贯。图表和表格有效支撑了论述。但EVAL-2场景分析部分承认场景标签无法完全反映真实难度,说明难度刻画维度有待更精细的定义。

  • 影响力 (1.5/1.5):作为SLT 2026的卫星挑战赛,直接推动了TSE技术从模拟数据向真实世界应用的评估与进步,对社区有明确的导向作用。揭示的“真实数据适配”关键路径和指标过优化问题具有重要实践意义。

  • 开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):对基线系统的描述(数据、模型变体、训练轮数)和工具包的使用方法是充分的。但论文对参赛系统的具体配置、超参数、训练细节等披露极为有限,关键配置大量缺失,影响了对顶尖系统结果的复现和深入理解。

  • 工程/实践价值 (1.5/1.5):提供了一个从数据构建、评估协议、基线实现到竞赛组织和结果分析的完整工程框架。对延迟预算的明确定义、验证方法的引入,以及针对指标攻击的反思,对工程实践具有直接指导价值。

🚨 局限与问题

  1. 论文明确承认的局限
    • 评估中发现的自动指标(DNSMOS OVRL, SpkSim)的可靠性问题,以及由此引发的对非侵入式指标过度依赖的担忧。
    • EVAL-2的场景标签无法完全反映TSE的真实难度,提示未来基准需要更细粒度的难度刻画(如重叠动态、说话人距离等)。
    • 挑战赛的结论主要基于提交的系统,可能无法代表该领域所有潜在的有效方法。
  2. 审稿人发现的潜在问题
    • 评估协议的根本脆弱性:虽然论文识别了过优化问题并更换了指标,但这本质上是一种“打补丁”的行为。它并未解决核心问题:当评估指标公开、可获取、且可能被直接用于模型优化时,其作为客观基准的权威性就会受到侵蚀。未来的挑战可能需要引入更严格的、参与者无法直接获取的评估流程(如隐藏测试集、在线评估服务器),或采用基于人类偏好的动态评估。
    • 数据偏差与代表性:尽管使用了真实数据,但EVAL-2的数据仍由挑战赛组织者录制和选择,可能存在选择偏差。其分布是否完全代表所有真实应用场景(如开放集市、嘈杂工厂)值得商榷。
    • 基线系统设计与评估目标的错位:所有基线都在合成英文数据(Libri2Mix-100)上训练,但评估集包含中文和真实录音。这种巨大的域差异使得基线分数普遍较低(如EVAL-2上TER>0.8),虽然被解释为“下限”,但也可能夸大了参赛系统的相对改进幅度,影响了对技术趋势的准确判断。一个在真实混合数据上微调过的更强基线或许更能揭示参赛系统的进步源于方法而非数据适配。
    • 赛后指标更换的公平性质疑:在竞赛结果公布后更换官方评估指标,即使有充分理由,也可能引发对竞赛公平性的讨论。这提示组织者需要在赛前对评估指标进行更极端的压力测试。

← 返回 2026-07-17 语音/音乐/音频论文速递