📄 Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

标签:#说话人日志 #模型评估 #语音识别 #基准测试 #多语言

7.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5

7.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #说话人日志 | #模型评估 | #语音识别 #基准测试 | arxiv

👥 作者与机构

  • 第一作者:Deovrat Mehendale(Sarvam AI, AI4Bharat, IIT Madras)
  • 通讯作者:未明确标注(论文使用公共邮箱 deovrat.mehendale@gmail.com, adityam0309@gmail.com, dhruvsubhashrathi@gmail.com
  • 作者列表:Deovrat Mehendale(Sarvam AI, AI4Bharat, IIT Madras)、Aditya Mehndiratta(Sarvam AI, AI4Bharat, IIT Madras,以公共邮箱标注)、Dhruv Rathi(Sarvam AI, AI4Bharat, IIT Madras,以公共邮箱标注)、Kaushal Bhogale(Sarvam AI)、Mitesh M. Khapra(Sarvam AI, AI4Bharat, IIT Madras)

💡 毒舌点评

亮点:首次全面覆盖印度宪法承认的全部 22 种语言的多说话人 ASR+diarization 联合基准,108 小时的三场景(近场/远场/野外)数据填补了一个明确的生态空白;联合评估 cpWER/WDER 的实验设计比传统 decoupled 评估更贴近生产实际;code-mixing 感知的双重转写协议是印度语言 ASR 评估中实际而长期被忽略的痛点。

短板:贡献本质是"数据集+跑分",缺乏方法论创新;标注质量缺乏量化证据(inter-annotator agreement 完全未报告),使得"三级人工校验"的质量声称缺乏实证支撑;作为"benchmark"却未提供官方评估工具包或标准化评估脚本,复现基线存在不必要摩擦;108 小时总量偏小,且 14 种低资源语言仅约 1.5 小时,统计可靠性堪忧;所有基线系统均为商业 API,版本未固定,基准的纵向可比性存疑。

📌 核心摘要

  1. 要解决什么问题:填补印度 22 种官方语言在"联合说话人日志与语音识别(speaker-attributed ASR)“上的基准空白。现有数据集要么缺少印度语言覆盖(如 AMI、CALLHOME),要么将 diarization 与 ASR 评估解耦(如 DISPLACE 将 ASR 评估放在独立的单说话人干净子集上),无法反映真实多说话人转录流水线的综合性能。
  2. 方法核心是什么:系统性地构建一个约 108 小时的对话语料库,覆盖近场会议(~53h)、远场会议(~27h)和野外 YouTube 音频(~28h)。所有音频经过五阶段人机协同标注(Bootstrap ASR→人工转写与说话人归属→code-mixing 双格式转写→QC 检查→专家审查),提供 RTTM 格式的说话人时间戳和两种文本转写格式(本族文字、罗马化英语混合)。基线评估 8 个系统(Sarvam、AWS Transcribe、Deepgram Nova-3、ElevenLabs Scribe、Azure STT、AssemblyAI Universal-2、GPT-4o Transcribe、Gemini 3 Pro),使用 DER、cpWER、WDER 三维度指标。
  3. 与已有方法相比新在哪里:与 DISPLACE 等先行工作相比,首次实现(a)22 语言全覆盖而非仅 5-7 种;(b)joint diarization+ASR 标注而非将 ASR 评估解耦到单说话人子集;(c)多场景统一评估(近场+远场+野外);(d)专门处理英语 code-mixing 的双重转写协议。
  4. 主要实验结果如何
    类别模型DER (%)cpWER (%)WDER (%)Miss (%)FA (%)Confusion (%)
    Indic-Spec.Sarvam16.038.833.16.33.95.9
    Comm. APIsAWS Transcribe23.543.734.313.13.17.4
    Comm. APIsElevenLabs Scribe35.058.340.713.66.215.3
    Comm. APIsAzure STT34.860.839.524.41.78.7
    Comm. APIsDeepgram Nova-332.063.239.318.35.48.3
    Comm. APIsAssemblyAI40.588.643.725.55.59.6
    Multimod. LLMsGPT-4o36.283.140.417.73.814.7
    Multimod. LLMsGemini 3 Pro74.058.933.041.75.826.5
    印度专研系统 Sarvam 全面领先;Multimodal LLM 出现奇特分化(Gemini 3 Pro 的 WDER 好但 DER 极差,源于遗漏检测严重,占比 41.7%);语言间性能差异大(Telugu cpWER 51%, Urdu 26%);重叠率与错误强相关。
  5. 实际意义是什么:为印度语言社区提供首个标准化的 multi-speaker 联合评估平台,可直接指导面向 10 亿级人口的会议转录、客服分析、多说话人对话系统等应用的模型选型和技术改进。
  6. 主要局限性是什么:野外数据仅覆盖 10/22 语言;不提供说话人 ID(野外子集);总时长 108 小时偏小,低资源语言仅约 1.5 小时;定位为评估集而非训练集;未提供官方评估工具包或基线模型权重;所有基线为商业 API,版本未固定,长期纵向可比性存疑。

🔗 开源详情

  • 代码:论文中未提及代码链接,未提供官方评估工具包
  • 模型权重:论文中未提及
  • 数据集:Indic DiarBench,获取链接:https://huggingface.co/datasets/sarvamai/indic-diarbench
  • Demo:论文中未提及
  • 复现材料:论文中未提及基线系统输出的存档或固定版本快照
  • 论文中引用的开源项目:Pyannote(论文中未提供链接,仅作为排除说明引用)

🏗️ 方法概述和架构

Indic DiarBench 是一个"数据集构建+基线评估"的标准基准范式,不涉及 novel 模型架构。论文的核心方法可以分解为两个独立但互补的流水线:数据集构建流水线评估流水线

一、数据集构建流水线(Data Construction Pipeline)

该流水线包含三个阶段:数据采集→标注→质量控制,每个阶段都有严格的操作规程。

论文定义了三种声学场景,每种场景有独立的采集协议:

  • 近场会议(Near-field, ~53h):每位参与者使用独立的近距离麦克风,通过在线会议平台虚拟参与(非共址)。这种设计的关键动机是利用独立声道精确捕获说话人时间戳,从根本上降低标注时的说话人混淆。每场会议 2-9 人,参与者在实验前获得讨论话题和辩论题库以激发自然交互,但开场热身部分被裁剪以确保保留的是自发对话。该子集覆盖全部 22 种语言,前 8 种高资源语言各约 4 小时,其余 14 种各约 1.5 小时。

  • 远场会议(Far-field, ~27h):使用远距离麦克风采集,有意引入混响、背景噪声和说话人-麦克风距离变化。该场景仅覆盖前 8 种高资源语言(每种约 1.4-4.2h,2-8 说话人)。噪声抑制设为"低"以保留自然声学伪影。

  • 野外音频(In-the-wild, ~28h):从 YouTube 公开视频中策展,覆盖 10 种语言(每种约 2h)。选择标准为:(a)持续的多说话人交互;(b)无广告或音乐主导段;(c)有清晰视觉线索可辅助标注者识别活跃说话人。每个 YouTube 频道仅取一个视频以保证说话人唯一性,后续通过说话人嵌入聚类+人工验证排查跨视频重叠。

说话人多样性:485 名会议参与者来自印度 189 个行政区,性别均衡,覆盖城乡和多教育背景。野外音频额外包含约 750 名说话人。

采用五阶段人机协同标注,核心设计选择是"机器辅助+人工校验"而非全自动,以平衡效率与准确性:

  • 阶段1:Bootstrap Transcription。使用多个独立 ASR 系统(公开模型+商业 API)生成初始转写,标注者看到的是一份可编辑草稿而非空白文档。这种做法降低了标注负担,同时通过多系统融合避免了单一系统偏置。

  • 阶段2:Human Transcription and Speaker Attribution。专业标注员逐段校验和修正词序列、时间戳和说话人标签。两条关键规则:(a)机器标注未经人工校验不得保留;(b)对于近场会议(已知说话人总数且有独立声道),标注员可调整时间戳和标签但不可新增说话人;对于野外音频(有视觉线索),标注员可新增/合并/删除说话人标签。

  • 阶段3:Code-Mixed Transcription。针对印度语言频繁的英语语码混合,标注员产出两份转写:(1)本族文字格式——包括英语词也以印度文字书写;(2)规范化格式——英语词用罗马字母,数字用阿拉伯数字。WER 计算时两种格式均视为正确匹配,避免因输出约定差异惩罚模型。

  • 阶段4:Quality Control。每语言 2-3 名专职 QC 人员检查转写一致性、语码混合规范、数字表示、非语音标签(<laughter><noise><cry> 等)以及说话人时间戳和标签。特别注意重叠语音段,常需多轮审查。微小问题直接修正,重大问题退回标注员返工。

  • 阶段5:Expert Review。每文件经一名内部语言专家(superchecker)终审。专家不直接修正,而是识别系统性问题并将不合格标注退回修订,直至质量达标。

该流水线的质量控制不是单点检查,而是三层递进过滤:QC 检查员(捕获错误实例)→ 专家审查(识别系统性问题模式)→ 返工机制。这种设计确保了质量问题的根本性解决而非表面修补。

二、评估流水线(Evaluation Pipeline)

论文采用三指标联合评估体系,每个指标揭示不同的系统能力维度:

  • DER(Diarization Error Rate):声学层面的说话人分段误差,包含遗漏检测(Miss)、虚警(FA)和说话人混淆(Confusion)。不使用 forgiveness collar,包含重叠语音。这是纯粹的 diarization 质量度量,不与 ASR 质量耦合。

  • cpWER(Concatenated minimum-permutation Word Error Rate):先基于说话人排列的最小化 WER 原则对输出段进行重排,再拼接计算总体词错误率。该指标主要反映 ASR 的转录质量,在说话人排列已优化后对 diarization 错误相对不敏感。

  • WDER(Word Diarization Error Rate):明确惩罚说话人归属错误——将词分配给错误说话人的惩罚比 cpWER 更重。该指标直接度量"谁在什么时候说了什么"的综合准确性,是 joint ASR+diarization 最严格的标准。

论文选择这三个指标的深层逻辑是:DER 隔离 diarization 性能,cpWER 隔离 ASR 性能,WDER 整合两者,三者共同构成完整的系统能力画像。

仅纳入能产出 joint ASR+diarization 输出的系统(因此排除 Pyannote 等纯 diarization 模型)。所有系统接收相同的单通道混合音频,确保公平比较。系统覆盖三类:(a)印度专研 API(Sarvam);(b)通用商业 API(AWS Transcribe, Azure STT, Deepgram Nova-3, ElevenLabs Scribe, AssemblyAI Universal-2);(c)多模态大语言模型(GPT-4o Transcribe, Gemini 3 Pro)。所有基线系统为现有商业或公开 API,其内部技术细节不在本文讨论范围内。

💡 核心创新点

  1. 首个覆盖全部 22 种印度官方语言的联合 diarization+ASR 基准:在此之前,DISPLACE 仅覆盖 5-7 种语言且将 ASR 评估解耦到独立的单说话人干净子集,CALLHOME 仅有 6 种语言的电话对话但无印度语言。Indic DiarBench 解决了"多语言多说话人联合评估"这一未被满足的需求,特别是把 14 种极低资源语言(如 Sanskrit、Santali、Bodo)首次纳入标准化 diarization 评测框架。
  2. 多声学场景统一评估设计:将近场(独立声道黄金标注)、远场(真实混响噪声)和野外(完全无约束)三类数据纳入同一基准,使模型能力在不同退化程度上被系统刻画。这与 DIHARD 的多领域评测哲学一致,但聚焦印度语言场景的特异性(如高重叠率、英语语码混合)。
  3. code-mixing 感知的转写与评估协议:设计双重转写格式(印度文字全部书写 vs. 英语罗马化),WER 计算时双向容错。这解决了多语混合场景下输出格式不一致导致的 WER 虚高问题——这是印度语言 ASR 评估中长期被忽略但在实际应用中极为常见的痛点。
  4. DER 误差分解与 cpWER/WDER 联合解读框架:通过并排列出 Miss/FA/Confusion 误差组分,以及 cpWER 和 WDER 的对比分析(如 Gemini 3 Pro 的 WDER=33.0% 优秀但 DER=74.0% 极差),揭示了一个重要的系统行为洞察:现代 LLM 在正确识别段上的 ASR 质量可能很高,但严重的遗漏检测(41.7% Miss)使其无法形成可用的 diarization 输出。

为展示数据集的广泛地理覆盖和说话人多样性,下图可视化了印度各行政区的语言数据收集点。

Figure 1: Speaker Data Collection by District and Language

地图用不同颜色标注了22种语言在189个行政区的分布,共有485名会议参与者,直观体现了数据集覆盖全部印度官方语言的创新性。

📊 实验结果

下表为所有 22 种语言、三种声学场景的时长加权平均值。

类别模型DER (%)cpWER (%)WDER (%)Miss (%)FA (%)Confusion (%)
Indic-Spec.Sarvam16.038.833.16.33.95.9
Comm. APIsAWS Transcribe23.543.734.313.13.17.4
Comm. APIsElevenLabs Scribe35.058.340.713.66.215.3
Comm. APIsAzure STT34.860.839.524.41.78.7
Comm. APIsDeepgram Nova-332.063.239.318.35.48.3
Comm. APIsAssemblyAI40.588.643.725.55.59.6
Multimod. LLMsGPT-4o36.283.140.417.73.814.7
Multimod. LLMsGemini 3 Pro74.058.933.041.75.826.5

说话人重叠是影响联合系统性能的关键因素,下图展示了Sarvam模型在不同重叠率下的指标变化。

Figure 3: Metrics variation vs overlap ratio

随着重叠率从约5%增加到25%,DER、WDER和cpWER均显著上升,图中可见重叠语音对说话人日志和ASR错误率的负面影响。

按语言的 cpWER 结果(Figure 2a,Sarvam 系统)

cpWER 范围语言及数值
<30%Santali (28%), Urdu (26%)
30-44%Bengali (35%), Gujarati (27%), Hindi (31%), Konkani (41%), Malayalam (38%), Marathi (34%), Odia (37%), Punjabi (34%), Sindhi (44%)
45-59%Assamese (46%), Bodo (59%), Dogri (53%), Kannada (51%), Kashmiri (58%), Manipuri (56%), Nepali (49%), Sanskrit (51%), Tamil (48%), Telugu (51%)
60-74%Maithili (65%)
≥75%(无)
N/A(部分商业 API 不支持的语言,Sarvam 全覆盖)

按语言的 WDER 结果(Figure 2b,Sarvam 系统)

WDER 范围语言及数值
<15%(无)
15-24%Urdu (18%)
25-34%Assamese (32%), Bengali (28%), Gujarati (27%), Hindi (32%), Kannada (30%), Malayalam (35% 边界), Marathi (33%), Odia (32%), Punjabi (39% 边界), Santali (34%), Sindhi (35% 边界)
35-49%Bodo (44%), Dogri (41%), Kashmiri (58%*), Konkani (49%), Nepali (42%), Sanskrit (39%), Tamil (41%), Telugu (44%)
≥50%Maithili (50%), Manipuri (56%)
*注:Kashmiri 的 WDER 为 58%,实际属于 ≥50% 范围,论文热力图色阶划分可能有视觉偏差。

重叠率影响分析(Figure 3)

Sarvam 模型的 DER 和 cpWER 随重叠率增加而显著上升:在最低重叠场景(约 5% overlap),DER 约 8%,cpWER 约 28%;在最高重叠场景(约 25% overlap),DER 约 24%,cpWER 约 48%。Telugu(20.4% overlap, 4.5 avg speakers)是最难语言之一,DER 27.7%。

按采集场景细分

近场(NF)因独立声道标注质量最高,但 Telugu 等语言因高重叠仍表现差。野外(ITW)因低重叠(6.5%)和清晰轮次转换,性能最佳。远场(FF)引入混响噪声后,所有指标均有不同程度恶化。12 种仅出现在近场的低资源语言表现出更高的 DER 和 cpWER。

语言家族对比

Dravidian 语系(Kannada, Malayalam, Tamil, Telugu)近场 cpWER 比 Indo-Aryan 语系平均高约 5 个百分点,在可比 DER 水平下。

误差分解洞察

  • Sarvam:误差分布均衡(Miss 6.3%, FA 3.9%, Confusion 5.9%),无单一主导失效模式。
  • Gemini 3 Pro:遗漏检测占主导(Miss 41.7%, Confusion 26.5%),主要因为不可靠的时间戳和对小片段话语(如肯定词和插话)的遗漏。
  • Azure STT:虚警率极低(FA 1.7%)但遗漏检测高(Miss 24.4%),因为保守的 VAD 策略。
  • AWS Transcribe:误差分解相对均衡(Miss 13.1%, FA 3.1%, Confusion 7.4%)。

🔬 细节详述

  • 总时长:约 108 小时(近场 53.2h, 远场 26.8h, 野外 27.6h)
  • 语言覆盖:22 种印度宪法第八附表语言(Assamese, Bengali, Bodo, Dogri, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Maithili, Malayalam, Manipuri, Marathi, Nepali, Odia, Punjabi, Sanskrit, Santali, Sindhi, Tamil, Telugu, Urdu)
  • 语系覆盖:4 个语系(Indo-Aryan, Dravidian, Sino-Tibetan, Austroasiatic)
  • 说话人:485 名会议参与者(来自 189 个地区),野外约 750 名说话人(前 10 种语言)
  • 重叠率:平均 12.8%,范围 6.1%(Punjabi)至 24.7%(Maithili)
  • 转写格式:两种 —— 本族文字形式 + 规范化形式(英语罗马化)
  • 标注格式:RTTM(说话人时间标注)+ 分段级说话人归属转写
  • 质量控制:3 级人工校验(标注员→QC 检查员→专家审查),未提供 inter-annotator agreement 数值
  • 数据集用途定位:仅用于评估,不适用于训练
  • 野外数据说话人 ID:不提供
  • 野外数据语言覆盖:仅 10/22 语言

实验配置(仅针对基线评估)

  • 评估音频处理:所有系统接收相同单通道混合音频
  • DER 计算配置:无 forgiveness collar,包含重叠语音段
  • 语言支持不完全:部分商业 API 不支持所有 22 语言,导致全局平均值存在偏差,论文故使用时长加权聚合
  • 论文中未说明:GPU 型号、评估硬件、推理延迟、成本分析、评估脚本的具体实现、统计显著性检验

基线系统细节(论文中提供的信息)

  • Sarvam:印度语言专研 ASR+diarization 系统,未披露架构细节
  • AWS Transcribe:具体版本未说明
  • Azure STT:具体版本未说明
  • Deepgram Nova-3:具体版本未说明
  • ElevenLabs Scribe:具体版本未说明
  • AssemblyAI Universal-2:具体版本未说明
  • GPT-4o Transcribe:多模态 LLM,未说明具体 API 版本或配置
  • Gemini 3 Pro:多模态 LLM,未说明具体 API 版本或配置

损失函数、训练策略、超参数等

论文定位为数据集+基准评估,不涉及模型训练,因此无损失函数、训练策略、超参数等内容。所有基线系统为现有商业或公开 API,其内部技术细节不在本文讨论范围内。

⚖️ 评分理由

  • 创新性 (1.2/2):首个覆盖印度全部22种官方语言的联合说话人日志与ASR基准,填补多语言多说话人评估空白;多声学场景统一设计与code-mixing双重转写协议具有明显的领域创新性。

  • 技术严谨性 (0.8/1.5):标注流水线设计详细,但未报告inter-annotator agreement等量化指标,削弱标注质量声称;低资源语言仅限近场,远场和野外覆盖不足;未进行数据泄漏检测,且远场标注的对齐方法未说明,影响数据集构建的严谨性。

  • 实验充分性 (0.8/1.5):缺少与Pyannote+独立ASR的级联基线,无法判断联合系统的相对增益;未评估流式在线场景;未报告置信区间,低资源语言统计可靠性存疑;code-mixing双格式容错的潜在掩盖问题未分析,实验设计充分性受限。

  • 清晰度 (1.0/1):论文结构清晰,数据采集、标注流水线与评估设置描述条理分明,图表表达合理,未发现明显表达或组织问题。

  • 影响力 (1.0/1.5):为印度语言社区提供首个标准化多说话人联合评估平台,直接支撑10亿级人口的会议转录、客服分析等应用,具有重要的社区推进与实际部署指导价值。

  • 开源 (1.0/1.5):数据集已通过HuggingFace公开发布,但未提供官方评估工具包或基线输出快照,仅部分开放基准所需的核心资源。

  • 可复现性 (0.1/0.5):所有基线系统为商业API且版本未固定,未提供输出存档;评估脚本缺失,严格复现结果几乎不可行;部分构建细节如远场对齐方法未披露。

  • 工程/实践价值 (1.2/1.5):联合三维度评估贴近真实多说话人转录需求,覆盖多声学场景和语码混合,能直接指导面向印度语言的工业级ASR+diarization系统选型与优化。

🚨 局限与问题

  1. 野外数据集不完整:野外音频仅覆盖 10 种语言,扩展至全部 22 语言列为未来工作。
  2. 不提供野外数据说话人 ID:无法追踪野外录音中的跨会话说话人身份。
  3. 仅用于评估而非训练:数据集规模(108h)不足以支撑模型训练,只设计为评测集。

审稿人发现的潜在问题

  1. 基准的持续维护性问题:所有基线系统均为商业 API,其底层模型版本持续更新。今天报告的 DER=16.0(Sarvam)可能在 API 更新后变为 DER=10.0 或 DER=25.0。除非冻结特定 API 版本并保存输出文件作为永恒基线,否则这个基准在 6 个月后将无法纵向比较。论文未提供基线系统输出的存档或固定版本快照机制。
  2. 评估集与训练集的污染风险:印度语言语音社区规模较小,22 种语言的标准化语音数据有限。基线商业系统(如 Sarvam)很可能在训练阶段使用了与 Indic DiarBench 重叠的录音来源或标注员群体,存在数据泄漏风险。论文未讨论任何泄漏检测措施(如训练集查询、说话人重合度检查)。相比之下,DIHARD 和 NOTSOFAR-1 等基准有明确的训练/评估分离协议。
  3. cpWER 和 WDER 的评估未提供开源实现:这两个指标虽然在文献中有定义,但具体实现细节(如最优置换计算的匈牙利算法参数、空段处理、时间对齐容差)可能因实现差异导致不同评估者的结果偏差 \(\pm 1-2\%\)。作为"标准化基准”,官方评估脚本的缺失是严重的实用性缺陷。
  4. 108 小时覆盖 22 语言的统计可靠性问题:14 种语言仅约 1.5 小时/语言。以平均约 15% 重叠率、每段 3 秒计算,这意味着每种低资源语言仅约 1800 个语音段。在 DER \(\approx 25\%\)、cpWER \(\approx 50\%\) 级别的性能下,这种样本量可能无法区分真实的 3% 性能差异是由于模型能力还是采样噪声。缺乏置信区间报告使得细粒度性能比较不够可靠。
  5. code-mixing 的"双格式容错"可能掩盖真实错误:WER 计算允许英语词的本族文字形式或罗马化形式任一种匹配,这实际上创造了一个"双标签"宽松评估。虽然这防止了格式约定差异导致的惩罚,但也可能掩盖真正的 ASR 错误——例如模型错误地将"computer"转录为正确英文,但因评估器接受两种格式,该混淆可能与真正的混淆(如错误将印地语词转写为英语)混入同一误差池,无法区分。论文未分析这两种容错场景的发生频率。
  6. 远场数据的 ground truth 并非真正独立:远场会议虽用远距离麦克风录制,但标注仍可能借助近场参考音频(论文未明确说明远场标注是否使用了独立声道信息)。如果标注过程使用了独立声道信息,则远场数据的 ground truth 质量依赖于跨声道对齐精度,这可能引入 alignment noise——论文未报告远场到近场的时间对齐方法和精度。
  7. 未评估流式/在线场景:所有基线系统在离线模式下评估(全音频处理后输出),但真实会议场景需要低延迟流式转写。缺少在线性能评估(如 word-level latency, streaming DER)限制了该基准在实际部署场景中的指导价值。
  8. 缺少与 pyannote 等纯 diarization 系统的级联基线:论文仅比较 joint ASR+diarization 系统,但未提供"pyannote 做 diarization + 独立 ASR 做转写"的级联基线。这使得读者无法判断 joint 系统相比传统级联方案是否有实质性收益,也无法评估 diarization 和 ASR 各自对最终 WDER 的贡献权重。
  9. 低资源语言的远场和野外数据完全缺失:14 种低资源语言仅有近场数据,无法评估其在真实退化声学条件下的系统鲁棒性。这意味着对这些语言的"基准覆盖"仅在理想声学条件下有效,实用性大打折扣。

← 返回 2026-07-28 语音/音乐/音频论文速递