英文题目:Tarsila-ASR: A Multi-Domain Test Suite for Benchmarking Brazilian Portuguese Speech Recognition
会议身份:
conference:interspeech:2026:conference-paper-id:leal26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #基准设计 #语音 #语音识别
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Sidney Leal:机构信息未能从会议 PDF 纯文本可靠映射
- Ariadne Matos:机构信息未能从会议 PDF 纯文本可靠映射
- Edresson Casanova:机构信息未能从会议 PDF 纯文本可靠映射
- Frederico Gonçalves:机构信息未能从会议 PDF 纯文本可靠映射
- Renato Moraes Silva:机构信息未能从会议 PDF 纯文本可靠映射
- Arnaldo Cândido Jr:机构信息未能从会议 PDF 纯文本可靠映射
- Sandra Aluísio:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
针对巴西葡萄牙语自发语音转写任务,系统输入为多口音、多场景语音,输出为保留填充、犹豫、截断等口语现象的文本,难点在于朗读域预训练模型在自发条件下严重退化。该工作先汇聚CORAA ASR、NURC-SP、MuPe Life Stories、Common Voice 17.0、Multilingual LibriSpeech、Multilingual TEDx等公开语料的测试划分,统一为16kHz音频并保留文本、时长与音频字段,新增来源与性别字段,形成62094条、共72.46小时的统一评测集。再用该评测集对MuPe-ASR、Whisper-large-v3、Omnilingual 7B做零样本诊断,然后在聚合的1156小时训练集加39小时验证集上对Distil-Whisper、Whisper-medium/large-v3、Omnilingual 300M/1B做监督微调并按验证词错误率选点。与仅在单一口音或朗读数据上训练的已有基线相比,关键差异在于以多地域多文体覆盖逼近真实会话分布,并联合词错误率Word Error Rate/WER、字符错误率Character Error Rate/CER、语义分与实时率Real Time Factor/RTF评测。在Tarsila-ASR上微调后Whisper-large3-ft-75k取得WER为15.40%、CER为9.11%、BERTScore为97.84的最佳字面精度,显著优于未适配对照。结论仅适用于巴西葡萄牙语自发、准备式与朗读混合的离线转写,未验证流式、强噪声与跨语言外推,原文未披露训练推理成本与统计显著性。
🔗 开源与复现资源
- 代码相关资源:https://github.com/nilc-nlp/tarsila-asr — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/nilc-nlp/tarsila-asr — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/nilc-nlp/tarsila-asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪件具体事?
本文的输入是巴西葡萄牙语的连续语音波形,输出是对应的文字转写。目标读者是刚进入语音领域的研究生,需要先分清任务类型:这里不是朗读语音识别,不是把干净录音转成规范书面语,而是会话式自动语音识别,要把访谈、对话、课堂讨论和舞台演讲等真实说话原样转出来,包括填充词、犹豫、重复和截断。论文要解决的具体事情有三件。第一,缺少一个统一的多域测试集,以往工作各用各的数据,口音、风格和标注不一致,模型之间无法公平比较。
第二,开源大模型在朗读上很好,但在自发语音上掉点严重,需要量化这种掉点发生在哪些子集。第三,用更多样化的会话数据微调强基线,看能否建立新的可复现的最优参考,并公开基准、检查点、脚本和代码。需要保留的关键信息是基准规模、构成、训练数据量、评测模型、指标方向和硬件条件。输出是 1 篇能复述方法的技术解读,不做营销式判断,所有数字回到原文核对。
论文明确指出,自发语音的鲁棒性不仅是识别问题,还关系到自发风格语音合成和实时语音到语音对话模型的输入质量,因此保留口语现象本身就是评测要求。理解这一点,后面看到词错误率偏高时就不会简单归因于模型太小,而会先检查说话风格和标注是否匹配。
同输入同目标的前人路线走到了哪里,还缺什么?
在巴西葡萄牙语方向,前人沿着数据规模和口音覆盖两条线推进。早期公开数据只有几十小时,近五年扩大到约 1521 小时葡萄牙语语音,其中自发语音不到 894 小时,主要来自 CORAA ASR、NURC-SP 和 MuPe。CORAA ASR 整合了 ALIP、C-ORAL BRASIL、NURC-Recife、SP2010 和 TEDx,覆盖 3 个州约 290 小时,并发布了基于 Wav2Vec2 XLSR-53 的模型。后续工作在 239 小时 NURC-SP 音频上微调了 Wav2Vec2-XLSR-53 和 Distil-Whisper,但口音以圣保罗市为主,声学多样性不足。MuPe 生活故事语料提供了 365 小时访谈,覆盖 17 个州、不同性别年龄教育程度,并在其上微调 Distil-Whisper,发现了与年龄和教育相关的偏差,但只做了一个架构,缺少多模型横向比较。
常用资源还包括 131 小时朗读的 Multilingual LibriSpeech 巴西子集、158 小时的 BRSDv2、164 小时葡萄牙语 TEDx 演讲、211 小时的 Common Voice 17 版其中 175 小时已验证。欧洲葡萄牙语方面有 425 小时数据集和 46 小时多域测试,但论文强调巴欧两种变体在发音、语速、词汇和语法上有实质差异,必须分开建模和评测。缺口很明确:没有一个同时抓住语言多样性、声学多样性和统一评测协议的巴西自发语音基准。本文的定位就是把已有公开工作的测试切分统一起来,而不是再采一批新录音,从而让不同模型在同一套多域条件下可比。
为什么朗读测得准不等于对话能用?
举一个教学用的例子帮助理解,不代表论文数据。假设同一句话,先是播音员照稿念出来,再是两个人在咖啡馆边想边说,中间夹着嗯、啊、说到一半改口和尾音吞掉。声学上,后者语速不均、能量起伏大、背景更杂;语言上,后者充满不完整词和语气词。如果评测只用朗读,模型只要学会干净发音到规范文字的映射就能得低错误率。
一旦放到对话,同样声学模型会遇到没见过的停顿分布和截断词,语言模型也会被口语词序打乱,错误率自然上升。论文用证据把这个直觉具体化:Whisper 和 Omnilingual 在以朗读为主的子集上表现强,但在自发条件下明显下降,原因被归为两点,一是自发语音的流利性缺陷、说话人变化和声学多样性,二是 MuPe-ASR 训练语料与其他语料在缩写和数字表示等标注规范上更接近,导致跨集不一致。也就是说,问题既有信号难,也有评测和标注不一致带来的系统偏差。
研究生容易误以为换更大模型就能解决,论文的对照提醒我们,如果预训练分布本身偏向朗读和准备好的演讲,那么不做域内适配,再大的模型也会在对话上露出差距。这正是需要多域基准的原因:把朗读、准备型演讲、自发对话放在同一把尺子下,才能看出模型到底是真鲁棒还是只在干净集上好看。
Tarsila-ASR 全景:从分散测试集到统一基准走了哪几步?
Tarsila-ASR 的方法全景可以沿着一个样本走完。起点是分散在各公开语料中的测试切分,例如一段来自 CORAA 的对话或一段 MuPe 访谈,附带各自的元数据格式和采样率。第一步是下载和归一化,论文写明开发了下载、归一化和合并脚本,只保留文本、时长和音频三列,另加两列,一列是来源子集标识,另一列是用语音性别分类器估计的性别,所有音频统一到 16 kHz 采样率。
第二步是合并,得到 62094 个样本、共 72.46 小时,性别约为 48% 女性对 52% 男性,覆盖圣保罗州城市、米纳斯吉拉斯、累西腓、圣保罗市、TEDx 舞台演讲、Common Voice 朗读、Multilingual LibriSpeech 朗读、MuPe 访谈、NURC-SP 对话会议课堂等,口音从地方口音到混合口音,说话风格从自发、准备型到朗读。第三步是评测,先用 3 个代表性开源系统做零样本诊断,再用聚合的训练验证集微调多个架构,最后在统一基准上报告词错误率、字错误率、BERTScore、SeMaScore 和两块显卡上的实时率因子。
整个安排的理由是保持测试纯粹来自已有工作的测试切分,避免用训练数据污染评测,同时用统一采样率和最小公共字段消除工程差异,让差异真正来自模型和说话条件。复述时要记住顺序:先统一测试,再诊断差距,再做多样化微调,而不是先微调再拼测试。
基准里装了哪些口音和风格?一个样本经历了什么?
基准的组件按来源子集划分,每个子集是一类说话条件的代表。coraa-alip 是访谈和对话,圣保罗州城市口音;coraa-coral 是独白对话和交谈,米纳斯口音;coraa-nurcrec 是对话访谈会议和课堂,累西腓口音兼有自发和准备型;coraa-sp2010 是交谈访谈和朗读,圣保罗市。
coraa-tedx 是舞台演讲,混合口音准备型;cv17 是众包朗读,混合口音;mls 是朗读书,混合口音;mupe 是访谈,自发为主且以圣保罗为主的混合口音,样本量最大;nurcsp 是对话访谈会议课堂,圣保罗市。
tedx 是舞台演讲准备型。跟踪一个样本,例如一段 2 秒的 coraa-sp2010 对话片段,它先被重采样到 16 kHz,只保留文本、时长和音频,加上来源标签和估计性别,然后进入 62094 样本池。在评测时,同一段音频被送给不同模型解码,比较转写与参考文本的差异。论文保留性别列的目的是让后续能检查偏差,但性别是模型估计值,不是人工标注,复现时不能当作金标准使用。
自发语音 × 朗读语音: 自发语音指访谈、对话中带填充词、犹豫、截断和重叠的自然说话,负责带来真实的声学和语言扰动;朗读语音指照稿念出的规范语音,负责提供干净可控的声学对照。二者搭配的原因是只看朗读会高估模型,论文用朗读子集和自发子集并列,才能暴露从可控录音到会话场景的域失配,组合意义是让评测同时检验干净条件下的上限和真实对话下的鲁棒性。
理解口音和风格标签后,才能读懂后面的分集结果:朗读和准备型演讲子集考验干净建模,自发子集考验对犹豫截断和多口音的泛化,混合在一起才接近真实部署。
指标组件:词错、字错、语义和速度各自分工是什么?
论文用了 5 类指标,各有明确分工。词错误率是主指标,越低越好,统计词级别的替换删除插入,适合比较整体可用性。字错误率越低越好,对截断词和形态变化更敏感,能补充词级别看不到的拼写差异。BERTScore 越高越好,用上下文嵌入对齐参考与假设,衡量语义相似。SeMaScore 越高越好,分析分层语义表示,对意思保持和幻觉更敏感,论文把主干从 DeBERTa-large 换成 mDeBERTa-V3-base 以支持多语言。
实时率因子越低越好,定义为处理时间除以音频时长,分别在 H100 和 RTX 4070 上测量并取平均,回答部署代价。教学上可以这样记:词错和字错管字面,语义分数管意思,实时率管速度。论文的发现是 BERTScore 大致跟随词错趋势,但 SeMaScore 给出互补视角,最好的 SeMaScore 来自 Omnilingual 1B 微调版而非词错最低的 Whisper,说明词汇差异很小时语义保持可能不同。这提示我们不能只看一个指标下结论,复述结果时要同时给出词汇和语义两面。
词错误率 × 语义分数: 词错误率负责按词统计替换、删除、插入的词汇层面准确性,是可复述的主指标;语义分数如 BERTScore 和 SeMaScore 负责用上下文嵌入衡量意思是否保留,能发现词错但意对或词对但幻觉的情况。二者搭配的原因是词汇指标对填充词和口语变体过于敏感,组合意义是同时回答转写错了多少词和是否保住了原意,避免只优化字面而忽视可用性。
后文看到微调把错误率压到 15% 到 19% 区间时,要同时检查语义分是否同步上升,以及实时率是否成倍变差,否则就是片面的胜利。
模型组件:蒸馏版、教师版和多语言版各自承担什么角色?
评测涉及 3 个家族。MuPe-ASR 是已发布的 Distil-Whisper 微调版,代表当前葡萄牙语自发语音的公开最优起点。Whisper-large-v3 是广泛使用的开源权重系统,代表大容量弱监督预训练的上限。Omnilingual 7B 是近期大规模多语言架构,代表基于 Wav2Vec2 的新路线。微调阶段,论文进一步操作了 Distil-Whisper、Whisper-medium、Whisper-large-v3、Omnilingual 300M 和 1B,其中 7B 只做零样本。
这样的选择不是为了堆模型数量,而是覆盖小而快、大而准、新路线 3 种典型部署心态。Distil-Whisper 从已发布检查点继续微调,观察 200k 步最优和 750k 步终点的泛化差异;Whisper-medium 和 large 分别在约 100k 和 75k 步出现过拟合迹象;Omnilingual 300M 和 1B 先跑 9k 步,1B 再延长到 15k 步看增益。所有检查点都发布在 Hugging Face,训练脚本和超参在仓库中。
记住每个家族的最佳值是家族内加粗、全局最优另标星号,跨家族比较时要看全局星号落在谁家。
蒸馏模型 × 教师模型: 教师模型指 Whisper-large-v3 这类大而准的原始模型,负责提供精度上限;蒸馏模型指 Distil-Whisper 这类经知识蒸馏压缩的小模型,负责以更低实时率因子提供可部署的效率。论文同时微调两者,搭配原因是精度与速度存在权衡,组合意义是给出两个可运行的操作点:要最高精度选大模型微调版,要低延迟部署选蒸馏微调版。
这种布局让后面的效率讨论有落点:大模型赢精度,小模型赢速度,新架构看语义保持。
微调用了多少数据、怎么训、什么时候停?
论文的训练是继续微调,不是做预训练。训练集来自前述公开自发语音数据集的训练和验证切分的聚合,得到 1156 小时训练和 39 小时验证,目的是更均衡地覆盖会话语音和声学变化。硬件是单张 80 GB 显存的 H100,最长的 Whisper-large-v3 训练约 5 天,评测同时用了 H100 和 12 GB 显存的 RTX 4070。Distil-Whisper 沿用前人策略,从已发布检查点出发,验证词错误率改善到约 200k 步且无过拟合,训练到 750k 步停止,同时报告最优验证点和终点以分析泛化。
Whisper-medium 和 large-v3 微调时分别在约 100k 和 75k 步附近出现过拟合,强调多样化自发数据和按验证性能选点的重要性,而不是训得越久越好。Omnilingual 300M 和 1B 验证词错误率相对平稳,先跑 9k 步,1B 延长到 15k 步探索增益。论文没有给出逐步学习率、优化器细节和完整超参表,复现时必须去仓库查脚本和配置,不能从模型名推定实现。需要明确的缺项是梯度路径、参数冻结范围和数据采样权重都没有在正文交代,因此只能说做了全量或脚本默认的微调,不能断言冻结了编码器或只调了某层。
零样本评测 × 微调: 零样本评测指不加巴西会话数据、直接用公开权重解码,负责暴露预训练分布与自发语音的差距;微调指在聚合的会话训练集上继续更新模型参数,负责把声学和标注风格拉向目标域。二者搭配的原因是只有先测零样本才能定位退化,再做微调才能验证域适应的增益,组合意义是形成先诊断后修复的完整证据链,而不是把预训练强弱与数据适配混为一谈。
训练与评测的对应关系是:训练只见聚合的会话训练验证切分,测试只见统一后的 Tarsila-ASR,这样才能检验泛化而非记忆。
评测条件如何保证公平?划分、指标和硬件怎么定?
公平比较依赖 3 个固定。第一,数据固定:所有模型都在同一套 Tarsila-ASR 上解码,音频都是 16 kHz,字段一致,子集划分一致。第二,指标固定:同一批假设同时算词错误率、字错误率、BERTScore、SeMaScore 和两块卡上的实时率因子,方向分别是越低越好、越低越好、越高越好、越高越好、越低越好。第三,基线固定:零样本阶段用 MuPe-ASR、Whisper-large-v3 和 Omnilingual 7B 横向看分集退化,微调阶段每个家族内部比较不同步数的检查点,跨家族再看全局最优。
聚合口径需要小心:分集表是按子集报告词错误率,总体表是在全基准上报告平均,子集样本量差异很大,mupe 和 cv17 占大头,因此总体数会被大子集主导,不能直接拿子集数平均去凑总体。硬件预算如上,训练在 H100,推理同时测 H100 和 4070,4070 显存小,对大模型更苛刻,Omnilingual 7B 在 4070 上没有给出实时率,引用时要注明缺测而不是零。资源可用性方面,3 个资源项状态都是可用,链接均为同一仓库地址,状态码 200,因此可以写当前可用和已公开,基准、模型检查点、脚本和代码都在该仓库。
复现时先跑通下载归一化合并脚本,再跑解码和指标脚本,最后才做微调,避免一上来就训大模型。
主结果:谁在总体上最好,谁在分集上翻车?
先提出比较问题:在统一多域条件下,未适应的开源权重与多样化微调后的模型相比,词汇精度、语义保持和速度如何取舍,公平条件是同一测试集和同一指标实现,指标方向如上节所述。下表整理基准规模与训练规模的总体事实,均为原文直接报告的数字,单位保留原文写法,性别占比单位仅在表头保留百分号形式,数据格保留裸值不逐格追加百分号,千分位逗号保留原文精度。表后会回到模型精度的具体权衡。
| 构成 | 样本数 | 总时长 | 女性占比(F/M%,表头单位) | 男性占比(F/M%,表头单位) |
|---|---|---|---|---|
| Tarsila-ASR 测试总量与性别分布 | 62,094 | 72.46 hours | 48 | 52 |
| 微调聚合训练与验证划分 | 1,156 hours 对应训练 | 39 hours 对应验证 | 会话语音 | 声学多样 |
这张表说明评测不是小样本抽查,而是六万多条、七十多小时的多域集合,训练则是 1000 小时量级的会话聚合,验证切分只有数十小时,因此选点必须谨慎。
回到模型层面,零样本分集按词错误率 WER 数值越低越好显示 Whisper 和 Omnilingual 在朗读主导子集上强,在自发子集上大幅下降,例如 MuPe-ASR 在 coraa-alip 上 WER 为 36.26,而 Whisper-large-v3 和 Omnilingual 7B 在该子集更高,分集均值 WER 分别为 21.63、33.03 和 51.71,原文均以裸值报告不逐格追加百分号。微调后所有家族都压到 15 to 19 percent 区间,其中 Whisper-large3 微调 75k 步取得最低词错误率和字错误率以及最高 BERTScore,成为新的性能参考,但其平均实时率比 Distil-Whisper 慢 3 到 4 倍。Distil-Whisper 微调 200k 步只比最优差 1.2 个绝对点,却保持最低平均实时率,是更偏部署的操作点。
语义上 Omnilingual 1B 微调 9k 步拿到最高 SeMaScore,以微弱优势超过 Whisper 最优,支持其在意思保持上可能更稳,但论文只称可能,没有做显著性检验。
实时率因子 × 转写精度: 转写精度由词错误率、字错误率和语义分数量化,负责回答内容对不对;实时率因子由处理时间除以音频时长得到,负责回答在 H100 和 RTX 4070 上跑得快不快。二者搭配的原因是实验室只看精度会掩盖部署成本,组合意义是让读者在选模型时同时看到每降低一点错误率需要多付多少计算时间。
多训几步一定更好吗?中间检查点告诉我们什么?
要回答训练时长与泛化的关系,需要比较同一家族内不同步数的检查点,条件是同一训练集和同一验证选点逻辑,指标看词错误率和语义分是否同步变化。下表用原文报告的区间和均值整理这一反直觉现象,不逐行复述每个模型,而是抓住可运行策略的对比。
| 比较维度 | 指标 | 未适应基线 | 微调后区间 | 比较对象 |
|---|---|---|---|---|
| 总体词错区间 | WER | 21.63 对应 MuPe 均值 | 15 to 19 percent range | 全家族微调版 |
| 精度差距 | WER | 最优系统 | within 1.2 absolute points | 蒸馏 200k 版 |
| 分集均值 | WER | 33.03 对应 Whisper 均值 | 51.71 对应 Omni 均值 | 零样本对照 |
表后解释主要收益与代价。
收益是多样化微调一致降低错误率,代价是并非单调改进。Distil-Whisper 的 200k 优于 750k,Whisper-large-v3 的 75k 优于 450k,Omnilingual 1B 的 9k 优于 15k,这种中间点最优的模式支持过拟合或对子集特性的敏感性增加,说明在异构数据上适配必须按验证性能选点,不能按时长拍脑袋。未胜出项也要点名:Omnilingual 300M 和 1B 的零样本词错误率高达 57 到 58 左右,Whisper-medium 零样本也超过 50,说明不做适配时大模型并不自动解决自发语音。另一个反例是微调后在朗读上出现轻微回退,但在自发和会话场景大幅进步,总体更贴近真实部署,这是有意为之的权衡,不是退化。
论文还对比了前人系统,微调后的大模型在 CV17、CORAA、NURC-SP 和 MuPe 上都超过以往报告,平均从 21.27 降到 15.82 左右,但跨论文比较时标注和切分可能不完全一致,引用时要注明是原文表 5 口径下的比较。
哪些结论还不能下,边界在哪里?
论文直接报告的是词汇和语义指标在固定测试集上的变化,有限解释是域失配和标注不一致导致退化,未验证的推测是某些架构语义保持更强的原因。缺失证据不是技术错误,但必须划清边界。第一,性别列是分类器估计值,不能用于公平性因果结论,MuPe 原文的年龄教育偏差也不在这套基准里重测。第二,实时率只测了推理耗时比,没有测端到端延迟、显存峰值和吞吐随批量的变化,不能承诺线上延迟一定改善。
第三,跨论文的表 5 比较依赖各工作自己的切分和归一化,严格公平性不如表内统一解码,引用时要区分。第四,训练超参、采样权重和冻结策略未在正文完整披露,复现必须以仓库脚本为准。第五,基准仍以圣保罗相关口音占比较大,14 个其他州主要靠 MuPe 覆盖,朗读和准备型占比也不小,因此总体数偏向大子集,子集平均和加权平均会讲不同故事。第六,SeMaScore 换了多语言主干,其分数跨论文不可比,只能在本文内比较。
认清这些,才能避免把总体趋势推广到每一组每一步,也不会把自动语义分当成人评。
要复现,先跑什么,再训什么,去哪里拿东西?
复现的第一步是拿资源。论文给出同一仓库地址,资源类型覆盖代码、模型和数据集,三项状态都是可用且状态码 200,因此可以写基准、检查点、脚本和代码当前已公开。先克隆仓库,运行下载、归一化和合并脚本,检查是否得到 62094 样本和 72.46 小时,以及 48% 对 52% 的性别分布,音频是否为 16 kHz,字段是否只有文本、时长、音频加来源和性别。第二步是复现零样本诊断,用 MuPe-ASR、Whisper-large-v3 和 Omnilingual 7B 在统一测试集上解码,核对分集词错误率的数量级,特别是自发子集显著高于朗读子集的现象,以及分集均值 21.63、33.03 和 51.71 是否量级一致。
第三步是复现微调,准备 1156 小时训练和 39 小时验证的聚合,Distil-Whisper 从发布检查点继续训到 200k 附近选点,Whisper-large-v3 注意 75k 附近的过拟合拐点,Omnilingual 1B 先到 9k 再看是否延长。第四步是复现指标,除了词错字错,还要跑 BERTScore 和换了 mDeBERTa-V3-base 的 SeMaScore,以及在 H100 和 4070 上的实时率。关键超参和信息条件以仓库为准,正文没有给全,不要猜学习率和冻结层。区分代码开源、权重下载和系统可运行:有脚本不等于一键可跑,要检查 Hugging Face 检查点、依赖版本和显存是否满足,7B 在 12 GB 卡上可能跑不动实时率,这与原文缺测一致。
何时值得用这套方法,论文特有的误解怎么避?
当你的目标是巴西葡萄牙语的会议、客服、访谈或课堂转写,而不是干净朗读,就值得尝试这套先统一多域测试再做多样化微调的路线。做法是先把已有公开测试切分拼成贴近部署的分布,再用 1000 小时量级会话数据微调,同时报告词汇、语义和速度,避免只看朗读榜单。选择上,要最高精度选 Whisper-large-v3 微调 75k 附近的检查点,要低延迟选 Distil-Whisper 微调 200k 附近的检查点,要语义保持可加测 Omnilingual 1B 微调 9k 版。需要避开 3 个特有误解。
其一,把总体词错误率当成每集都好,实际上 coraa-alip 等自发集仍接近 29% 左右,而 cv17 可到 8% 多,部署前必须看分集。其二,把训练更久当成更好,本文多个家族都是中间点最优,必须按验证选点。其三,把语义分高当成人评通过,自动语义分只是词汇之外的补充,不能替代听感和可用性评估。还需补的验证是更大口音均衡、更干净的转写归一化、显著性检验和线上延迟实测。
回到起点,本文的贡献不是发一个新录音集,而是让分散的测试变得可比,并给出可下载、可运行的新基线,这正是后续会话 AI 工作的起点。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses