英文题目:Source-Adaptive Data Curation for Bilingual NVV-Aware ASR
标签:#语音识别 | #数据集构建 | #多语言 | #数据增强
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Yuang Cao:机构信息未在 arXiv HTML 中可靠披露
- Qirui Zhan:机构信息未在 arXiv HTML 中可靠披露
- Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
- Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
- Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
- Shuo Feng:机构信息未在 arXiv HTML 中可靠披露
- Bengu Wu:机构信息未在 arXiv HTML 中可靠披露
- Lei Xie:机构信息未在 arXiv HTML 中可靠披露
- Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
面向中英双语非言语发声感知识别需从波形直接预测交织词与16类行内标签的序列,难点在于细粒度事件易混淆且须相对转写定位,而中英发音风格与标注分布差异进一步加剧跨源泛化难度。方法先以词汇重映射改造Whisper-medium,将16类标签复用未用词条表示为原子标记,与词共享解码空间实现单序列自回归联合生成并关闭时间戳预测。其统一输出格式进入公开语料提纯,先做标签归一统一异构标注,再经噪声与变速扩增增加多样性并由多模态大模型做接受拒绝过滤得到干净监督。提纯后的可控监督再与影视媒体挖掘互补,经增强去噪与端点切分获得词级脚手架后由生成式标注插入修正标签形成自发样本,三路连同无标签语音负例混合训练。与外挂事件分类器或后对齐方案不同,该设计将识别与相对定位内化为解码过程,并按来源适配数据策略以兼顾可控性与自发多样性。在官方终测1946句双语评测协议下,提议系统的双语FinalScore分数从基线原始公开数据的33.32升至53.61。英文词错误上升与呼吸喘息等细粒度类别偏弱构成适用边界,该英文退化在更广泛域外推中尚未验证,而训练成本受限于8卡RTX 4090全参数微调与bfloat16精度对应硬件配置。
🔗 开源与复现资源
- 第三方资源:https://nvvspeech-challenge.github.io — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出必须保留什么?
输入是一段波形,推理时只有音频可用,不给视频流,不给外部事件检测器,也不做事后对齐。输出是一条带标签转写序列,把词 token 与行内非言语声标签交错排列。任务要求同时做对三件事:词内容写对,非言语声类别判对,标签插在转写相对位置上。挑战固定了 16 类:呼吸、吸鼻、笑、哭、咳嗽、清嗓、喷嚏、叹息、喘息、打鼾、哈欠、哼声、呻吟、嘶声、咂嘴和打嗝。评价同时看事件识别、位置与带标签文本错误,因此漏标、错类、放错相邻词之间都会扣分。
非言语声 × 自动语音识别: 非言语声负责界定笑、叹息、呼吸、咳嗽等非词事件的类别与出现位置,自动语音识别负责把声学信号转成可读词序列,二者搭配的理由是只转词会丢掉对话情感与交互信息,组合意义是把词与事件放在同一条带标签转写序列里联合评价。
对刚入门的读者,白话是这样:常规语音识别只关心说了什么字,遇到笑声往往删掉或折成一个通用非语音符号;这篇论文要的是连哪里笑了、是哪种笑样声都写进同一行文本,并且中英双语都要处理。中英的说话风格、声学实现与标注分布本来就不一致,不同来源的录音条件也不同,所以只靠加大模型难以 1 次解决,数据来源的可靠性与多样性同样关键。官方资料页当前可用,地址为挑战官网,本文写作时状态码为可达,可用于核对赛道定义与评分器。
已有路线提供了什么,还缺什么?
已有非言语语音数据集覆盖了孤立事件分类与合成旁路,例如 ESC、VocalSound、NonVerbalSpeech-38K、NVSpeech、MNV-17、SMIIP-NVV、SynParaSpeech 与 NonverbalTTS。它们把事件种类做大,但按论文的梳理,存在标注质量不一、类别不平衡、声学多样性有限的问题。另一条路线是直接在识别器里加事件分类或对齐模块,把词识别与事件检测分开做。这种分开做法的好处是模块清晰,代价是需要额外对齐与融合,且难以保证标签落在正确的词间位置。
本文选择的是第三条路线:编码器加解码器结构统一生成。编码器只看音频,解码器自回归地逐个输出词或标签,不另设分类头。教学上可以这样对照:同输入都是波形,同目标都是词加事件,同监督都用带标签文本,但本文把事件当作词表中的特殊词来生成,而分离式路线把事件当作另一路检测任务来做。论文没有声称分离式路线必然失败,只报告在官方双语协议下统一生成的分数与消融增益,未测量的延迟与误报代价不在本文证据内。
双语带标签转写难在哪里?
难点有 3 层。第一层是类别细:呼吸与吸鼻、叹息与喘息在时长与能量上都很短弱,容易被噪音淹没,也容易互相混淆。第二层是位置严:同样是笑,放在句首、句中停顿处或句尾,都会改变多事件归一化标签距离与带标签文本错误。第 3 层是双语与多源不平衡:公开语料以普通话为主,英语样本少;影视数据更自发,但原始没有可靠标注,直接拿来训练会引入错标。
举一个教学例子,注意这只是例子而非论文数据:假设音频是“我今天——笑——太累了”,正确输出需要在对应词之间插入笑标签;若模型写对词但把笑标签移到句尾,词错率可能不变,但事件位置分与带标签错误仍会变差。这个例子说明为何论文要同时报告事件微平均值、位置距离与带标签文本错误,而不是只看词错率。
系统全景:一个样本走完全程
拿一条中文带笑音频为例走一遍。波形先算对数梅尔谱,经音频前端与 Whisper 编码器得到声学表示;解码器在标准多语转写提示下,从起始符开始逐个生成:词、词、笑标签、词,直至结束。时间戳预测全程关闭,因为任务只要求转写相对位置。所有参数都参与微调,解码用官方语言标签选择中文或英文提示,不做样本级后处理,也不外挂检测器。
下图是论文给出的结构总览,先看主路径再看提示细节,有助于把编码、提示与统一输出对应起来。
看图路径: 1. 从底部对数梅尔谱经音频前端到编码器,再经交叉注意力到解码器的主路径走一遍;2. 对照解码器下方输入的起始与语言提示和上方输出的词加标签序列,确认标签与词同序列生成;3. 检查无时间戳提示在输入输出中的位置,理解为何关闭绝对时间预测;4. 观察火焰图标标注的可训练模块,确认是全参数微调而非只调解码器
论文图 1。原论文 Figure 1::“Overview of NVV-Aware Whisper. Whisper-medium is fully fine-tuned to jointly generate lexical tokens and inline NVV tags in a single autoregressive sequence, with timestamp…”。
从像素可见,底部是声谱图,上方左侧是音频前端加编码器,右侧是解码器,编码器到解码器标有交叉注意力;解码器下方框为带起始与语言的输入 token,上方框为包含词与哭笑类标签的输出 token,并带有无时间戳标记。火焰图标按图注表示可训练模块,全模型微调意味着编码器与解码器都更新。这一总览支持后文的理解:声学多样性不足或标签错位,都会直接进入同一自回归损失。
词汇重映射与联合解码如何实现?
Whisper 原词表没有 16 类非言语声的专用 token。做法是复用 16 个未用子词条目,重映射为规范标签,并删掉对应合并规则,使每个标签成为单原子 token。这样词表大小与模型维度不变,预训练 checkpoint 可直接复用,无需扩词表或改结构。词 token 与标签共享同一解码输出空间,联合概率按链式分解逐项相乘,每一步都以声学编码与已生成前缀为条件,用标准自回归交叉熵优化。
词汇重映射 × 自回归解码: 词汇重映射负责把 16 个非言语声类别对应到 Whisper 词表中 16 个未用条目并删除合并规则使每个标签为单原子 token,自回归解码负责按前文与编码器状态逐个生成词或标签,二者搭配的理由是不扩词表就能复用预训练 checkpoint,组合意义是词转写、事件识别与转写相对位置统一在一个输出空间完成。
符号含义先说清:输入波形记为声学信号,输出序列记为词与标签交错的长度可变序列,编码器输出记为声学条件。计算目标是最大化给定音频下整条带标签序列的似然。原文明确的实现是保留多语转写提示、关闭时间戳、移除 16 条合并规则、全参数更新。原文未给出梯度截断或分层冻结细节,因此不能推定某层冻结;缺项就是缺项。
\[\begin{split}Score=100\,[&0.70\,\mathrm{F1}_{\mathrm{micro}}+0.20(1-\mathrm{mNTD})\\ &+0.10\left(1-\min(\mathrm{Err}_{\mathrm{tagged}},1)\right)].\end{split}\]上式是联合解码的概率分解,不是近似目标,也没有附加对齐损失。它的教学意义是:词错、类错、位置错都折进同一次逐 token 预测,数据中标签放错位置会直接教会模型放错位置,这正是后文要用大模型过滤与生成式标注的原因。
转写相对位置 × 绝对时间对齐: 转写相对位置负责说明非言语声标签插在词序列中哪两个词之间,绝对时间对齐负责给出事件在波形时间轴上的起止秒数,二者搭配的理由是本任务只要求前者因而可以关闭时间戳预测,组合意义是解码器专注生成带标签文本而不另设事件分类或对齐模块。
源自适应整理:公开语料与影视数据分开处理
整理策略按来源分两支。公开分支起点是基线用过的双语公开语料,先做标签归一化,把异构标注映射到 16 类规范与统一带标签格式;再做声学增强,对选中语句加高斯白噪、变速或两者叠加,比例为 40%、40%、20%,信噪比均匀取自 20 到 35 分贝区间,变速因子在 0.9 到 1.1 之间,温和范围是为了不破坏呼吸、吸鼻、咂嘴等短弱线索,并对主导标签降权、对尾部标签上采样;最后做多模态大模型过滤,把波形与带标签文本一起交给 Gemini 2.5 Pro 做接受或拒绝,只保留声学存在、类别正确且与词文本一致的样本,失败样本直接丢弃而不自动修复。保留部分称为干净公开数据。
声学增强 × 多模态大模型过滤: 声学增强负责用加噪与变速增加声学多样性并缓解长尾标签不平衡,多模态大模型过滤负责对波形加带标签文本做接受或拒绝判断以剔除错标,二者搭配的理由是增强只增加样本不修正标签错误,组合意义是在保留多样性的同时提升公开语料的标注可靠性。
影视分支处理无标注的电影电视录音,不做波形级增强以保留细微线索。先用 FFmpeg 抽音轨,对干扰强的录音可选 MossFormer2-SE-48K 增强,再用 Silero 静音检测切掉长非语音段;再用火山引擎 Doubao 语音识别 2.0 得到带说话人与时间戳的初版句级文本,用 0.1 秒合并间隙融合识别边界与语音活动区,并切成适配 30 秒输入窗的语句;最后把分段波形与初版文本一起交给同一大模型做生成式标注,可插入、删除、纠正或移动标签,得到带自然时机与上下文共现的影视数据。
受控公开语料 × 野外影视数据: 受控公开语料负责提供已有标注、格式统一的中英监督,野外影视数据负责提供自发的语气、说话人交互与真实声学条件下的事件时机,二者搭配的理由是前者规范但自发性不足、后者丰富但无可靠标注,组合意义是合并后同时获得规范性与多样性。
最后把干净公开数据与影视数据合并为最终数据,并混入无标签纯语音数据作为显式负例,抑制无事件时乱生标签。按原文表 1 的构成,最终数据为 1000.0 小时、371599 条、512968 个事件,另加 178.8 小时纯语音,总计 1178.8 小时、401599 条。影视分支事件密度更高,语言更均衡,这是理解后文消融的关键。
下表提出的问题是:不同整理阶段的数据量、语言占比与事件密度如何变化,合并是否同时改善规模与多样性。比较条件是同一套公开起点与同一影视挖掘流程,指标方向是时长与条数越大覆盖越广,每小时事件数越高监督越密。
| Dataset | Hours | ZH / EN (%) | #Utt. | #NVV | NVV/h |
|---|---|---|---|---|---|
| A: Raw Public NVV Data | 515.1 | 93.7 / 6.3 | 177,292 | 205,277 | 398.5 |
| D: Movie NVV Data | 454.3 | 57.7 / 42.3 | 179,585 | 290,818 | 640.1 |
| E: Final NVV Data (C+D) | 1,000.0 | 76.2 / 23.8 | 371,599 | 512,968 | 513.0 |
| F: Tag-free ASR Data | 178.8 | 69.9 / 30.1 | 30,000 | – | – |
该表显示原始公开数据 515.1 小时且普通话占 90%以上,增强后扩到 763.0 小时,过滤后剩 545.7 小时但事件密度略升;影视数据 454.3 小时且中英相对均衡、事件密度达每小时 640.1 个;合并后 1000.0 小时且英语占比提到 23.8%。主要收益是规模与多样性兼得,代价是过滤丢掉一部分增强样本,且影视标注依赖大模型生成质量,错标风险仍需下游分数验证。
训练与推理的计算边界在哪里?
训练是全参数微调,损失为标准自回归交叉熵,梯度路径覆盖编码器与解码器全部参数,优化器用 AdamW 加余弦调度。推理是纯音频输入的自回归生成,无视频、无外部检测器、无后处理,语言提示按条给定。原文未报告解码束宽、采样温度、实时率与显存占用,因此不能从模型名称推定延迟或确定性,也不能把冻结参数的假设套用到本文。
教学上要分开 4 个量:训练资源指 8 卡与批量等预算,推理开销指显存与计算量,输出帧率指音频处理速度,实际延迟指从输入到出字的等待时间。本文只给了部分训练预算,其余三量缺项,复现报告应如实写缺项而不承诺改善。
实验条件:测什么、与谁比、如何算分?
数据集方面,训练如上表,最终数据含普通话 762.0 小时、英语 238.0 小时,另加普通话 125.0 小时与英语 53.8 小时的无标签语音;测试为官方终阶段 1946 条,其中普通话 985 条、英语 961 条,用官方赛道 1 评分器。系统方面,基线、所提系统与消融都用同一识别结构、同一训练配置与同一解码策略,并共享同一份 178.8 小时无标签语音,唯一差别是带标签部分的训练语料:基线用原始公开数据,所提系统用最终数据,消融逐个换带标签子集。参数方面,全参数微调 Whisper-medium 共 769M 参数,优化器为 AdamW 加余弦学习率,学习率 1 乘 10 的负 5 次方,500 步热身,有效批量 352,半精度与深度加速 ZeRO-2,在 8 张 4090 上训练,训练与推理都关闭绝对时间戳,推理按官方语言标签设提示。
评分按官方协议:每种语言的赛道分由事件级微平均、位置距离与带标签文本错误加权而成,权重为 0.70、0.20、0.10,带标签错误对普通话用字错率、对英语用词错率并截断到 1;双语最终分为中英平均。微平均占 70%,说明事件识别是主导因素,位置与文本为补充。
\[FinalScore=(Score_{\mathrm{ZH}}+Score_{\mathrm{EN}})/2.\]上式是双语平均,不是加权平均,中英各占一半。教学提醒:百分点与相对百分比不同,0.70 权重下的微平均提升不能直接换算成词错率下降;数值相同也不代表同一指标,比较时必须同时核对语言、阶段与聚合对象。
数据与指标的口径细节
数据口径按表 1 理解:时长为小时,语言占比为普通话与英语的时长比,事件密度为每小时标注事件数。最终数据 1000.0 小时中普通话与英语为 76.2 比 23.8,总训练加纯语音后为 1178.8 小时、中英 75.2 比 24.8。注意增强样本是追加而非替换,过滤是删除而非修复,影视分支无波形增强,这些操作差异决定了各阶段时长与密度的变化方向。
指标口径要逐个核对:事件微平均看类别判对,位置距离看标签在词间的相对顺序,带标签错误看含标签文本的字或词错误,纯文本错误为去掉所有标签后的字或词错误。聚合对象是先按语言算赛道分再双语平均,不能把中文与英文样本混在一起算 1 次微平均。百分点差值与相对百分比不同,例如最终分提高 20.29 是百分点差,不能写成相对提升百分之多少。
主结果:增益来自哪里,代价在哪里?
要回答的问题是:在模型与纯语音数据都不变、只换带标签语料时,最终分与分项指标如何变化。公平条件是同一结构与同一解码,指标方向是微平均越高越好,位置距离与两类错误越低越好。
| 条件 | 指标 | 基线 | 所提系统 | 语言 |
|---|---|---|---|---|
| 可运行训练语料 | 最终分 | 33.32 | 53.61 | 双语平均 |
| 可运行训练语料 | 赛道分 | 34.05 | 55.45 | 中文 |
| 可运行训练语料 | 赛道分 | 32.59 | 51.76 | 英文 |
| 可运行训练语料 | 事件微平均 | 0.3325 | 0.5666 | 中文 |
| 可运行训练语料 | 事件微平均 | 0.2964 | 0.5081 | 英文 |
上表基于原文连续句整理,事件位置与文本错误的完整数字见正文叙述:中文位置距离从 0.6602 降到 0.4443,英文从 0.7459 降到 0.4357;中文带标签字错率从 60.24 降到 53.22,英文带标签词错率从 32.38 升到 50.91。表后解释是:双语最终分提高 20.29 个百分点,中英赛道分分别提高约 21 点与 19 点,最大增益在事件识别与位置;中文纯文本字错率从 48.15 到 47.38 基本持平,说明中文增益主要来自事件与位置且词识别大体保留。
英文纯文本词错率从 25.58 升到 34.98,说明英文在获得事件增益的同时词转写变差,且标签插入与位置错误进一步推高带标签错误。由于事件与位置占 90%权重,总分仍大幅上升。未胜出项必须指出:英文词保真度是明确代价,最终语料仍以普通话为主,语言均衡与英文词鲁棒性是后续重点。
分标签看:哪些类别真正变好,哪些仍弱?
要回答的问题是:总分提升是少数高频标签带动,还是多数类别普遍变好。比较条件是同一测试集上的基线与所提系统逐类事件值,指标方向是越高越好。
| 语言与标签 | 基线 | 所提系统 | 变化方向 |
|---|---|---|---|
| 英文打嗝 | 0.161 | 0.742 | 上升 |
| 英文叹息 | 0.019 | 0.498 | 上升 |
| 英文哼声 | 0.311 | 0.713 | 上升 |
| 中文喷嚏 | 0.209 | 0.790 | 上升 |
| 中文吸鼻 | 0.168 | 0.679 | 上升 |
| 中文嘶声 | 0.098 | 0.576 | 上升 |
上表只列出原文明确点名的大幅提升类,完整 16 类中英文 14 类、中文 15 类提升。表后必须同时讲弱项与倒退:英文喘息、呼吸、呻吟仅 0.224、0.330、0.340,中文呼吸与喘息仅 0.237 与 0.288,说明细粒度短弱事件仍难;英文嘶声从 0.660 降到 0.625、咂嘴从 0.540 降到 0.423,中文打鼾从 0.904 降到 0.856;中文打嗝基线已 0.930 接近饱和而英文打嗝从低位大涨,呈现语言依赖。这些正反例子支持论文的判断:整理改善了覆盖面,但未解决全部类别与语言特异弱点。
消融:增强、过滤、影视数据各自贡献多少?
要回答的问题是:公开分支的增强与过滤、影视分支的独立效果,以及两支合并是否互补。公平条件是模型、优化与无标签语音都不变,只换带标签子集,指标方向是赛道分与最终分越高越好。
| 训练数据 | 中文赛道分 | 英文赛道分 | 最终分 |
|---|---|---|---|
| 原始公开数据 | 34.05 | 32.59 | 33.32 |
| 增强后公开数据 | 38.96 | 36.16 | 37.56 |
| 干净公开数据 | 41.08 | 37.46 | 39.27 |
| 影视数据 | 54.21 | 38.47 | 46.34 |
| 最终合并数据 | 55.45 | 51.76 | 53.61 |
上表数字均有原文连续句覆盖:增强带来加 4.24 到 37.56,过滤再加 1.71 到 39.27;影视单独达 46.34 但中文 54.21 远强于英文 38.47;合并达 53.61,比干净公开高 14.34,比影视单独高 7.27,其中英文从 38.47 提到 51.76 是合并的主要来源。表后解释是:公开精炼提供渐进增益,影视提供更强的独立性能与自发多样性,二者合并最均衡。反例是影视单独的英文并不强,说明只靠影视不能解决英文问题;合并后英文大涨支持互补判断,但仍待验证是否来自语言占比提升、事件密度提升或上下文共现,不能直接断为因果。
还不能承诺什么?
论文直接报告的是识别与位置分数提升,以及中文词识别大体保留、英文词识别下降。有限解释是影视数据带来更自然的时机与共现,干净公开数据提供更可靠的受控监督。未验证推测是若继续改善语言均衡就能同时保住英文词准确率,这在本文没有对照实验,不能当作已证结论。
缺失证据不是技术错误,但必须点名:未测量误报率、延迟、推理开销与实际帧率,未做统计显著性与置信区间,未报告大模型过滤的接受率与生成标注的人工抽检一致性,也未公开影视版权的再分发细节。相关性不等于因果:影视事件密度高与分数高同时出现,不能直接推出密度越高必然越好。训练资源只报告了 8 卡与批量配置,未报告总时长与能耗;总体趋势不等于每条、每类都变好,上节的倒退类就是反证。
复现先做什么,需要哪些条件?
先固定评价口径:用官方终阶段 1946 条与官方评分器,按中英分别算赛道分再平均,不要自行换词错率工具或改权重。基线复现用原始公开双语语料加 178.8 小时无标签语音,全参数微调 Whisper-medium,学习率 1 乘 10 的负 5 次方、500 步热身、有效批量 352、关闭时间戳、按官方语言标签设提示。核对点是词汇重映射是否删掉 16 条合并规则并保持词表大小不变,否则 checkpoint 维度对不上。
再逐步加整理:先加噪与变速增强并记录信噪比与变速区间,再加接受或拒绝过滤并保留被丢样本以便审计,最后再加影视挖掘。影视链路需准备 FFmpeg、语音增强与静音检测、初版识别与大模型标注,每一步保留时间戳与说话人信息,0.1 秒合并间隙与 30 秒切分要与原文一致。资源状态方面,挑战官网当前可用,可用于核对赛道与数据说明;论文未声明代码与权重公开状态,复现时应按未公开准备,只把官网当作定义依据,不把可达当作代码可运行。
何时值得尝试,还需补哪项验证?
当任务要求在同一行文本里同时保留词与非言语声位置,且只有音频可用时,本文路线值得尝试:不扩词表的重映射加统一自回归生成,实现成本低;公开精炼加影视挖掘的双支整理,能同时补可靠性与自发性。复现时建议先跑通不扩词表的联合解码与官方评分,再逐个加增强、过滤与影视数据,每步都保留中英分项与逐类分项,避免被总分掩盖英文词退化。
还需补的验证有三项:对大模型过滤与生成标注做人工抽检,报告接受率与类别混淆;对英文做语言均衡与词鲁棒性对照,确认词退化来自数据占比、标注噪音还是解码偏置;对倒退的嘶声、咂嘴与打鼾类做针对性误差分析,区分是声学混淆、样本不足还是位置标注不一致。补完这些,才能判断该方法在新领域与新语言配比下是否依然成立。
📎 论文与评分元数据
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
