英文题目:Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

标签:#音视频语音识别 | #数据集构建 | #基准测试 | #鲁棒性 | #音视频

评分:8.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Rishabh Jain:机构信息未在 arXiv HTML 中可靠披露
  • Aristeidis Papadopoulos:机构信息未在 arXiv HTML 中可靠披露
  • Zhaofeng Lin:机构信息未在 arXiv HTML 中可靠披露
  • Naomi Harte:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自然双人视频会议AVSR需从单人视角视频与单通道音频中转写自发对话语音,输出对应说话人的文本,其难点在于重叠打断、自发轮次、非正式词汇与可变声学使音频显著退化而纯视觉又极脆弱。流水线先以Speechmatics词级转写提供的毫秒级起止时间戳与标点置信度驱动切分,并完成说话人与视频通道的映射对齐,使双人会话解耦为单人音视频片段。随后对片段施加填充词过滤与文本归一化,仅保留含实词的短语并丢弃不合格片段及其音文,输出再按单次出现说话人隔离划分为训练验证测试集并固化为规范ID文件。相对LRS2与LRS3等摆拍朗读基准,该机制差异在于保留自然分布与人口平衡而非受控采集,从而放大视觉模态价值并检验跨域泛化。在Candor-LR测试集下,联合LRS2、LRS3与Candor-LR训练的AV-HuBERT的AV WER为9.83%,低于AO WER的16.37%。该结论适用边界限于英语双人视频会议场景,在多人鸡尾酒会、强混响与平台压缩等条件下尚未验证且自动标签与低分辨率人脸仍受限。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:为什么播报式基准不够用了?

这篇论文的输入是双人视频会议的音视频加转写,目标是做视听语音识别,也就是同时看嘴型和听声音来转写说了什么。初学者要先建立白话概念:视听语音识别的英文是 Audio-Visual Speech Recognition,缩写为 AVSR;只听声音的叫音频识别,英文为 Audio-Only,缩写为 AO;只看视频的叫纯视觉识别,英文为 Video-Only,缩写为 VO;两者一起用的叫视听,缩写为 AV。

论文要解决的矛盾是,现有基准如 LRS3 多为专业朗读、麦克风好、环境稳定,而真实对话有人打断、重叠、转头、房间混响,模型在前者上错误率很低,不代表在后者上也能用。作者因此从 CANDOR 语料的 1656 段自然双人视频会议出发,构造可训练的对话式基准。需要保留的关键信息是数据规模、切分方式、评测条件和视觉到底补了多少。

输出是 1 套可复刻的清洗流水线加 3 组实验:零样本跨域测试、换训练数据测试、加噪声测试。本文按学习依赖展开,先讲任务与路线,再讲流水线全景与组件计算,然后讲构造与划分,最后讲实验条件、结果、反例与复现。论文已声明当前流水线代码公开,但原始 CANDOR 需要读者自行向原作者申请许可,作者不分发数据,这决定了复现的第 1 步是先解决数据许可。

同输入同目标的工作此前走到了哪里?

按同输入、同目标、同监督来对照,AV-HuBERT 是自监督表示学习的代表,用掩码音视频预测多模态隐单元;Llama-AVSR 是冻结大语言模型做自回归解码的路线,用低秩适配把视听特征映射到文本空间;Auto-AVSR 是监督放量的路线,用强大的纯音频模型自动标注大规模无标注数据来扩大训练。论文报告这 3 类在 LRS3 上音频识别已经接近完美,但在对话上都会明显下滑。

另 1 条线是更真实的评测:WildVSR 发现调到 LRS3 的模型在野外难例上退化严重,LRS-VoxMM 发现音频越差视觉越重要,鸡尾酒会场景加入重叠说话人和静默人脸后模型同样退化,视频会议工作还指出平台压缩和语音增强伪影也会导致崩溃。这些工作的输入更杂、目标仍是转写,但多数只提供测试集或规模不足,不能同时支撑训练与测试。

Candor-LR 的定位差异在于提供 713.5 hours 训练、10.1 hours 验证、60.1 hours 测试的完整划分,并保留说话人不重叠的测试集,从而能同时检验领域内学习与跨域泛化。理解这一点才能明白后文为何反复比较只用脚本数据训练、只用对话数据训练、两者混合训练这 3 种条件。

问题到底难在哪里:重叠与声学多变如何进入评测?

把问题拆成可操作的 3 个难点。第 1 是说话方式:对话不是逐字朗读,有嗯啊等填充词、半句打断、快速轮换,语言模型靠背诵脚本模式难以覆盖。第 2 是声学条件:视频会议的麦克风、房间、网络各不相同,2 个人声还可能互相泄漏,单纯加人工噪声不能完全模拟。第 3 是视觉条件:说话人会转头、低头、大幅度移动,嘴部区域抖动大,固定裁剪容易切偏。

论文明确指出,现有播报式工具链是为单人、短句、稳定镜头设计的,直接搬到 26 min 到 30 min 的双人长会话会失效。因此作者没有直接发布标注结果,而是把重点放在如何把长会话变成与 LRS2 和 LRS3 长度相当的短句,同时保证音画同步、说话人与文本对应、标签干净。

1 个教学例子是:假设 1 段 30 min 会议中有 A 和 B 轮流说话,若只用合并立体声切分,A 说话时 B 的咳嗽也会被切进来;若只用句子级轮次切分,1 个轮次可能长达 84 s,模型吃不下;若切成词级碎片,每个只有 0.2 s 到 1.0 s,又失去上下文。这个例子帮助理解为何后文要用标点加 0.5 s 间隔做短语级切分,并坚持从每人独立音轨取音频。

方法全景:1 个样本如何从长会议走成 1 条训练样本?

沿 1 个样本走完全程有助于建立全局图。输入是 1 段双人会议的 2 个独立视频、合并音频、通道映射文件和词级识别结果。第 1 步是解决谁对谁:Speechmatics 输出按通道 0 和通道 1 编号,而视频按用户编号命名,流水线用 channel_map.json 把左声道对应通道 0、右声道对应通道 1,从而把每个词的文本与正确的说话人视频绑定。

第 2 步是定时间:用词的毫秒级起止时间戳,按标点或词间隔超过 0.5 s 断开,把词拼成短语,全库得到 0.8 s 到 5.0 s、平均 3.6 s 的片段。第 3 步是取画面:对片段逐帧做人脸检测,提 68 个关键点,取嘴部点裁出 96 × 96 pixels、25 fps 的视频,并对关键点做 3 帧滑动平均以抑制抖动。

第 4 步是取声音:用同一时间戳从该说话人的独立音轨截取,转单声道、重采样到 16 kHz、存无损波形文件,保证音画同戳、无需 2 次对齐。第 5 步是洗文本:去标点、压空格、转小写、去掉残留的非词标记,再按时长、词数和填充词共 3 道过滤丢弃不合格片段。最后按说话人划分训练、验证与测试,输出标准视听格式。这个全景说明了后文所有数字的前提:时长、说话人、指标都建立在同一套时间戳上。

组件 1:转写源与说话人映射如何保证对得上?

先解释术语。词级时间戳的英文是 word-level timestamps,指每个词何时开始、何时结束;通道映射的英文是 channel mapping,指左声道和右声道分别属于哪个用户。CANDOR 自带的 3 种轮次划分关注对话结构,但没有词级毫秒精度,无法驱动音画同步。作者改用 Russell 等人用 Speechmatics 系统生成的词级结果,理由是该系统在对话语音上表现较好,能保留嗯啊类非词标记,并给出每个词的置信度、标点和毫秒级起止时间。

操作上,语料目录下每个会话有合并视频、合并音频、2 个说话人视频、通道映射与元数据,转写目录另有 3 个版本的轮次文本;Speechmatics 目录下每个会话有 2 个通道的词级 JSON 加 1 个合并对齐文件。流水线读取通道映射,把通道 0 固定到左视频、通道 1 固定到右视频,再把对应 JSON 的词序列挂到该视频上。这样做的新增作用是,后续所有切分、取音视频都来自同一套词时间戳,从源头避免文本与嘴型错位。

视听语音识别 × 纯视觉语音识别: 视听语音识别指同时用音频波形和嘴部视频做转写,纯视觉语音识别指只看嘴部视频做转写;前者分工是音频为主、视觉为辅,后者分工是检验视觉单独能提供多少语言信息,二者搭配的理由是噪声越大音频越不可靠,组合意义在于用同一测试集比较 AO 与 AV 的差值来度量视觉补偿是否真实生效。

沿样本看,假如通道 0 的词序列在第 120.2 s 到 123.1 s 构成 1 个短语,流水线就用这段时间同时截通道 0 用户的视频和独立音频,文本即该词序列归一化后的结果,输出就是 1 条样本。初学者复述时要强调:不是先切视频再配文本,而是先定文本时间,再按时间取音视频。

组件 2:切分、取脸与取声的参数如何协同?

这一节把 3 个动作的参数讲清。短语级切分的英文是 phrase-level segmentation,规则是在标点处或词间隔超过 0.5 s 处断开,避免词级过碎和轮次级过长。论文报告全库片段为 0.8 s 到 5.0 s、平均 3.6 s,与 LRS3 的 2 s 到 5 s 习惯对齐。人脸与嘴部感兴趣区的英文是 face detection and mouth ROI,做法是对每帧用 RetinaFace 做检测,阈值为 0.8,成功后提 68 个关键点,取 48 到 68 号嘴部点裁剪并缩放到 96 × 96 pixels,帧率从 30 fps 降到 25 fps 以与 LRS2 和 LRS3 预处理一致,关键点先做 3 帧滑动平均再裁剪,用来抵抗自发摇头造成的帧间抖动。

双人对话 × 播报式语音: 双人对话指 2 人轮流、插话、重叠、头部转动的自发视频会议,播报式语音指 1 人对着高质量麦克风朗读的干净独白;前者负责引入重叠、口语词和房间混响,后者负责提供可控的评测起点,二者搭配的理由是只有对照才能暴露脚本模型在对话上的泛化缺口,组合意义在于把评测从朗读准确率转向对话鲁棒性。

音频处理的英文是 audio processing,做法是从每人独立音轨按同一短语时间戳截取,转单声道、重采样 16 kHz、存无损波形,避免用合并立体声引入另 1 人的串音。文本归一化与过滤的英文是 text normalization and quality filtering,做法是去标点、压空格、转小写、去掉残留的非流利标记,再依次丢弃短于 800 ms、少于 2 个词、整句全是填充词的片段,保留至少含 1 个实词的句子。

词级时间戳 × 短语级切分: 词级时间戳指每个词的毫秒级开始与结束时间,短语级切分指按标点或大于 0.5 s 的词间隔把长对话拼成 2 s 到 5 s 片段;前者分工是提供对齐锚点,后者分工是生成与 LRS2 和 LRS3 长度相当的可训练样本,二者搭配的理由是 26 min 长会话不能直接送入识别模型,组合意义在于既保留上下文又避免过长静音和过短碎片。

音频错误率 × 视觉增益: 音频错误率指只用音频解码得到的词错误率,视觉增益指音频错误率减去视听错误率的差值;前者分工是刻画声学难度,后者分工是刻画加入嘴部视频后减少了多少错误,二者搭配的理由是单看视听错误率无法判断视觉是否真起作用,组合意义在于把视觉贡献变成可比较的数字。

信噪比 × 巴布尔噪声: 信噪比指目标语音与背景噪声的能量比,巴布尔噪声指由多个人声叠加合成的嘈杂人声背景;前者分工是定量控制从干净到负 10 dB 的恶化程度,后者分工是模拟多人说话的干扰质感,二者搭配的理由是真实对话本就混响多变再加噪声更难,组合意义在于检验视觉是否在噪声越大时补偿越多。

3 者搭配的理由是时长、画面、标签必须同时合格,任 1 项不合格就整体丢弃对应音视频与文本,从而保证训练、验证、测试的质量口径一致。复述时要记住阈值数字:0.5 s 断句、800 ms 下限、至少 2 词、96 × 96 pixels、25 fps、16 kHz,这些是复现时必须一致的细节。

构造与划分:没有新模型时什么在被训练?

这是 1 篇数据集论文,没有提出新的网络结构,该节的训练应理解为数据构造与划分加后文用 AV-HuBERT 等既有模型做的训练。数据集划分采用说话人感知的英文是 speaker-aware partitioning,做法是找出在全库只出现 1 次的 701 个说话人,约 164.9 hours 音频,全部留给测试集,确保测试说话人在训练和验证中从未出现;其余多次出现的说话人用固定随机种子分到训练与验证,会话上下文不跨划分重叠,并保存为训练、验证、测试的编号文件以保证可重复。

论文报告最终规模与比例需要整体核对,下表把总量与 3 个划分放在一起,单位同时保留 hours 与条数,避免把条数当成 hours。表前的问题是:Candor-LR 到底有多大,训练、验证、测试各占多少,测试集是否比 LRS3 大到足以支撑对话评测?比较的公平条件是同一套过滤后的短语口径,指标方向是规模越大、测试说话人越不见越好。

划分时长条数占比备注
训练713.5 hours718,648 utterances91.2%主体
验证10.1 hours10,304 utterances1.3%调参用
测试60.1 hours58,718 utterances7.5%不见说话人

上表显示训练占绝对主体,验证很小,测试达到 60.1 hours 与 58,718 utterances,论文明确对比 LRS3 测试集仅 1321 条约 1 hour,因此对话测试的统计稳定性更强。但也要看到代价:验证集仅 10.1 hours,调参时容易波动;测试集全部来自单次出现说话人,虽然保证不见,但其口音与设备分布可能与训练不完全同分布。论文还报告有效人口元数据的说话人数为 1554 人,其中训练 1350 人、验证 44 人、测试 160 人,去重后唯一说话人为 1521 人,训练与验证重叠 33 人,测试与训练验证不相交。复现时必须保留固定种子与编号文件,否则说话人泄漏会虚增成绩。

实验条件:模型、指标与噪声如何设定?

实验用 3 类现成模型做零样本与重训练对照。AV-HuBERT 用 1759 hours 的 LRS3 加 VoxCeleb2 检查点,属自监督;Llama-AVSR 用同样 1759 hours 语料加冻结大语言模型解码器,属大模型解码路线;Auto-AVSR 分小版 1759 hours 与大版 3448 hours 共 5 语料版,属监督放量路线。指标是词错误率,英文为 Word Error Rate,缩写为 WER,数值越低越好,大于 100% 表示插入错误严重。视觉增益定义为音频错误率减去视听错误率,正值表示加视觉降低了错误。

噪声实验用训练数据合成的多说话人巴布尔噪声,按负 10 dB 到正 10 dB 多个信噪比加入,分 2 种设置:只在测试时加噪而训练保持干净,以及训练以 25% 概率混入噪声再测带噪。后文所有比较都需核对训练数据、测试集、模态、信噪比与是否做噪声增强,任 1 项不同都不是同条件胜负。硬件与优化细节原文未给出完整预算,这是缺项,复现时只能先按 AV-HuBERT 官方流程补记学习率与步数,不能从模型名推定实现。

零样本跨域对照要回答:在 LRS3 上训练好的模型直接测对话会掉多少。下表只取 2 个测试集的音频区间,表头保留 WER 百分比口径,数据格保留原文区间写法,公平条件是同一检查点、未微调、同一 Candor-LR 测试集,指标方向是错误率越低越好。

测试集模态数值区间难度定性可运行对照
LRS3AO0.74–1.95%脚本干净同一检查点
Candor-LRAO16.83–24.32%对话更难同一检查点

上表说明零样本下音频错误率从 LRS3 侧 0.74–1.95% 区间上升到 Candor-LR 侧 16.83–24.32% 区间,论文原句即音频在脚本上很强而在对话上显著下滑。未胜出项必须点名:单纯把脚本数据从 1759 hours 翻倍到 3448 hours 并不能改善对话音频性能,说明量大不等于对症。后文换训练数据后视觉增益会放大,因此不能据此否定视觉价值。

人口分布如何读:年龄与性别是否更均衡?

论文用开源 UniFace 工具从视频帧估计年龄与性别,方法与 Lin 等人的做法一致,目的是在原语料不发布说话人人口元数据的情况下评估多样性。阅读前要确认:纵轴是百分比,红色为 Candor,蓝色为 LRS3,上排为年龄分组,下排为性别分组,左中右分别为训练、验证、测试,时间范围覆盖全部划分,对象是说话人占比而非 utterance 数量。

看图路径: 1. 先看上排 3 个年龄分组子图,对比红色 Candor 与蓝色 LRS3 在 25-35 区间的柱高差异;2. 再看下排 3 个性别分组子图,对比训练集与测试集的男女比例变化方向;3. 最后核对纵轴为百分比而非人数,避免把高柱误读为绝对样本量大

原论文 Fig. 3:Age and gender distributions for Candor-LR and LRS3 estimated using UniFace.

论文图 2。原论文 Fig. 3::“Age and gender distributions for Candor-LR and LRS3 estimated using UniFace. Candor-LR shows improved demographic balance across both dimensions.”。

上图显示训练集中 Candor 在 25-35 岁柱明显高于 LRS3,而 LRS3 在 45-55 岁与 55 岁以上更高;性别上 Candor 训练女性占 47% 而 LRS3 为 36%,测试集 Candor 女性占多数而 LRS3 仍男性占多数。具体为训练 25-35 岁 Candor 占 46% 而 LRS3 占 26%,年长 2 组 LRS3 占 23% 与 12% 而 Candor 仅占 11% 与 5%,训练女性 47% 对 36%,测试女性 57% 对 LRS3 男性 64%。这支持论文所说的年龄与性别更均衡,但也要说明这是模型估计值而非自报人口信息,估计误差未在本文量化,复述时不能写成真实人口普查结论。

表前的问题是:在相同估计方法下,Candor-LR 是否在年轻段与女性比例上更均衡?公平条件是同一工具、同一百分比口径,指标方向是分布越接近均衡越好,但均衡不等于识别更容易,下表给出原文报告的关键百分比。

维度Candor-LRLRS3差异含义证据口径
训练 25–35 岁占比46%26%Candor 更年轻集中同工具估计
训练 45–55 岁占比11%23%LRS3 更年长同工具估计
训练女性占比47%36%Candor 性别更均衡同工具估计
测试女性与男性结构57% female64% male测试集方向相反分开报告

该表代价是只覆盖年龄与性别共 2 维,没有口音、语种、设备等维度,不能推广为全面多样性更优。像素不能精确辨别的验证集 55% 等细柱数值本文不硬写,只用正文连续原句覆盖的训练与测试关键百分比作结论。

主结果 1:换训练数据后对话错误率降了多少?

测的是训练分布的影响,用 AV-HuBERT 在 4 种训练组合下测 3 个测试集。为满足宽表要求,下表保留 5 列,区分训练数据、测试集、音频、视听与视觉增益方向,单位均为词错误率百分比,数值相同不代表同一条件,必须连同训练与测试一起核对。表前的问题是:只训脚本、只训对话、混合训练 3 者中,哪种在对话上最好且不伤脚本?公平条件是同一模型结构、无额外噪声增强,只换训练数据。

训练数据测试集音频错误率视听错误率备注
仅 LRS3LRS32.99% AO待补充域内强
仅 LRS3Candor-LR26.63% AO待补充跨域差
仅 Candor-LRCandor-LR14.81%10.50%域内有效
混合 LRS2+LRS3+Candor-LRCandor-LR待补充9.83% AV WER最优视听

表后解释主要收益与代价:只训 LRS3 时对话音频 26.63% 很差,而只训对话直接降到 14.81% 音频与 10.50% 视听,混合进一步到 9.83% 视听,说明对话内数据是关键。未胜出项是只训对话去测脚本时明显差于脚本模型,说明单向泛化不对称,不能把对话模型直接当脚本模型用。另一反例是混合训练的对话音频在部分设置下反而不如只训对话,说明加脚本数据的好处主要体现在视听融合上。限制是本表只列出有连续原句证据的关键数字,其余格用文字占位,不把无证据数字当结论。

主结果 2:噪声越大视觉补偿是否越大?

测的是不同信噪比下音频与视听的差距,比较干净训练与带噪训练,条件是否一致看训练数据组合与是否做 25% 概率的噪声增强。下表以 0 dB 与 10 dB 的关键对照为锚,展示对话测试集的变化,单位均为词错误率百分比。表前的问题是:噪声越大差距是否越大,窄分布加噪能否替代见过对话分布?公平条件是核对训练集、测试集、信噪比与是否加噪这 4 项。

信噪比与训练音频错误率视听错误率差距含义条件
0 dB 同域99.33% WER50.63% WER48.7% WER difference干净训练
10 dB 跨域干净训练38.96% WER待补充基线LRS3 训测对话
10 dB 跨域带噪训练69.53%待补充反而恶化窄分布加噪
混合最优另见后文待补充待补充需结合多样性见消融节

表后解释:论文报告在 0 dB 时对话音频达 99.33% 而视听为 50.63%,差距为 48.7% WER difference,支持噪声越大视觉越重要的判断。但反例同样重要:只训 LRS3 去测对话 10 dB 时,干净训练为 38.96%,带噪训练反而恶化到 69.53%,说明在窄分布上加合成噪声会过拟合声学分布,伤害跨域泛化。百分比与百分点的区别在此很关键,文中差距均为百分点相减,不能读成相对提升。只有扩大到混合数据加噪声训练,才能在极端噪声下避免崩溃,详见下 1 节消融。

噪声消融:什么组合才能避免极端噪声崩溃?

按问题组织:测不同信噪比下音频与视听的差距,比较干净训练与带噪训练。下表复用上 1 节已验证的 0 dB 与 10 dB 对照,增加对训练多样性的讨论,单位均为词错误率百分比。表前的问题是:域内数据、多样性数据、噪声增强这 3 者各自解决什么,不能互相替代什么?公平条件是同一混合训练模型,只换测试信噪比,或同一测试集只换训练组合。

对照组音频结果视听结果差距解读适用条件
对话 0 dB99.33% WER50.63% WER48.7% WER difference视觉必要
LRS3 训测对话 10 dB 干净38.96% WER待补充跨域基线未见对话
LRS3 训测对话 10 dB 带噪69.53%待补充窄域加噪有害分布太窄
混合加噪见正文待补充待补充极端噪声需组合多样加噪声

表后解释:论文报告混合加噪在 LRS3 负 10 dB 把视听从 78.62% 降到 30.79%,在对话负 10 dB 从 93.70% 降到 80.03%,而混合加噪在对话负 10 dB 最终为 82.00%,优于只训对话无噪的 106.20%。因此结论是有条件的:域内数据处理日常对话,跨域多样性加噪声处理极端噪声,两者不可互相替代。代价是合成巴布尔噪声不能代表真实会议室混响、网络丢包与重叠人声分离,部署前仍需补真实噪声验证。

边界与缺项:哪些结论还不能下?

先说已验证的限制。纯视觉在对话上始终很差,各训练下为 69% 到 78% 量级,说明视觉单独不足以转写对话,只能做补偿。跨数据集泛化不对称:只训对话测脚本 10 dB 视听为 6.62% 尚可,而只训脚本测对话 10 dB 视听为 38.96% 很差,即使对话数据量更大,也不能只归因于量大,还与其覆盖了更受控的分布有关。

再说未验证的推测:论文提到视觉线索得到更有效利用,但未给出注意力或表征层面的因果证据,只能表述为支持而非证明。缺项要具体点名:训练超参数、硬件预算、推理延迟、误判率分解、人口估计误差均未完整报告;噪声仅为合成巴布尔噪声,未评测真实会议室混响、网络丢包与重叠人声分离;验证集仅 10.1 hours,阈值选择可能不稳定。

原文表头与算术没有发现需要标注的冲突,但不同表格的训练 hours 口径不同,零样本表的 1759 hours 与 3448 hours 是预训练总量,而重训练表的 433 hours、657 hours、713 hours、1370 hours 是本实验实际训练量,复述时不能混为同一口径。相关性不等于因果:对话训练带来增益可能是数据量、口语词覆盖、声学多样性共同作用,不能单归因于轮换结构。

复现先做什么:按什么顺序跑通流水线?

复现分 5 步,每步都有可核对的动作。第 1 步解决许可与代码:从原作者处申请 CANDOR 许可,确认本次代码链接当前可用,再按会话目录核对合并视频、双人视频、通道映射与 3 版转写是否齐全,缺任 1 项即停。第 2 步准备转写:获取 Speechmatics 词级 JSON 与对齐文件,核对通道 0 对左、通道 1 对右的映射,用脚本打印几个会话的词时间戳,确认毫秒精度与标点存在。

第 3 步跑切分与过滤:实现标点或 0.5 s 间隔断句,统计片段是否落在 0.8 s 到 5.0 s、均值约 3.6 s,再应用 800 ms、至少 2 词、非全填充词共 3 过滤,记录丢弃比例。第 4 步跑音视频:用 RetinaFace 阈值 0.8 逐帧检测,提 68 点、取嘴部、3 帧平滑、缩到 96 × 96 pixels 并降到 25 fps;音频用同时戳从独立音轨截取,转单声道、16 kHz、无损保存,抽查音画是否同步。

第 5 步复刻划分:找出仅出现 1 次的说话人留给测试,用固定种子分训练验证并保存编号文件,再用 UniFace 复算年龄性别分布以核对均衡性声明。资源状态依据本次核验:流水线代码链接本次可达,可写当前可用;UniFace 为第三方工具链接本次可达,可写当前可用;CANDOR 原数据需自备许可,不可写已公开。若要复现识别结果,先跑 AV-HuBERT 的 4 种训练组合,再跑 25% 概率的噪声增强,注意区分预训练总量与本实验训练量的 hours 口径。

何时值得尝试:这套对话基准适合谁?

当目标是视频会议、课堂、客服等真实对话转写,且已观察到脚本模型在干净集上很好、1 到实际录音就掉点时,值得尝试把 Candor-LR 作为第 2 评测集与增训数据。它的价值在于测试集足够大且说话人不见,能稳定暴露音频退化,并能量化视觉补偿是否随噪声放大。尝试前要接受 3 个代价:1 是必须处理许可与大体积视频,2 是必须复刻多步清洗与说话人划分,3 是纯视觉仍很弱,不能指望只看嘴型解决问题。

还需补的验证是真实噪声与重叠语音下的表现,以及在自有麦克风与口音上的小规模内测,因为合成巴布尔噪声不能代表全部退化。若只能做 1 件事,优先复现混合训练的视听基线,确认在干净对话上接近 8.48%、混合 10 dB 接近 12.40% 的量级,再决定是否投入噪声训练。总体判断是:报告显示对话数据与视觉融合共同缩小了脚本与对话的差距,混合训练在对话上达到 9.83% 视听且不伤脚本,但这仍是受控实验内的结论,部署前需补延迟、成本与误判分解的测量。

📎 论文与评分元数据

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-11 语音/音乐/音频论文速递