英文题目:Unified Audio-Visual Modeling to Recognize Which Face Spoke When and What in Scenarios with On- and Off-Screen Participants
会议身份:
conference:interspeech:2026:conference-paper-id:makishima26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#自回归模型 #Transformer #音视频 #音视频语音识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:方法研究
👥 作者与机构
- Naoki Makishima:机构信息未能从会议 PDF 纯文本可靠映射
- Suzuka Yamada:机构信息未能从会议 PDF 纯文本可靠映射
- Taiga Yamane:机构信息未能从会议 PDF 纯文本可靠映射
- Mana Ihori:机构信息未能从会议 PDF 纯文本可靠映射
- Tanaka Tomohiro:机构信息未能从会议 PDF 纯文本可靠映射
- Satoshi Suzuki:机构信息未能从会议 PDF 纯文本可靠映射
- Shota Orihashi:机构信息未能从会议 PDF 纯文本可靠映射
- Ryo Masumura:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作研究含在屏与画外参与者的音视频说话人归属语音识别(audio-visual speaker-attributed speech recognition,AVSASR),输入为单通道重叠语音与多路人脸视频,输出为按说话起始先后排序的多人转写、起止时间戳与视频归属,要求部分说话人不在画面时避免错误强制关联。方法为端到端单模型序列化输出:语音编码器与视频编码器分别抽取声学与唇动表征,经可学习段嵌入区分来源后拼接,再由Transformer编码器建模跨模态依赖,最后由Transformer解码器自回归生成时间戳加文本加视频令牌序列,其中画外话语统一生成专用[None]令牌。该标记可复用多次,而每个可见编号至多出现一次,训练时对所有音画组合等概率采样。含画外说话人的 LRS3 仿真测试中,3 话语时所提方法视觉词错率(visual word error rate,VWER)为 42.6%,优于分离式多说话人音视频语音识别加唇动检测基线的 44.9%,2 话语时为 30.4%对 34.8%;视觉时间错误率(visual time error rate,VTER)同样更优。全可见条件下与专用模型基本持平,3 话语词错率(word error rate,WER)为 33.4%对 33.5%。在含画外说话人的三话语仿真测试条件下,所提方法的VWER为42.6%,低于分离式多说话人音视频语音识别加唇动检测基线的VWER 44.9%。该结论的适用边界受限于LRS3仿真混合、固定三路视频与最多三话语的评测场景,画外多说话人时依赖音画同步的归属仍困难构成失败条件,真实远场会议与更多人数场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,哪些信息必须保留?
这篇论文处理的输入是单通道重叠语音加多路人脸视频。语音侧是多个说话人同时说话的混合波形,只有一个声道可供使用,无法靠声道分离说话人。视频侧是同一场景下多名参与者的嘴部附近画面,每一路视频对应一个候选人脸,帧率在实验中被降采样处理。目标是同时回答 3 个问题:哪张脸在说话,何时说话,说了什么文字内容。论文把这个任务称为音视频说话人归属语音识别。
必须保留的信息包括每句话的文字、每句话的开始与结束时间、每句话与视频路数的对应关系。如果说话人不在画面内,对应关系必须显式保留为缺席,而不是随意指向某张可见脸。输出被定义为一个序列化标记序列,依次排列每句话的起始时间标记、结束时间标记、文本词、视频标记,再用分隔符区分说话人,最后以结束符收尾。这样的输出形式让内容识别、时间定位和人脸关联共用同一自回归过程。
对刚进入语音或音视频领域的研究生而言,关键是理解这里的重叠不是背景噪声,而是两个或 3 个目标说话人都需要被转写。模型不能先假设画面中一定有说话人,也不能假设说话人数等于视频路数。后续所有建模、数据构造和评价指标都围绕如何在离屏情况下仍保持这种对应关系的正确性展开。
此前路线如何分工,为什么离屏条件会让它们失效?
此前研究大致沿两条路线展开。一条是多说话人音视频语音识别,主要把视觉信息作为查询,从嘈杂混合语音中抽取目标说话人的文字,做法包括以目标人脸为条件做分离再识别,或引入注意力在多人脸轨道上选择。另一条是主动说话人检测,判断任意时刻哪张脸正在说话,处理音频与视觉线索的同步关系。两条路线各自解决说什么和谁在说的一部分,但都需要先确定目标是谁,再决定如何利用视频。
论文指出,已有的音视频说话人归属识别工作把两条路线联合起来,例如对每个音频帧计算覆盖多个人脸轨道的注意力分数,或在重叠段同时转写并确定音视频流对应关系。这些方法报告了在可见说话人条件下的关联能力。但它们的共同假设是音频中的说话人一定出现在视频中。原文明确说明这一假设在真实鸡尾酒会、遮挡、画外交流以及因隐私无法采集全部人脸视频时不成立。
相关工作还包括音视频说话人日志和离屏说话人检测的探索,利用音视频同步、说话人身份信息或向量特征处理隐藏说话人。但论文表示,据其所知,此前没有研究在音视频说话人归属识别建模中系统处理离屏参与者。因此本文不是重复可见条件下的联合建模,而是把缺席情况作为一等建模对象,并相应扩展训练与评测数据的构造方式。
离屏问题具体难在哪里?
困难首先来自强制关联。当模型只能输出可见视频编号时,即使某句话来自画外,它也被迫选择一路可见视频,从而把错误的文字安到错误的人脸上,并污染时间边界评价。其次是数量不匹配。当所有说话人都在屏时,模型可以按唇动开始顺序把话语与视频对应;当存在离屏说话人时,动唇数量与话语数量不再一致,简单的顺序对应失效,必须依赖更细的音视频同步。
困难还来自训练覆盖。如果训练只包含说话人全部可见的组合,模型学不到缺席模式,测试遇到离屏就会把离屏语音误关联到可见参与者,导致词错误率和视觉指标同时上升。论文的解决思路是引入专用缺席标记,并在训练中覆盖可见与缺席的各种音视频组合,使模型学会在证据不足时选择不关联。 举一个教学用的例子:两句话重叠,视频有 3 路人脸,其中第一句话来自画外,第二句话来自第二路人脸。
理想输出应为第一句话对应缺席标记,第二句话对应第二路视频。若模型没有缺席标记,它可能把第一句话也指向第一或第 3 路视频,造成两路视频的评价都出错。这个例子只说明输出形式,不代表论文的实际数值效果。
统一建模的全景:一个样本如何走完输入到输出?
沿一个样本走一遍有助于建立整体图像。假设输入为一段单通道双说话人重叠语音和 3 路人脸视频。语音先经过语音编码器得到声学表示,每路视频各自经过视频编码器得到视觉表示,再拼接并加入区分语音段与各视频段的段嵌入,最后经过变换器编码器得到联合上下文。解码器自回归地生成序列化序列,例如先输出第一句话的开始时间、结束时间、文本词和视频标记,再输出分隔符,然后输出第二句话的相应内容,最后输出结束符。
在全在屏情况下,视频标记取值为可见编号,例如第一句话对应第 3 路视频,第二句话对应第一路视频。在 1 人离屏情况下,第一句话对应缺席标记,第二句话对应可见编号。在 2 人均离屏情况下,两句话都对应缺席标记。图注明确指出音频与视频同色表示同一说话人,这为理解 3 种组合提供了直观对照。
下面这张图是理解该全景的关键,它把 3 种音视频组合的输入与期望输出并排展示,初学者应先看输入侧的语音与视频路数,再看输出侧时间、文本与视频标记的排列,然后对比缺席标记出现的位置。
看图路径: 1. 先看每行底部输入:左侧单通道重叠语音与右侧三路视频的对应关系;2. 再看顶部输出序列中时间标记、文本与视频标记或[None] 的排列顺序;3. 对比(a) 全在屏、(b) 一人离屏、(c) 两人离屏三行输出的视频标记差异;4. 核对音频颜色与视频笑脸颜色在(b)(c) 中如何不再强制对应可见人脸
论文图 1。原论文 Figure 1:“Overview of proposed method when (a) both speakers are on-screen, (b) one speaker is absent, and (c) both speakers are absent in case of K = 2.”。
该图包含 3 个面板。(a) 对应 2 人都在屏,输出为两个可见视频编号;(b) 对应 1 人缺席,第一句话输出[None],第二句话输出可见编号;(c) 对应 2 人均缺席,两句话都输出[None]。输入侧每行都是左侧单通道重叠语音加右侧 3 路视频,输出侧箭头上方为期望的序列化片段。像素可见的笑脸颜色与波形颜色在(a) 中形成对应,在(b)(c) 中离屏话语不再占用可见编号,这正是专用缺席标记要实现的避免强制关联的效果。
组件如何分工:编码器、段嵌入与自回归解码器做了什么?
语音编码器负责把对数梅尔滤波器组声学特征转换为帧级声学表示。论文实现中先经过卷积与池化及深度卷积与长短时记忆层,再堆叠变换器编码器块。视频编码器负责把每路嘴部灰度画面转换为帧级视觉表示,论文使用轻量移动端网络。两者输出在时间轴上拼接前各自加入位置编码,使模型能捕捉时序对齐关系。 段嵌入负责显式区分哪段表示来自语音、哪段来自第几路视频。
论文用段信息序列标记语音部分与各视频部分,并通过嵌入层加到拼接后的表示上,再送入变换器编码器得到联合上下文。解码器以该上下文为条件,按步预测序列化序列中的下一个标记,生成概率按链式法则分解,训练用交叉熵损失优化。
多说话人语音识别 × 时间戳预测: 多说话人语音识别负责把重叠语音中的每句话转写成文字并按说话人分开,时间戳预测负责给出每句话的开始和结束时刻,二者搭配的理由是只有先知道何时说了才能把文字与人脸活动对齐,组合后模型按先进先出顺序输出带起止标记的序列化文本,为后续关联视频帧提供时间锚点。
音视频说话人归属识别 × 主动说话人检测: 音视频说话人归属识别负责回答哪段文字对应哪路视频,主动说话人检测负责判断当前哪张脸正在说话,前者需要后者的对应关系才能把识别结果落到具体人脸,后者单独做只能给说话状态而给不出文字内容,组合后模型在同一自回归序列中同时输出文字、时间和视频标记,1 次完成何时、说了什么、对应哪张脸。
视频标记 × [None] 标记: 视频标记负责把第 k 句话指向第 i 路视频,[None] 标记负责表示该句话的说话人不在任何输入视频中,二者搭配的理由是常规视频标记只能做强制选择,遇到遮挡或画外说话人必然指错,组合后模型对离屏话语输出[None] 而不再占用可见人脸编号,从而保留可见话语的正确关联并显式区分离屏部分。
上述 3 组搭配共同决定了模型的监督来源:文字与时间来自音频转写与边界标注,视频归属来自话语与视频路的对应标注,缺席情况来自[None] 标注。约束条件是可见编号至多被分配 1 次,而[None] 可被多次分配,这保证了可见人脸不重复占用,同时允许多个离屏话语并存。
缺席标记的约束与组合覆盖如何防止硬指认?
缺席标记的形式化约束是每个话语的视频标记取值范围为可见编号集合加[None],可见编号每个至多用 1 次,[None] 使用次数不限。论文强调常规研究多假设视频路数等于说话人数或只处理单目标加单视频,不考虑缺席;也有工作处理路数不等但未引入缺席标记。本文把所有可能的音视频组合都纳入考虑,使训练覆盖有人在屏内、有人在屏外的自由交谈情形。 在实现上,目标标签与常规序列化序列相同,只是视频标记位置允许出现[None]。
模型结构与损失函数与常规方法一致,区别在于标签空间与训练数据的组合分布。这种设计的好处是无需新增独立分支,仅通过扩展输出词表与组合采样即可支持离屏。 需要指出的缺项是,论文未报告缺席标记与可见编号之间的显式竞争机制细节,例如解码时是否对重复可见编号做硬约束解码。按证据只能说训练标签满足该约束,推理是否强制执行该约束未明确说明,因此不能从模型名称推定其解码实现。
训练与数据构造实际执行了哪些操作?
训练数据基于唇读句子数据集构建。原文使用该数据集的预训练、训练验证与测试集合并后重新划分,保证说话人在集合间不重叠,并使验证与测试包含更长音频。由于原数据为单说话人视频,论文通过混合不同说话人的话语构造双说话人与三说话人仿真重叠语音,混合时保持原始音量,平均信干比约为零分贝,延迟随机选择并遵循先前序列化输出训练的约束。
视频长度不足时复制最近帧补齐,并为内存约束每 5 帧取 1 帧得到每秒 5 帧视频,裁剪嘴部周围区域并转灰度,加高斯噪声。声学特征为 80 维对数梅尔滤波器组,文本为句子片段标记。 训练策略是先在无离屏条件下预训练,再加入离屏组合继续训练,初始参数来自前 1 个阶段,优化器使用修正自适应矩估计。视频分配遵循缺席约束,所有模式设为等概率,实验中视频路数设为三。
常规音视频说话人归属模型只用可见说话人与非说话参与者视频训练,因此无法处理离屏视频标记;常规多说话人音视频识别去掉视频标记,可与本文方法同样利用含离屏的视频训练。 唇动检测基线由视频编码器、变换器编码器块与分类层组成,逐帧预测唇动与否,在相同多说话人视频数据上训练,复制帧被标注为零。
推理时先由多说话人音视频识别给出转写与时间戳,再对每个话语视频对计算跨度内外唇动帧数差的归一化分数,选最高分视频,若最高分低于阈值则判为离屏。该阈值与打分规则是论文明确给出的可运行策略,不是事后最优。
评测条件如何设置,指标方向如何理解?
评测分为两种条件:所有说话人都在屏,以及包含离屏说话人。话语数分别考察一、二、三句话的重叠情形。比较对象包括常规多说话人语音识别、常规多说话人音视频说话人归属识别、多说话人音视频识别加唇动检测的组合系统,以及本文提出的方法。为公平比较,所有模型采用相同主体结构。常规归属模型未使用缺席标记,离屏结果仅供参考。
指标包括词错误率、视觉词错误率与视觉时间错误率。词错误率只评价说了什么,不考虑归属。视觉词错误率评价哪张脸说了什么,把预测视频标记对应的转写作为该视频的假设文本再算词错误率,若视频标记预测错误,即使文字本身正确也会计为错误。视觉时间错误率评价哪张脸何时说话,把预测视频标记对应的时间戳作为假设边界计算时间错误率,包含漏检与误检,边界比较容差为正 -250 毫秒。3 个指标都是越低越好。
计算词错误率与视觉词错误率时只评价文本词,不含分隔、时间与视频等特殊标记。
视觉词错误率 × 视觉时间错误率: 视觉词错误率负责评价哪张脸说了什么是否正确,视觉时间错误率负责评价哪张脸何时说话是否正确,前者把预测视频标记对应的转写文本作为该视频的假设文本再算词错误率,后者把预测视频标记对应的起止时间作为该视频的假设边界再算时间错误率,二者搭配才能把内容错误与关联错误、时间边界错误区分开。
数据划分、仿真混合、特征提取与视频预处理在前一节已交代,评测时假设话语按开始时间排序以简化序列化顺序。论文还报告唇动检测在测试数据上的召回率、精确率与调和平均值较高,但这只说明唇动帧分类本身较准,不等于话语级归属一定准确,因为后者还受时间戳误差与阈值选择影响。
主结果:在屏与离屏条件下谁更稳?
比较的核心问题是统一模型在保持在屏性能的同时,能否在离屏条件下避免把画外语音硬安到可见脸上。公平条件是相同结构、相同仿真构造与相同指标定义,指标方向均为越低越好。下表聚焦双话语重叠在屏条件,展示 3 个可运行策略的内容与关联误差,常规语音识别因无视频归属不参与视觉指标比较。
| 话语数 | 方法 | 词错误率 | 视觉词错误率 | 视觉时间错误率 |
|---|---|---|---|---|
| 2 话语在屏 | 常规归属识别 | 25.8 | 28.8 | 3.2 |
| 2 话语在屏 | 识别加唇动检测 | 25.8 | 28.9 | 4.6 |
| 2 话语在屏 | 本文方法 | 25.4 | 27.9 | 3.6 |
该表显示,在屏双话语条件下本文方法与专用常规归属模型基本相当,词错误率与视觉词错误率差异很小,视觉时间错误率略高但处于同一量级。组合系统的视觉时间错误率高于两者,说明分步打分在边界精度上存在代价。单话语与三话语在屏趋势类似,论文报告本文方法接近专用模型,未出现明显退化。
未胜出项是单话语在屏的视觉词错误率与视觉时间错误率,本文方法略逊于常规归属模型,这提示缺席标记的引入并未在简单条件下带来增益。 需要强调的是,在屏结果不能推广到离屏,离屏条件下的关联难度与误差来源不同,下一节用离屏对照进一步检验缺席标记的作用。
离屏对照:缺席标记与分步对脸各付出什么代价?
这里的比较问题是当测试包含离屏说话人时,统一缺席建模相对分步先转写后对脸是否更可靠。条件保持仿真混合、视频路数与指标定义一致,常规归属模型因训练未见离屏而作为参考,其离屏数值仅说明强制关联的失效程度,不能视为同条件可部署基线。真正可运行的对照是识别加唇动检测组合与本文方法。
| 条件 | 指标 | 常规归属参考 | 本文方法 | 可运行对照 |
|---|---|---|---|---|
| 2 话语含离屏 | 词错误率 | 38.1 | 25.8 | 25.8 |
| 2 话语含离屏 | 视觉词错误率 | 71.9 | 30.4 | 34.8 |
| 2 话语含离屏 | 视觉时间错误率 | 76.3 | 3.5 | 6.4 |
该表显示,常规归属参考在离屏时词错误率明显上升,视觉指标大幅恶化,论文解释为把离屏语音错误关联到可见参与者所致。本文方法把词错误率拉回到与组合系统相同的水平,并在视觉词错误率与视觉时间错误率上优于组合系统。
代价是本文方法的视觉词错误率仍高于其词错误率,差值随话语数增加而扩大,说明内容转写正确但归属错误的情况仍然存在。
多说话人音视频识别 × 唇动检测: 多说话人音视频识别负责输出带时间戳的多人转写但不输出视频归属,唇动检测负责逐帧判断嘴唇是否在动并据此为每句话打分选脸,前者提供何时说了什么,后者提供哪张脸在动,组合成基线系统的理由是把关联步骤外置为可运行的对照,组合意义在于检验端到端统一建模相对分步先转写后对脸是否有优势。
三话语含离屏时趋势相同但绝对误差更高,本文方法的视觉词错误率与视觉时间错误率仍优于组合系统,但与词错误率的差距更大。论文将其归因于动唇数与话语数不一致后,模型必须依赖音视频同步而非顺序对应,并指出更恰当的同步建模是未来工作。这一表述属于有限解释,原文未给出同步模块的消融证据,因此只能视为待验证的方向。
哪些边界尚未验证,不能承诺什么?
首先是数据边界。所有训练与评测均为仿真混合,混合时保持原始音量且平均信干比约为零分贝,视频经过补帧、降采样、裁剪与加噪。真实遮挡、相机外自由走动、多麦克风混响与隐私缺失视频的分布可能与仿真不同,论文未报告真实会议或野外数据的验证,因此不能把仿真增益直接承诺为真实部署增益。 其次是指标边界。
论文报告了内容与归属相关指标及唇动帧分类的召回率与精确率,但未测量误判率随阈值的完整曲线、推理延迟、模型参数量与训练算力开销,也未报告统计显著性与多次随机种子的方差。总体趋势不等于每组话语都成立,单话语在屏已有本文方法略逊的反例。 再次是机制边界。论文显示了缺席标记缓解强制关联的效果,但未消融段嵌入、位置编码、视频编码器选择或不同离屏比例训练分布的影响,也未说明解码时如何保证可见编号不重复。
相关性不等于因果,不能断言去掉某组件必然如何。未测量延迟与成本时,不应承诺实时性或效率改善。
复现应先做什么,需要保留哪些关键条件?
复现的第一步是重建数据划分与仿真流程,而非直接调模型。需按说话人不重叠原则重新划分唇读句子数据,保证验证与测试包含更长音频,再按保持原始音量、平均信干比约为零分贝、随机延迟约束混合出双说话人与三说话人重叠语音。视频侧需实现补帧、每 5 帧取 1 帧、嘴部区域裁剪转灰度与高斯噪声注入,声学侧提取 80 维对数梅尔特征,文本侧使用句子片段标记。视频路数设为三,并按可见编号至多用 1 次、缺席标记不限次的约束等概率采样各种组合。
第二步是按 2 阶段训练:先无离屏预训练,再加入离屏组合微调,保持语音编码器、视频编码器、段嵌入与变换器编码解码器的结构一致,优化器与超参数与原文一致。组合基线需单独训练唇动检测模型,并实现基于时间跨度内外唇动帧数差的归一化打分与阈值判离屏逻辑。评价时分别在全在屏与含离屏条件下计算词错误率、视觉词错误率与视觉时间错误率,边界容差取正 -250 毫秒,且只对文本词计分。
关于可用性,证据中未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。复现者应以论文正文与仿真描述为准自行实现,并记录随机种子、划分文件与混合参数以保证可比性。还需补充的验证包括真实录制数据的泛化、不同离屏比例与不同视频路数的敏感性,以及延迟与算力的实测。
何时值得尝试这种统一缺席建模?
当应用场景明确存在画外或遮挡说话人,且输出必须同时给出文字、时间与人脸对应时,这种在序列化输出中增加缺席标记的统一建模值得尝试。它用最小的结构改动解决了强制关联问题,在屏性能基本不损失,离屏时优于分步对脸基线。对于教学而言,其价值在于展示如何把缺席作为显式标签纳入自回归词表,并通过组合采样覆盖真实场景。
当场景保证所有说话人始终可见,或已有高精度人脸跟踪与声源定位可独立提供可靠关联时,分步方案可能更易调试,统一模型的额外关联负担未必必要。当视频缺失比例极高或音频质量极差时,音视频同步本身不可靠,缺席标记也难以弥补,此时应先改善前端增强或引入说话人身份等更强线索。 常见的误解是把视觉词错误率的下降等同于语音识别本身变强。
实际上词错误率与视觉词错误率之差反映的是归属错误,本文方法的主要贡献在归属而非纯转写。另一个误解是把唇动帧分类的高分等同于话语归属已解决,但话语级归属还受时间戳误差与阈值影响。理解这两点,才能正确复述该方法的作用边界。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
