英文题目:Who is Talking to Me? Addressing Egocentric TTM with Speaker-aware Conversational Context

会议身份:conference:interspeech:2026:conference-paper-id:chen26x_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #Transformer #音视频 #语音 #口语理解

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Fukun Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Xionghu Zhong:机构信息未能从会议 PDF 纯文本可靠映射
  • Minjie Cai:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

第一视角下对我说话检测(Talking-to-Me,TTM)需根据目标语音段与对应人脸判断说话人是否在对佩戴者说话,难点在于多说话人频繁出画与视线缺失下的长程语义依赖。所提框架先由说话人感知语音嵌入模块将转写文本特征与说话人身份嵌入及对话轮次嵌入拼接投影为统一表征,再由对话上下文建模模块将当前与历史共10轮表征送入话语级 Transformer 编码器捕捉跨轮依赖。随后注视感知视觉嵌入模块用冻结的注视检测(Looking-at-Me,LAM)骨干提取帧级特征并池化投影,最后经双 token 自注意力融合语义与视觉线索并残差保留文本主导后输出分类。与显式建模身份与长上下文的机制差异使模型在视觉缺失时仍可沿对话流推理意图。在 Ego4D TTM 验证集上以平均精度均值(mean Average Precision,mAP)达到72.40%,超出此前最强的 SICNet约3.42个百分点。作者承认在人脸缺失与语义模糊时仍会失效,跨数据集与测试集外推尚未验证。原文未披露训练、推理或部署成本,代码与模型权重已在 GitHub 开源。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

这篇解读的输入是论文正文与两张官方原图像素,目标是让刚进入语音与音频方向的研究生能复述对我说话任务的定义、复现多模态对话上下文框架的训练与推理流程,并理解实验条件与代价。必须保留的信息包括数据集划分与样本量、冻结与更新的参数、评价指标方向、主结果与消融数字、上下文长度与推理速度。输出是一套按学习依赖组织的技术说明,不做营销式判断,不引入证据之外的数值。先说任务。

对我说话的英文是 Talking-to-Me,缩写为 TTM,白话就是在第一视角社交视频里,对每一个候选说话人脸判断他这段话是不是说给戴相机的人听的。输入是一个语音片段与对应的视频片段加跟踪到的人脸裁剪,输出是每个目标人脸的二分类概率。难点在原文写得很直接:多人自然对话有多轮语义依赖,说话人经常不在画面里,或者低头看牌、看物体导致没有直接的注视行为,只看当前一句话或只看一张脸是不够的。

举一个教学用的例子:同样一句有两个四,如果上一轮是佩戴者问要不要配对,下一轮的回答很可能是说给佩戴者听的,如果上一轮是另外 2 人在讨论牌面,同样文字可能就不是说给佩戴者听的,这个例子只说明为什么需要历史,不代表论文统计过这类句式。复述方法时要能说清 3 条线:语音转文字后加说话人编号与轮次编号得到话语向量,记忆库取出历史一起做编码得到上下文表示,注视分支提供视觉修正,最后融合分类。

实验部分要能说清在哪个划分上比、和谁比、指标越高越好、关键数字是多少、拿掉哪个模块掉多少。

已有三条路线各解决了什么,为什么还不够?

论文把已有方法分成 3 类,对照时要按同输入、同目标、同运行阶段来理解,不能把类别差异直接当胜负。第一类是音视频直接融合,比如 Ego4D-TTM 基线与 TalkNet,白话就是把声音特征和人脸特征拼起来判断是否在跟我说话,分工是声音管谁在说、图像管脸朝哪,搭配理由是两者互补。但原文指出它们缺少对对话历史的显式建模,限制了在多轮对话中捕捉意图的能力。

第二类是多任务学习,比如 Multi-task、Late Fusion 与 EgoT2,白话就是把对我说话和看着我、主动说话人检测一起训练或融合,分工是相关任务共享视觉社交线索,搭配理由是注视与说话活动能辅助判断寻址对象。第 3 类是上下文感知,比如 SICNet,白话就是引入短文本对话上下文加视觉线索,分工是预训练语言模型管语义、视觉管社交线索。但原文认为它们依赖粗粒度的身份表示,也就是只分是不是佩戴者,以及有限的时间范围,难以建模长期语义依赖与显式说话人角色。

教学上可以这样记:第一类缺历史,第二类缺长期语义,第 3 类缺细粒度身份。论文的选择是保留第 3 类的文本上下文思路,但把说话人编号做细、把历史窗口拉长,再把看着我任务的预训练模型冻结为视觉分支,而不是重新联合训练视觉任务。

对我说话 × 看着我: 对我说话负责判断语音是否在语义上寻址佩戴者,看着我负责判断人脸是否在视觉上注视佩戴者;前者需要长期对话语义,后者提供瞬时 gaze 线索,论文把看着我预训练模型冻结为视觉分支,正是因为二者相关但不同,不能互相替代。

问题形式化:一个样本从输入到输出要走哪些步骤?

先沿一个样本走完全程。假设验证集里有一段目标语音,编号为第 k 轮,附带这段时间的人脸裁剪序列。第一步是得到这段话的文字,论文用 Whisper 做自动语音识别,白话就是语音转文字工具,得到转写文本。第二步是知道是谁说的,论文用说话人日志流程得到说话人编号,佩戴者固定为 0,其他人按聚类结果编号,同时记录对话轮次序号。第三步是把文字、说话人编号、轮次编号变成一个向量,这就是说话人感知语音嵌入。

第四步是从记忆库取出前 T-1 轮的同类向量,与当前向量组成长度为 T 的序列,做话语级编码,得到融入历史的表示,取最后一个位置对应当前轮的表示。第五步是视觉线,把该语音对应的人脸裁剪送入冻结的看着我骨干,帧级特征做时间平均池化再投影,得到注视感知嵌入。第六步是把文本的当前轮表示与视觉表示堆成两个 token,做多头自注意力,取文本 token 的输出加残差得到融合表示。第七步是送入两层感知机加 Softmax 得到对我说话概率。

目标是二分类,监督是每个非佩戴者语音片段是否寻址佩戴者的人工标注。需要强调的是测试划分不公开,所以论文所有数字都报告在验证集上,这决定了复现时只能对齐验证集,不能声称在测试集上可比。

框架全景:三模块如何分工又在哪里汇合?

框架全景可以用 3 条支路加 1 次汇合来记忆。下支路是语音语义线,负责把转写文本变成话语向量并存入记忆库,中支路是上下文线,负责把历史与当前一起编码,上支路是视觉线,负责提供注视证据,最后在特征融合与输出模块汇合。原文把模块命名为说话人感知语音嵌入模块、对话上下文建模模块、注视感知视觉嵌入模块,英文缩写分别为 SSE、CCM、GVM。SSE 的输入是转写文本、说话人编号与轮次序号,输出是统一维度的向量。

CCM 的输入是长度为 T 的向量序列,输出是同样长度的上下文增强序列。GVM 的输入是人脸裁剪序列,输出是一个与语音同维的视觉向量。融合时只取 CCM 序列中对应当前轮的最后一个表示与视觉向量做交互,这种设计让文本主导决策,视觉做修正。下面的导读先帮你定位这张总览图的主路径,再看记忆库与编码器的连接,最后看融合处的残差。

看图路径: 1. 先从下半部分找到当前轮嵌入与记忆库取出的历史嵌入汇入话语级编码器的箭头;2. 再看上半部分视觉分支输出与文本分支输出如何进入自注意力做融合;3. 对照图例确认记忆库圆柱体与投影层小网络符号各代表什么;4. 沿最右侧箭头确认最终输出是目标人脸的分数

原论文 Figure 1:Overview of the proposed multimodal conversational context framework.

论文图 1。原论文 Figure 1:“Overview of the proposed multimodal conversational context framework.”。

看完总览图可以这样复述像素可见的结构:下方粉色大框内是话语级编码器,下方圆柱体是记忆库,箭头显示历史嵌入从记忆库进入编码器,当前轮嵌入从左侧进入编码器,编码器输出的当前轮表示向上进入黄色融合框;上方黄色框内左侧是自注意力,框内可见两个堆叠的 token 与查询、键、值的箭头,右侧是预测头,最终向右输出分数;图例区分了记忆库符号与投影层符号。这种布局对应正文的公式流程:先拼接投影得到单轮向量,再组序列编码,再与视觉向量融合。理解这张图后,后续组件节只需逐个展开每个框的计算与冻结策略。

语音这边:文字、说话人、轮次如何变成一个向量?

语音分支的起点是转写与编号。Whisper 给出每段语音的文本,RoBERTa 把每句文本编码为话语级特征,白话就是用预训练语言模型把一句话变成一个语义向量。说话人编号来自基于聚类的第一视角说话人日志流程:先用 CAM++ 从每段语音提取说话人嵌入,白话就是声纹向量,再做拉普拉斯特征分解得到谱嵌入空间并做 K 均值聚类,把语音按说话人分组,每段得到一个编号,佩戴者固定为 0 以保证跨视频一致。轮次序号是标量,记录对话进行到第几轮。

关键设计是身份与轮次都用 32 维可学习嵌入表示,而不是直接用离散标量,前者更具表达力,能参与优化。实现上是把语义向量、身份嵌入、轮次嵌入拼接后过一个线性投影层,得到维度为 d 的说话人感知语音嵌入。原文没有给出 d 的具体数值与 RoBERTa 的具体层宽,这是复现时需要对照代码的缺项,不能从模型名字推定。

说话人感知语音嵌入 × 对话上下文建模: 说话人感知语音嵌入负责把当前轮的话说了什么、是谁说的、第几轮说的一起打包成一个向量,对话上下文建模负责把当前向量和记忆库里前 T-1 轮的向量放在一起做自注意力,让每一轮都能看到历史;前者解决多说话人混淆,后者解决单轮语义不清,二者搭配才能在长期对话中推断意图。

说话人日志 × 说话人身份嵌入: 说话人日志负责用聚类给每段语音分配离散的说话人编号,佩戴者固定为 0,说话人身份嵌入负责把该离散编号变成 32 维可学习的连续向量;前者是分组结果,后者是可参与梯度优化的表达,二者搭配才让模型能区分不同个体的说话行为。

记忆库 × 话语级 Transformer 编码器: 记忆库负责按时间存下每轮的话语级说话人感知嵌入,话语级 Transformer 编码器负责把当前轮加前 T-1 轮组成的序列做 L 层自注意力;前者是存储结构,后者是计算结构,搭配后每轮表示既保留自身语义又融入对话历史。

记住这一步的输出会被两处使用:一处是进入编码器参与当前预测,一处是存入记忆库供未来轮次使用,这种读写关系是上下文建模能利用长期历史的前提。

上下文与视觉:历史如何参与,注视如何修正?

上下文建模的输入是当前轮与前 T-1 轮的向量序列,长度为 T。论文用 L 层话语级 Transformer 编码器做自注意力,白话就是让序列里每一轮都能加权地看其他轮,捕捉多轮语义依赖。输出是同样长度的增强序列,取最后一个位置作为当前轮的上下文表示,它既保留自身语义又融入历史中的显著信息。原文没有报告 L 的层数与头数,这是缺项,复现时需以代码为准,不猜。

视觉分支的输入是目标语音对应的人脸裁剪序列,先用冻结的看着我模型逐帧提特征,再做时间平均池化得到话语级视觉表示,过线性投影对齐到与语音相同的维度。冻结意味着视觉骨干不参与梯度更新,只提供 gaze 感知线索。融合时把文本当前轮表示与视觉表示堆成两个 token,送入多头自注意力,取文本 token 对应的输出再与原始文本表示做残差连接,得到融合表示,最后过两层感知机加 Softmax 得到概率。

残差的作用在原文有明确安排理由:保留原始语义信息,让视觉在不干扰文本主导决策的前提下提供补充。

注视感知视觉嵌入 × 多模态融合: 注视感知视觉嵌入负责回答说话人是否在视觉上看向佩戴者,它来自预训练的看着我任务骨干,多模态融合负责把文本分支的当前轮表示和视觉分支的表示堆成两个 token 做自注意力再残差相加;前者提供 gaze 证据,后者让视觉只做修正而不淹没以文本为主的决策。

这一步的教学要点是区分两个注意力:编码器内的注意力管历史轮次之间,融合处的注意力管文本与视觉之间,二者位置与目标不同。

哪些参数更新,哪些冻结,监督从哪里来?

训练配置要按冻结与更新分开记。严格冻结的包括 Whisper、CAM++ 与看着我模型,它们只做推理式特征提取,不更新。RoBERTa 的处理分 2 个阶段:先微调最后两层、层归一化层与池化层 5 个轮次,用新初始化的分类头,损失为交叉熵;随后训练语音嵌入的线性投影层、话语级编码器、视觉投影层、多模态融合模块与预测头 10 个轮次,优化器是 AdamW,学习率为 0.00001,损失同样是交叉熵。所有实验在一张 RTX 4090 上进行。

监督来源是 Ego4D 社交互动子集里每个非佩戴者语音片段的二分类标注,指示是否寻址佩戴者。需要指出的缺项是原文未报告批量大小、权重衰减、学习率调度、早停与随机种子,也未说明记忆库是在训练中在线更新还是预先离线写入,更未给出梯度是否截断到历史轮的细节,因此不能从冻结字样推定整个系统输出确定,也不能把无训练的骨干等同于确定性求解。复现时应先固定转写与聚类结果,再训练可学习部分,避免把级联误差算到融合模块头上。

2 阶段的安排理由在原文是明确的:先让语言模型适应任务,再联合训练上下文与融合,避免一开始就扰动大模型。

数据、划分、指标与基线条件是什么?

数据来自 Ego4D 社交互动基准,原文报告训练 389 个片段共 32.4 小时,验证 50 个片段共 4.2 小时,测试 133 个片段共 11.1 小时,测试划分不公开所以只报告验证集。预处理后训练样本 26691 个,验证样本 2469 个,每个样本对应一个非佩戴者语音片段的标注。评价指标是平均精度均值,白话就是对每个类别算平均精度再平均,越高越好,遵循官方基准协议。模型配置上音频文本线用 Whisper 转写、CAM++ 提声纹、RoBERTa 提文本,视觉线用 ResNet-18 为编码器的看着我基线模型,融合后用两层感知机输出概率。

基线覆盖 3 类可运行策略:音视频融合的 Ego4D-TTM 与 TalkNet,多任务与融合的 Multi-task、Late Fusion、EgoT2 的多个变体,以及上下文感知的 SICNet。比较的公平条件是同一验证集与同一指标,但原文未说明各基线是否用同一转写与同一人脸跟踪,因此在复述时要保留这一限制,不能声称所有条件完全一致。资源状态方面,论文脚注给出代码与权重链接,第三方基准链接本次验证为可用状态,但当前解读只依据正文证据,不对链接长期可达做承诺。

主结果:在相同验证集上谁高谁低,高多少?

比较问题是:在同一验证集与同一平均精度均值指标下,引入细粒度说话人身份与长历史建模的方法是否优于已有可运行基线,指标越高越好。表中按方法类别列出可运行基线与本方法,数值保留原文写法。下图的导读帮你把数字与多说话人实例对应起来,先看边框颜色图例,再看同一说话人在不同帧的朝向与分数变化。

看图路径: 1. 先按图例确认红框无语音、绿框是对我说话、蓝框不是对我说话;2. 再对比中间帧与右帧同一说话人朝向变化与边框颜色变化;3. 观察左帧佩戴者手部与说话人位置关系,理解多说话人场景

原论文 Figure 3:Example of the TTM prediction results in egocentric multi-speaker social interaction scenario.

论文图 2。原论文 Figure 3:“Example of the TTM prediction results in egocentric multi-speaker social interaction scenario.”。

这组 3 帧来自同一视频的教学实例:左帧佩戴者发起对话,中帧编号为 1 的参与者注视佩戴者并被赋予较高的分数,右帧同一说话人转向另一参与者并被赋予较低的分数,原文还配有文字转写说明对话内容。像素可见的是红绿蓝三色边框分别对应无语音、对我说话、不是对我说话,以及人物头顶的编号标签。这种定性结果支持文本历史加注视修正的机制,但不能当作定量证据,定量判断仍看下表。

方法类别方法平均精度均值与本方法差距可运行性
本方法Ours72.40%基准本研究可运行

表后解释要同时说收益与代价。本方法报告 72.40% 平均精度均值,原文报告比前最优 SICNet 高 3.42 个百分点,这支持细粒度身份与独立编码后再建模长历史的有效性。

代价是流水线更长:依赖 Whisper 转写质量、聚类身份质量与冻结视觉骨干,任何一环误差都会向后传递。未胜出项也要点名:除 SICNet 外多数基线不利用转写文本特征,限制了细粒度意图推理,而 SICNet 虽用上下文但缺显式身份建模与独立话语编码。限制是测试集未公开、基线转写条件未完全对齐、未报告统计显著性,因此只能说在验证集上观察到一致领先,不能推广为所有场景必然成立。百分点与相对百分比不同,这里说的都是百分点差值。

拿掉哪个模块掉多少,历史多长才够?

消融要回答两个问题:3 个模块是否互补,历史窗口多长才够。先看模块消融,比较问题是保持其他组件不变、只移除一个模块时性能如何变化,指标仍是平均精度均值越高越好。

消融条件含义平均精度均值相对完整模型下降说明
Full Model完整模型72.40%基准三模块齐备

表后解释:完整模型最高,去掉上下文掉得最多,说明长历史是主要来源;去掉身份次之,说明区分说话人行为确有贡献。

去掉视觉掉得最少但仍有 1.60 个百分点,说明注视是补充而非主导。这支持三者互补的判断,但不能反推拿掉后必然在其他数据上掉同样幅度。再看上下文长度,比较问题是窗口 T 取多大时收益饱和,条件是同一模型只变 T。

窗口条件历史含义平均精度均值推理速度适用判断
T=1仅当前轮68.34%31.4 FPS 附近无历史基线
T=3短历史70.89%31.4 FPS 附近提升显著
T=10中等历史72.29% 上下31.4 FPS已接近饱和
更大窗口长历史72.4% 上下几乎不变边际收益小
数据规模389 训练片段等26691 训练样本2469 验证样本需对齐划分

表后解释:从 1 到 3 提升最大,说明短期历史提供关键线索;到 10 继续提升但增幅收窄,之后饱和在 72.4% 附近,说明最有信息量的线索集中在近期轮次。

原文报告推理速度达 31.4 帧每秒且随 T 几乎不变,表明增大窗口计算开销可忽略,但要注意帧率不等于端到端延迟,转写与聚类耗时未计入,不能承诺实时性改善。未评测边界是超过 10 之后的具体曲线与长尾罕见场景,复现时应先试 T 为 10,再按需扩展。

哪些情况仍会错,哪些验证还没做?

论文明确报告的失败条件是缺脸与语义模糊场景,例如玩家低头看牌自言自语,此时缺失注视线索且意图含糊,容易误判。这说明当视觉分支无有效输入且文本历史也无明确寻址对象时,模型会同时失去两路证据。未验证的推测要单独标记:原文在结论提出未来可用大规模多模态语言模型增强上下文与意图理解,这属于可能方向而非已验证结论,待验证。

缺失证据不是技术错误,但复述时要用支持与可能区分语气:已显示的是三模块互补与历史窗口饱和趋势,支持的是细粒度身份有助于区分说话人,可能但待验证的是更大模型一定带来提升。相关性不等于因果,转写质量与性能的相关不能直接说成转写导致全部增益。未测量的量包括误判率分布、端到端延迟、训练与推理成本明细,原文只给了单卡型号与推理帧率,没有给出训练时长与显存占用,因此不能承诺成本得到改善。

总体趋势不等于每组都成立,平均精度提升不代表每一轮对话都变好。

要复现,先做什么,后查什么?

复现的第一步是按原文划分准备数据:训练 389 片段、验证 50 片段,预处理后对齐 26691 与 2469 的样本量,确认标注是每个非佩戴者语音片段是否寻址佩戴者,评价用官方协议的平均精度均值。第二步是冻结部分:Whisper、CAM++、看着我骨干严格冻结,视觉编码器用 ResNet-18 的基线权重,第三方基准链接本次验证可用,但要以论文脚注的代码权重为准。第三步是 2 阶段训练:先微调 RoBERTa 最后两层加层归一化与池化层 5 轮,再训练投影层、编码器、融合与预测头 10 轮,优化器 AdamW,学习率 0.00001,损失交叉熵,硬件为单张 RTX 4090。

第四步是对齐超参数缺项:身份与轮次嵌入维度为 32 已知,但编码器层数、注意力头数、隐藏维度、批量大小、调度与种子未报告,必须查代码,不猜。第五步是先固定 T 为 10 验证主结果,再扫 T 为 1 与 3 复现饱和曲线,同时记录推理帧率与转写聚类耗时分开报告。常见误解是把冻结等同于确定性:冻结只说明参数不更新,不代表级联输出确定,转写与聚类仍有随机性与误差。

另一个误解是把验证集最优当可部署收益:原文的 72.40% 是验证集结果,测试集未公开,部署前还需补跨场景与缺脸场景的验证。

何时值得尝试这个思路?

当你的任务也是判断话语寻址对象,且有多说话人、多轮次、说话人经常出画或低头导致注视缺失时,这个思路值得尝试:用转写文本承担主要语义,用细粒度身份区分谁在说,用近期历史提供意图线索,用冻结的注视模型做轻量修正。复现时优先保证转写与聚类质量,因为它们是所有上下文的基础;融合处保留残差,让视觉只做加分项。

还需要补的验证是同一转写与同一跟踪条件下的基线重跑、统计显著性、端到端延迟与显存成本,以及缺脸与自言自语等边界场景的误判分析。区分代码开源、权重下载与系统可运行:论文声明代码与权重可用,第三方基准链接本次可达,但可运行还要求 Whisper、CAM++、RoBERTa 与视觉权重的版本对齐,缺一不可。记住核心数字:完整模型 72.40%,比 SICNet 高 3.42 个百分点,去上下文掉到 68.01%,去身份掉到 69.84%,去视觉掉到 70.80%,窗口从 1 到 3 提升到 70.89%,到 10 达 72.29% 上下后饱和,推理约 31.4 帧每秒且随窗口几乎不变。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总