英文题目:Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection

会议身份:conference:interspeech:2026:conference-paper-id:lu26d_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#混合专家模型 #多模态学习 #零样本 #语音 #音视频理解

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Wenhuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xinyue Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenjun Ke:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhizhi Yu:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenhao Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jianguo Wei:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音驱动开放集目标检测以语音波形与图像为输入,直接输出目标框与语音语义对齐结果,难点在于连续语音时间冗余高、信息密度不均,且配对音频图像数据稀缺而难以从零训练。本文提出Speech2See框架,先以HuBERT-Base抽取帧级声学嵌入并经查询引导语义聚合压缩为紧凑语义令牌,再送入类Grounding DINO特征增强器与跨模态解码器完成听觉到定位映射,最后在解码器前馈网络层插入混合LoRA专家做参数高效微调。与经文本中转的两阶段YOSS相比,该设计避免自动语音识别级联误差并保留连续声学线索。在COCO2017验证集闭集评测下,Speech2See的AP指标为56.2,高于YOSS-large的AP指标为39.2。结论仅在10说话人合成语音与COCO、Objects365、Flickr30k、LVIS构造集上验证,真实噪声、多轮指代与长尾罕见类外推尚未证明。该结论适用边界受限于合成语音构造评测,真实噪声下表现尚未验证。训练成本上硬件为8张NVIDIA A800,推理开销上参数量为197.8M且实时因子为0.35。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么值得直接听声定位?

这篇论文研究的输入是一张图像加一段语音,语音内容是类别名或描述句,例如说出椅子、狗、球、人物等目标。输出是在图像上给出这些目标的边界框,等价于把听到的词定位到看得见的位置。目标读者需要先保留 3 个信息条件:数据集本身没有原生语音,语音是用合成方式从文本标注生成的;评估同时看闭集与零样本;比较时要区分语音模型、文本模型与级联系统的训练数据是否一致。

开放集检测的白话含义是检测器不只认识训练时见过的固定类别,还要能响应训练时未见过的新类别描述。传统做法依赖文本提供语义引导,例如 Grounding DINO、GLIP 与 YOLO-World 都用文本查询去引导定位。但在人机交互与语音导航中,打字或提供文本并不方便,语音才是更自然的输入。论文进一步指出语音不只是文本的发声版,它带有语调与重读等副语言线索,理论上有助于消解指代歧义。难点在于语音是连续、冗长且信息密度不均的信号,还混入噪声、韵律与说话人差异,直接对齐图像比离散文本更难。

开放集目标检测 × 音频定位: 开放集目标检测负责在不限定预设类别下定位已知与新类别目标,提供框回归与类别泛化能力;音频定位负责把语音描述直接作为定位依据,提供不依赖文字输入的交互方式。二者搭配的理由是现实中语音引导比文本更直接,且语音的语调与重读可消解指代歧义,组合意义是用语音查询驱动开放词汇的框预测,实现听声定位。

因此学习任务可以复述为:在缺少大规模真实语音图像配对的条件下,把连续语音压缩为可与视觉融合的语义表示,再用继承自文本图像对齐的检测器完成定位。论文把成功标准定为不经过中间文本转写,直接建立语音到视觉的对应,并在 COCO 与 LVIS 等基准上用平均精度验证。

已有路线走了哪两条路,各自卡在哪里?

第一条路是文本驱动的开放集检测。GLIP、YOLO-World 与 Grounding DINO 用大规模图像文本对学习共享的视觉语言表示,实现更广的类别覆盖与零样本能力。这条路的监督来源充足,解码器已经学会把离散语义符号与图像区域对齐。它的运行阶段是给定文本提示做检测,输入模态固定为文本,不能直接处理语音。

第二条路是语音驱动的早期尝试。论文点名的 YOSS 采用 2 阶段设计,先通过 CLIP 以文本为中介把音频编码器与视觉特征对齐,再把对齐后的音频编码器接入检测框架,用对比学习把语音映射到图像区域。作者总结其有两个限制:一是解耦的 2 阶段训练阻碍高效端到端优化,导致收敛次优;二是依赖文本中介限制了直接跨模态融合,没有充分利用语音的声学线索。更根本的约束是配对音频图像数据稀缺,从零训练难以泛化。

级联基线 × 端到端优化: 级联基线负责先用语音识别把语音转文字再用文本检测器定位,分工清晰但引入转写误差与文本编码器开销;端到端优化负责让语音表征与视觉特征在同一网络内联合学习对齐。搭配比较的理由是二者输入同为语音、输出同为框,可公平检验中转是否有损,组合意义在于论文用端到端替代 2 个阶段,以避免信息瓶颈与误差传播。

论文还设置了一个可运行的级联基线用于对照:Whisper-Base 做语音识别转文字,再接 Grounding DINO-T 做检测。该基线保留了完整的转写与文本编码开销,论文报告其参数量与实时系数都高于端到端方法,且在 COCO 零样本上精度更低。这组对照的教学意义是:中转文字看似复用了成熟模块,但转写错误会向后传播,且计算代价并未更小。

要解决的具体矛盾是什么,不解决会发生什么?

具体矛盾是:一边是 Grounding DINO 的文本图像对齐先验与 HuBERT 的声学表示都很强,另一边是二者之间存在模态间隙,直接拼在一起并不能做好语音引导的解码。如果只冻结主干、简单加一个多层感知机做适配,语音的时间冗余与不均匀信息密度仍未解决,论文报告这种替换会导致大幅下降。

如果延续 2 阶段或级联做法,会发生两类可预见的问题。第一是误差传播:语音识别错一个词,后续检测器只能基于错文本定位,无法利用原始韵律纠偏。第二是优化割裂:音频编码器对齐与检测器训练分开做,梯度不能端到端地调整跨模态融合部分。论文因此把问题框定为如何用渐进式预训练加微调,把先验知识有效迁移到语音域,而不是重新收集海量真实语音图像对从零训练。

Speech2See 让一个样本走完哪条主路径?

沿一个样本走一遍有助于建立全景。输入为图像与音频对,记为图像 I 与音频 A。图像侧用 Swin Transformer 提取多尺度视觉特征,语音侧用 HuBERT 提取原始语音嵌入。接着查询引导的语义聚合模块把冗长的 HuBERT 嵌入压缩为紧凑语义 token。这些 token 与视觉特征进入受 Grounding DINO 启发的结构:特征增强器做深度融合,语音引导的查询选择模块初始化目标查询,最后跨模态解码器综合增强特征给出预测框与基于语音表示的分类。

训练范式分为两段。预训练阶段建立语音与视觉的基础对齐,微调阶段在解码器中插入 Mixture-of-LoRA-Experts 深化对齐。整体架构的目标是直接语音视觉对应、支持高效端到端优化并保持泛化。以下先看总体结构图,再拆解两个核心模块。

阅读该总体结构图时,先区分语音支路、视觉支路与解码主干,再注意微调分支只在第二阶段接入解码器的位置。该图把压缩、融合、查询初始化与解码放在同一端到端链路中,与 2 阶段中转形成对照。

看图路径: 1. 先从左侧波形经音频编码器到语义聚合的箭头看语音支路如何变短变紧凑;2. 再看图像编码器与语音分支如何共同进入特征增强与查询选择;3. 观察跨模态解码器下方微调分支的接入位置与标注的冻结与更新含义;4. 最后看右侧示例中语音符号与图像块的对齐示意如何表达直接对应

原论文 Figure 1:Our proposed end-to-end audio grounding architecture: Speech2See.

论文图 1。原论文 Figure 1:“Our proposed end-to-end audio grounding architecture: Speech2See.”。

从图中可见的主路径是波形经音频编码与语义聚合变短后,与图像特征汇合进入查询选择与跨模态解码器,右侧示意了语音符号与图像区域的直接对应关系。下方单独画出的微调插件表明第二阶段只动该插件而不重训主干,这与后文冻结与更新规则一致。理解这条主路径后,再看压缩与自适应两个模块各自解决什么计算问题。

语音太长太冗余如何压缩,解码器如何只动小部分就适配语音?

音频编码器输出的特征序列冗余,不适合直接与视觉模态对齐。为此论文引入 K 个可学习查询,记为查询集合,其中 K 远小于语音时间步数 Nt。这些查询充当语义适配器,用基于 Transformer 的交叉注意力对整个语音序列做加权聚合。每个查询有各自的查询、键、值投影矩阵,对所有语音帧计算注意力权重后加权求和,得到聚合后的 token。最终得到 K 个紧凑 token,把原始声学数据转为高层语义形式,再参与跨模态解码器的融合。

第二个组件是参数高效的跨模态适配。转移来的解码器参数保留了文本图像语义先验,但对语音引导的解码仍次优。论文在解码器的前馈网络层加入路由器与 K 个 LoRA 专家。给定输入 token,路由器计算专家分数并按 Top-1 选择最相关的专家,被选专家输出与原始前馈输出相加。每个专家采用标准 LoRA 低秩分解形式,含可学习的低秩矩阵与缩放系数。

每层前馈变换配备专用混合专家但共享同一路由器,使不同专家 специали化于不同语音或语义模式,同时保持参数效率。关键的冻结规则是该阶段冻结原始预训练解码器权重,只训练 MoLE 相关部分。

Query-Guided Semantic Aggregation × 跨模态解码器: Query-Guided Semantic Aggregation 负责把冗长且信息密度不均的 HuBERT 语音序列压缩为紧凑语义 token,解决时间冗余;跨模态解码器负责把该语义 token 与多尺度视觉特征做深度融合与框解码。搭配理由是原始声学序列不适合直接对齐视觉,而解码器承接了文本-图像对齐先验,组合意义是先压缩再融合,让语音能直接参与查询初始化与跨注意力解码。

Mixture-of-LoRA-Experts × 参数高效微调: Mixture-of-LoRA-Experts 负责在解码器前馈网络旁以路由器选择一个低秩专家做增量适配,专门处理不同语音与语义模式;参数高效微调负责冻结原始解码器权重只训练 MoLE 部分,保持文本-图像先验不被稀释。搭配理由是语音多样性需要自适应容量但配对数据少不宜全量更新,组合意义是以极少可训练参数深化语音到视觉的对齐。

下图把解码器内部堆叠与 MoLE 插件画在同一层级,有助于核对冻结边界。左侧为自注意力、图像交叉注意力、文本交叉注意力与前馈网络的重复层,右侧为路由器加两个 LoRA 专家的并联旁路,二者输出相加。图例用不同图标区分微调与冻结,阅读时应先确认箭头起点为跨模态查询,再看旁路在前馈位置汇入。

看图路径: 1. 先看左侧解码器层内自注意力到图像与文本交叉注意力再到前馈网络的堆叠顺序;2. 再看右侧路由器加两个 LoRA 专家的并联结构与加号汇合位置;3. 对照图例中火焰与雪花符号确认哪些模块在微调阶段更新或冻结

原论文 Figure 2:MoLE plugin integrated into the cross-modal decoder.

论文图 2。原论文 Figure 2:“MoLE plugin integrated into the cross-modal decoder.”。

该图显示的计算含义是主干表示不变,只用稀疏激活的低秩增量修正前馈输出。路由器输出的柱状示意对应 Top-1 选择,同一层内不同输入可能走向不同专家,这正是论文所说的自适应处理语音多样性。结合冻结规则可以复述为:主干提供通用对齐能力,专家提供语音特化的残差修正,负载均衡损失防止专家被闲置。

两阶段各冻结谁、更新谁,监督信号从哪里来?

预训练阶段冻结 Swin-T 与 HuBERT 主干以及检测解码器,只优化查询引导的语义聚合模块与投影层。优化器为 AdamW,学习率为 1 乘 10 的负 4 次方,批量为 64,训练 10 个轮次,并采用线性热身调度。语音输入归一化为固定 256 个 token 长度,检测器配置 900 个目标查询。该阶段的监督来自检测损失,形式沿用 Grounding DINO,包括边界框回归的 L1 损失与广义交并比损失,以及仿 GLIP 的对比对齐损失,用于基于聚合语音表示对预测目标分类。匈牙利匹配的代价系数为分类 2.0、L1 为 5.0、广义交并比为 2.0,最终优化的损失权重为分类 1.0、L1 为 5.0、广义交并比为 2.0。

微调阶段插入秩为 64、专家数为 2 的 MoLE 模块到前馈层,只更新 MoLE 参数 2 个轮次,其余参数保持冻结。额外引入稀疏混合专家常用的负载均衡损失,防止专家利用不足并保证多样激活,总目标为检测损失加超参数 lambda 加权的负载均衡损失,论文取负载均衡权重为 1 乘 10 的负 2 次方。所有实验在 8 卡 NVIDIA A800 上进行。

需要指出的缺项是原文未报告学习率调度在微调阶段的具体取值与投影层维度的完整初始化细节,也未给出负载均衡损失在每层的聚合方式是平均还是求和。复述时不应从模型名称推定这些实现,只能按已报告的冻结边界、损失组成与训练轮次执行。若要复现,应先固定上述已报告超参数,再通过日志核对损失曲线是否收敛。

数据如何构造,评估条件如何划分?

由于常用基准缺乏原生语音标注,论文用 edge-TTS 把文本标注合成为多说话人语音语料。合成对象是类别名或描述句,采用 10 个音色与韵律不同的说话人以保证声学多样性与鲁棒性。涉及的数据集包括 COCO 2017 检测集 80 类、Objects365 检测集 365 类、Flickr30k 定位数据与 LVIS 检测数据。论文给出的数据规模为 COCO 约 12.3 万图与 89.6 万框,Objects365 约 60.9 万图与 1000 万框,Flickr30k 约 3.1 万图与 27.5 万框,LVIS 约 16.4 万图与 200 万框。

方法基于 Grounding DINO,视觉与语音主干分别为 Swin-T 与 HuBERT-Base。评估分为闭集与零样本两类。闭集在 COCO2017 验证集上训练并测试;零样本要求训练时未见 COCO 图像与标注,或在 LVIS 长尾类别上测试泛化。指标为平均精度及其在不同交并比与类别划分下的变体,数值越大表示定位与分类整体越好。

比较时需注意 YOSS-large 在 COCO 上为全监督,不具备零样本比较资格,只能作为有监督参考;文本驱动的 Grounding DINO 可视为语音任务的文本上界,但输入模态不同,不能直接当作同条件胜负。

主结果在什么条件下胜出,代价与未胜出项是什么?

先提出比较问题:在相同语音驱动任务下,端到端是否比 2 阶段与级联更准且更省;在零样本下,迁移文本图像先验能否让语音模型接近有监督基线。公平条件要求核对训练数据:闭集比较都在 COCO 上训练,零样本比较需确认是否见过 COCO,LVIS 比较需确认长尾类别划分。指标方向为平均精度越高越好,参数量与实时系数越低越好。

下表整理 COCO 闭集、COCO 零样本与级联效率 3 组关键数字,均为原文直接报告的可运行策略结果,不含事后最优或 oracle。阅读时先看条件列,再看指标列,避免把闭集与零样本数字混为一谈。

条件指标YOSS-large 或级联基线本方法文本上界或补充说明
COCO 闭集AP39.256.2提升 17.0,端到端直接对齐
COCO 零样本AP39.2 闭集有监督参考42.7超过有监督 YOSS-large 闭集,仍低于文本模型
级联对比AP / 参数量 / 实时系数41.6 / 266.7M / 0.4142.7 / 197.8M / 0.35参数减少约 26%,无中间文本
LVIS 零样本AP16.319.9提升 3.6,长尾仍具挑战

论文报告闭集上本方法达 56.2 平均精度,对 YOSS-large 的 39.2 提升 17.0,支持端到端直接语音视觉对齐避免了多阶段信息瓶颈与误差传播的判断。零样本上本方法在 Objects365 加 Flickr 加 GQA 预训练下达 42.7,甚至超过有监督 YOSS-large 的闭集 39.2,支持渐进对齐有效迁移了文本图像先验。但差距依然存在:文本驱动上界更高,论文将其归因于声学信号的噪声与说话人变化等固有歧义,而非实现失误。LVIS 上本方法为 19.9,对 YOSS-large 的 16.3 提升 3.6,但在稀有、常见与频繁类别上与文本检测器仍有差距,论文解释为连续声学特征纠缠副语言变化,语义不如离散文本明确。

以下定性图按列给出真值、Speech2See 与 Grounding DINO 的预测框,有助于理解互补性而非单一胜负。阅读时不要把框颜色直接当作同一类别,需结合标注文字确认。

看图路径: 1. 先按列确认左中右分别为真值、Speech2See 与 Grounding DINO 的预测框;2. 再对比上下两组场景中框的位置与类别标注差异;3. 重点观察第二行中间列对横向目标的检出与第一行多出的小目标框

原论文 Figure 3:Qualitative Comparison of Object Detection Results

论文图 3。原论文 Figure 3:“Qualitative Comparison of Object Detection Results”。

从可见内容看,第一行室内人物场景中本方法检出标注目标并多检出一个真值遗漏的手包,第二行花瓶场景中本方法准确检出餐桌而文本基线漏检,但本方法漏检了盆栽。这组例子支持语音与文本检测器各有优劣的判断,也提醒平均精度提升不等于每类每图都更好。未胜出项与边界是盆栽漏检与长尾稀有类差距,论文未在真实噪声环境做系统评测,这部分属于待验证。

拿掉关键模块会发生什么,专家数量如何选择?

消融要回答两个可操作问题:语义压缩是否必要,混合专家是否带来稳定增益。比较条件是同一预训练数据与同一评估集,只更换适配模块或是否启用 MoLE。指标仍为平均精度及不同交并比变体,越高越好。

条件指标无 MoLE 或 MLP 基线本方法 K 等于 2K 等于 1 或 3 的补充
COCO 闭集AP54.1 无 MoLE56.2MoLE 带来一致提升
COCO 零样本AP40.4 无 MoLE42.7MoLE 在零样本同样有效
LVIS 零样本AP18.5 无 MoLE19.9稀有与常见类均有改善
压缩对照AP27.2 MLP42.7 QSA40.7 当 K 等于 1,K 等于 3 为 42.7 无额外增益
效率对照参数量与实时系数266.7M 与 0.41 级联197.8M 与 0.35省去文本编码器开销

论文报告用标准多层感知机适配器替换查询引导的语义聚合会导致从 42.7 跌至 27.2,下降 15.5。原文解释是多层感知机缺乏动态优先重要帧的机制,难以处理时间冗余与不均信息密度,而可学习查询能选择性关注稀疏语义线索。这支持压缩模块必要的判断,但不应反推拿掉后在所有数据上必然同等幅度下降。

专家数量方面,从 1 增至 2 带来显著增益,证实混合专家能捕捉单一专家难建模的声学变化;增至 3 无额外增益且增加参数,因此取 2 为效率与容量的平衡。MoLE 在闭集与零样本、COCO 与 LVIS 上均一致提升,支持自适应路由细化初始对齐、防止先验被语音多样性稀释的解释。代价是引入路由器与额外低秩参数,论文未报告推理延迟的逐层分解,因此不能承诺每步延迟都下降,只能说总体参数与实时系数低于级联基线。

哪些结论有边界,哪些验证还没有做?

首先是数据边界。当前语音由合成器生成,虽有多说话人,但仍是受控合成分布。论文明确把合成数据称为当前常态,并将真实数据集基准与噪声环境鲁棒对齐列为未来工作。因此在真实口音、重叠语音与环境噪声下的表现属于待验证,不能把合成集上的增益直接推广为真实场景必然同等成立。

其次是表示边界。文本提示是离散符号,语义明确;声学特征连续且纠缠韵律与说话人身份,精确语义对齐更难。这解释了为何语音零样本仍低于文本上界,也意味着长尾类别与稀有词的语音泛化需要额外验证。论文在 LVIS 上虽有提升,但绝对值仍不高,不应解读为长尾问题已解决。

第三是资源声明边界。本次可核对的来源未绑定且完成验证的代码、模型或数据资源,不得声称已公开或当前可用。复现应以论文文字中的超参数与流程为准,缺失的实现细节应报告为缺项而非按名称推定。训练资源为 8 卡 A800,推理开销只报告了总体参数与实时系数,未报告输出帧率与实际延迟的测量环境,讨论延迟时需区分二者。

要复现应先做什么,需要哪些关键超参数?

第一步是按原文构造合成语音。取 COCO、Objects365、Flickr30k 与 LVIS 的类别名或描述句,用 edge-TTS 合成 10 个不同音色与韵律的版本,保持文本到语音的可追溯划分。语音输入归一化为 256 token,检测器设 900 个目标查询,主干固定为 Swin-T 与 HuBERT-Base。

第二步执行冻结式预训练。冻结视觉与语音主干及检测解码器,只训练语义聚合与投影层,用 AdamW、学习率 1 乘 10 的负 4 次方、批量 64、10 轮加线性热身。损失按分类 1.0、L1 为 5.0、广义交并比为 2.0 加权,匹配代价按分类 2.0、L1 为 5.0、广义交并比为 2.0。

第三步插入 MoLE 微调。秩取 64,专家数取 2,只更新 MoLE 2 轮,总损失加权负载均衡项系数为 1 乘 10 的负 2 次方。评估时分别跑 COCO 闭集、COCO 零样本与 LVIS 零样本,核对是否见过目标集图像,避免把有监督参考误作零样本基线。建议先复现 MLP 对照的大幅下降与 K 从 1 到 2 的增益,以确认压缩与路由两处机制均生效。

何时值得尝试这个方案,如何一句话记住它?

当应用只能拿到语音而拿不到文本,且类别开放、不能为每个新词重训检测器时,该方案值得尝试。它的可复述要点是:用现成文本图像对齐与语音表示做先验,先以可学习查询压缩语音解决冗余,再以冻结主干加稀疏低秩专家解决语音多样性,全程不经过语音识别中转。

记住它的强证据与代价:强证据是 COCO 闭集 56.2 对 39.2、零样本 42.7 反超有监督基线闭集、LVIS 19.9 对 16.3,以及参数与实时系数低于级联;代价是仍低于文本上界、依赖合成语音、长尾与真实噪声未经充分验证。后续补验证应优先做真实语音基准、噪声鲁棒性与长尾稀有类的细粒度分析,再谈部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总