英文题目:Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.1997

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#SFT #音频大模型 #语音识别 #音频问答

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhen Wan:机构信息未能从会议 PDF 纯文本可靠映射
  • Chao-Han Huck Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jinchuan Tian:机构信息未能从会议 PDF 纯文本可靠映射
  • Hanrong Ye:机构信息未能从会议 PDF 纯文本可靠映射
  • Ankita Pasad:机构信息未能从会议 PDF 纯文本可靠映射
  • Szu-Wei Fu:机构信息未能从会议 PDF 纯文本可靠映射
  • Arushi Goel:机构信息未能从会议 PDF 纯文本可靠映射
  • Ryo Hachiuma:机构信息未能从会议 PDF 纯文本可靠映射
  • Shizhe Diao:机构信息未能从会议 PDF 纯文本可靠映射
  • Kunal Dhawan:机构信息未能从会议 PDF 纯文本可靠映射
  • Sreyan Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
  • Yusuke Hirota:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhehuai Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Rafael Valle:机构信息未能从会议 PDF 纯文本可靠映射
  • Chenhui Chu:机构信息未能从会议 PDF 纯文本可靠映射
  • Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
  • Boris Ginsburg:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu-Chiang Frank Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为原始音频、可选文本问题、模型自身首遍假设与外部系统假设,输出为转写文本或多选答案,难点在于外部假设可能错误而无仲裁的全模态直接融合会放大幻觉与过度纠正。本文先并行生成内部假设、外部假设与融合重写假设,再按优劣比较构造显式动作标签,接着把动作标记与目标拼接为统一序列做监督微调,最后在推理时先解码动作再按动作生成结果。相比仅操作文本的生成式纠错与无仲裁的全模态拼接,该机制把信任分配显式化,使转写与推理共用同一可控框架。在7个英语语音识别数据集上对接Parakeet时平均词错误率降至5.69%,优于同期最强基线Parakeet的6.68%,在音频问答上多数采样版本平均准确率达到77.37%,高于Audio Flamingo 3的74.49%。该结论限于英语为主的转写与三类音频问答,跨外部系统迁移与多外部源设置尚未验证,重写动作在稀有类上仍欠触发。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决什么输出?

这篇论文的输入是原始音频,加上可选的文本问题,以及来自其他系统的文本假设。输出有两类,一类是语音识别的转写文本,另一类是音频问答的选择题答案。读者可以这样想象学习起点:先有一个能听音频的全模态语言模型,它自己能做一遍转写或回答。同时还有一个外部专家,例如独立的语音识别模型或音频推理模型,它也给出自己的答案。

目标不是把两边文本简单拼起来,而是让同一个全模态模型学会判断该信谁。要理解为什么需要判断,先看两种纠错路线的差别。纯文本的生成式纠错只看语音识别给出的多个候选,不再回听音频。如果所有候选都丢了同一个词,纯文本方法就没有依据把它找回来。全模态纠错把原始音频也作为证据,理论上可以补回被删除或幻觉的内容。

但论文的预备实验显示,把音频和文本一起拿去做有监督微调,反而让平均词错误率上升。这说明多一个信息源不等于自动变好,关键在于缺少裁决机制。下面这张图把纯文本与全模态纠错的输入差异画了出来,例子只是帮助理解输入形态,不代表论文报告了该例的数值效果。

看图路径: 1. 先看左侧音频到流式识别模型的箭头与中间解码多候选列表的对应关系;2. 再对比上方纯文本大模型与下方可听音频的全模态模型的输入差异;3. 注意标准答案中同时需要保留的关键词在候选中被分散的现象

原论文 Figure 5:Text-base GER uses only ASR hypotheses.

论文图 5。原论文 Figure 5:“Text-base GER uses only ASR hypotheses.”。

这张图左侧是一段音频先经过流式识别得到多个解码候选,上方分支只把候选送给纯文本大模型,下方分支同时把音频回路送给全模态模型。可以看到标准答案中的关键词被分散在不同候选中,纯文本分支只能在候选中挑选或拼凑。相比之下,全模态分支还有机会回到声学证据,这正是后面要可靠使用而非被带偏的能力。

与只看文本的纠错路线有何不同?

相关路线可以按输入和运行阶段划分。第一类是生成式纠错,它运行在识别之后,只操作文本假设,不接触原始音频。论文指出这类方法是非智能体式的,因为它没有自己的感知,也就无法在内部感知与外部建议之间权衡。

第二类是朴素的多模态微调,它把音频与外部多候选一起送入全模态模型,期待模型自动融合。论文的对照显示这条路线在 7 个语音识别基准上都退化了,换提示词强调内部、外部或均衡融合也没有恢复。第 3 类是零样本提示裁决,即不训练,只靠指令让基座模型选择相信谁。

论文报告基座模型缺乏内在的裁决能力,决策对提示词措辞高度敏感,容易退化为固定启发,例如总是偏向内部或总是偏向外部。第四类是本文的可学习自反省路线,它在同一输入条件下增加显式动作监督,让模型先输出动作再输出答案。这与前 3 类的区别在于监督来源和运行阶段:监督来自比较内部、外部与重写三者实际效果后构造的动作标签,运行阶段是并行的先各自生成再集中裁决,而不是级联地只做 1 次文本修正。

为什么同时给音频和文本反而更容易错?

论文把困难称为智能体困境:模型既有自己的听觉,又收到可能错误的外部建议,但没有机制决定信谁。初学者可以沿一个样本走一遍:音频进入全模态模型得到内部转写,同时外部识别模型给出 5 个候选,模型再看两者做最终转写。如果外部候选错得很离谱,而模型又没有被训练过如何拒绝,就可能把自己本来正确的听写改错,或者放大幻觉。

内部感知 × 外部建议: 内部感知指全模态模型自己听音频后的一遍转写或回答,外部建议指独立语音识别或音频推理模型给出的假设文本,二者分工是提供两个可比较的信息源,搭配理由是单看一方无法判断谁更可信,组合意义是让模型先比较再决定跟随哪一方或重新综合。

为了让失败可度量,论文先做了两组预备对照。第一组是柱状图所示的级联智能体基线,比较单模型与加了纠错后的平均词错误率,指标越低越好。第二组是提示词消融,固定用音频加外部多候选或再加内部一遍结果,分别用强调内部、强调外部、强调音频与均衡 4 种指令做有监督微调。两组都显示朴素融合没有带来收益,这为后面引入显式动作提供了动机。

下图是预备实验的核心证据导读,重点是比较单模型与纠错后的高低关系,以及预言上限与可运行策略的距离。

看图路径: 1. 先读纵轴平均词错误率与横轴五个柱子的条件名称;2. 比较前两个单模型柱子与中间两个纠错柱子的高低关系;3. 再看最右侧绿色预言上限柱子与其他柱子的差距

原论文 Figure 2:Preliminary results on the cascaded agen- tic Qwen-omni baseline for generative error correction…

论文图 2。原论文 Figure 2:“Preliminary results on the cascaded agen- tic Qwen-omni baseline for generative error correction (GER) with supervised fine-tuning show that both text- only and text-audio GER…”。

从可见的 5 个柱子看,左侧两个单模型柱子明显低于中间两个纠错柱子,说明无论是纯文本纠错还是同时给音频与文本的纠错,在该有监督微调设置下都没有超过单模型。最右侧绿色柱子是把内部、外部与纠错三者事后取最优的预言上限,它明显更低,说明候选集合里确实有好答案。差距在于可运行的融合策略还没有学会挑出来,下一节的方法就是为了把这个挑选能力变成可学习的动作。

总览:三步走完从假设到最终答案

方法全景可以分成 3 步。第一步是一遍生成,外部参考模型和全模态模型各自独立产生回答,互不干扰。第二步是动作生成,全模态模型同时看到音频、问题、内部回答和外部回答,然后先输出一个动作令牌。第 3 步是按动作生成最终输出,直接推理对应直接采用某一方,重写对应综合全部证据生成新答案。

论文明确说明本工作聚焦直接推理与全模态重写,工具调用留作未来工作,正文附录另有一个小规模主动感知探索,不计入主方法。

生成式纠错 × 自反省智能体: 生成式纠错指对已有的转写假设做文本层面的修正,自反省智能体指先输出控制动作再输出答案的编排者,前者负责给出候选修正方向,后者负责判断何时信任自己、何时采用外部、何时重写,组合后把隐式融合变成显式可控的决策。

下图是论文给出的动态编排示意,阅读时先沿输入到输出的主路径看,再看分支在哪里汇合,这个顺序能避免把并行生成误解为级联修正。

看图路径: 1. 沿左侧音频箭头看第一步的两个并行一遍生成框;2. 再看中间全模态模型如何汇聚假设并进入动作生成;3. 最后看第三步直接推理、全模态重写与工具调用三个出口

原论文 Figure 1:Speech-Hands acts as a dynamic orchestrator that predicts a special action token to govern its…

论文图 1。原论文 Figure 1:“Speech-Hands acts as a dynamic orchestrator that predicts a special action token to govern its cogni- tive strategy for ASR and multi-domain audio reasoning.”。

图中底部标注了 3 个阶段:第一遍生成、动作生成、最终链式输出。第一步框里并排放置语音或音频模型与全模态模型,表示多源假设的聚合。第二步只有一个全模态模型框,表示裁决集中在这里。第 3 步列出直接推理、全模态重写与工具调用 3 个出口,最终指向语音识别或音频问答。这个结构统一了转写与推理,因为两类任务都可以用同一个先决策后生成的格式处理。

三个动作具体控制了什么计算?

组件的核心是 3 个动作令牌,分别记为内部、外部与重写。内部表示信任自己的一遍结果,外部表示采用外部系统的假设,重写表示两者都不可靠,需要结合音频与全部文本重新生成。推理时模型分两段解码,先解码动作令牌决定优先哪路信息,再按该动作解码最终文本或答案。

这种设计带来可解释性,因为可以统计动作的准确率、精确率、召回率与混淆情况,分析模型何时信自己、何时请教外部、何时综合重写。

动作令牌 × 全模态重写: 动作令牌是放在答案之前的特殊标记,用来声明本次采用内部、外部还是重写策略,全模态重写是当两者都不可靠时重新结合音频与全部文本生成新答案,前者分工是控制与可解释,后者分工是综合证据,搭配后模型既知道选什么也知道如何生成。

下面这张总览图把两条一遍路径与 3 路动作分支画在同一张图上,适合对照着理解控制变量出现的位置与前后信息流向。

看图路径: 1. 先看左侧音频与问题如何分别送入外部与内部两条一遍生成路径;2. 再看中间全模态智能体输出三个动作分支的位置;3. 最后看右侧最终输出如何与所选动作一一对应

原论文 Figure 3:Overview of our proposed Self-Reflection Multimodal GER framework.

论文图 3。原论文 Figure 3:“Overview of our proposed Self-Reflection Multimodal GER framework.”。

从左往右看,音频与问题同时进入两条一遍生成路径,上方参考智能体产生外部回答,下方全模态智能体产生内部回答,原始音频与问题还直连中间的动作预测模块。中间模块输出 3 个分支,分别对应外部、内部与重写,每个分支在右侧有对应的最终输出框。虚线表示外部与内部回答也可以直通最终输出,这对应直接采用的情形,实线绿色箭头表示进入动作预测与重写的路径。这个图说明动作不是事后解释,而是生成开始时就决定的控制变量。

动作标签与训练目标如何构造?

训练把决策与生成放在同一个目标字符串里学习,例如重写标记加上标准转写。模型用指令式提示被告知有 3 路输入:原始音频、外部系统的 5 个转写假设、自己的一遍转写。任务要求先判断内部是否可靠,如果可靠就输出内部标记加自己的转写,如果外部更可靠就输出外部标记并采用其假设,否则输出重写标记并结合两者与音频生成新答案。

词错误率 × 动作标签构造: 词错误率是语音识别中比较转写与标准答案差距的指标,动作标签构造是按内部、外部与重写三者谁的词错误率最低来给训练监督,前者提供客观比较尺度,后者把比较结果变成可学习的动作,组合使决策监督来自实际效果而非人工启发。

语音识别的标签构造以词错误率为指针。对每个音频样本,先让全模态模型生成内部转写,并行用外部识别模型得到外部文本,再让全模态模型结合音频与外部文本生成 1 次重写预测。然后分别计算三者与标准转写的词错误率,如果内部为零错误或最低就标为内部,如果外部最好就标为外部,如果重写最好就标为重写。这样做的安排理由是鼓励模型在自己能做对时信任自己,而不是盲目融合。

音频问答的监督是离散的对错信号。先让全模态模型基于音频与问题给出内部选项,同时从音频推理模型得到外部选项,再与正确答案比较。如果内部正确就标内部,如果内部错而外部正确就标外部,否则当两者都错时标重写。由于外部采样有随机性,论文对外部模型采样 5 次并收集预测选项,如果多数命中正确答案才标外部,否则标重写。训练时对拼接后的动作加目标序列做单一交叉熵损失,动作与后续预测共同贡献损失。

下表把论文明确给出的训练规模与优化条件放在一起,比较问题是动作标签构造需要多少推理开销,公平条件是同一套内部、外部与重写流程。

条件指标规模与轮数批量与采样学习率与解码
语音识别每集上限样本数20,000641e-4 余弦衰减
优化与精度轮数5 epochs64fp16 贪心解码
提示消融退化词错误率8.52%–9.05%同批量贪心解码
外部问答采样采样次数5 次64贪心解码
动作构造负担推理次数3 路推理64贪心解码

上表的主要收益是可复现性:每集至多 20,000 样本的限制来自对全训练集做内部、外部与重写 3 次推理的计算负担,优化条件固定为 5 轮、半精度、批量 64、初始学习率 1e-4 加余弦衰减,推理统一用贪心解码。代价是语音识别只用了受限子集,可能未用尽全部信号。提示消融中词错误率升到 8.52%–9.05% 说明换措辞不能解决融合问题,必须引入动作监督。

在哪些数据、基线与指标下比较?

语音识别用开放语音识别榜单的 7 个代表性集,覆盖会议、演讲、播客与视频风格语音、长篇朗读、政治录音与有声书干净与嘈杂条件,具体包括会议语音、演讲、播客类大规模集、金融长语音、多语政治录音英文子集、有声书干净集与困难集。基线微调与提示纠错用全部可用训练集,而本文方法除非特别注明用全量,否则每集至多 20,000 样本。吉加语音只有 9389 个有效样本满足过滤条件,这一点在附录采样表中有交代。

音频推理用多域音频问答基准,包括知识密集的生物声学问答、多声源声景问答与复杂音频问答三部分。与以往只有测试集的基准不同,该基准提供训练与开发集,使可训练的智能体框架可以被评估。生物声学约 0.7 千训练与 0.2 千开发,声景约 1.0 千训练与 0.6 千开发,复杂问答约 6.4 千训练与 1.6 千开发。外部音频问答模型用开放音频语言模型作为强基线。

基座统一用同一全模态模型,并在词表里扩展 3 个特殊动作标记,训练与推理都使用它们。指标方向要先讲清:语音识别用词错误率,越低越好。音频问答用准确率,越高越好。聚合对象是各数据集上的平均词错误率与各问答子集上的平均准确率。论文没有报告显著性检验与置信区间,也没有系统报告延迟与推理开销,复现时应把平均值当作报告值,不自行推断每组都显著。

主结果:可运行策略是否超过了单模型?

比较问题是:在相同音频与外部假设条件下,显式动作的可运行策略能否同时超过单模型与朴素级联纠错。公平条件是同一基座、同一外部系统、同一评测集,指标方向是语音识别词错误率越低越好。下表先看预备实验的数值关系,它说明为什么需要动作,而不是直接看最终大表。

条件指标单一识别基线单一全模态基线朴素纠错与预言上限
级联预备平均词错误率7.177.338.07 与 8.44
预言上限词错误率5.005% WER事后最优
提示微调词错误率高于基线高于基线8.52%–9.05%
动作要超越平均词错误率7.177.338.44 左右
问答见下表平均准确率另见问答表另见问答表另见问答表

上表的主要收益是反证逻辑:两个单模型分别在 7.17 与 7.33 左右,而纯文本与音频加文本的朴素纠错升到 8.07 与 8.44,提示消融也在 8.52%–9.05% 区间,说明不加裁决的融合不可靠。预言上限在 5.00 与 5% 词错误率左右,说明候选里有好答案,差距在于选择能力。代价是预言上限是事后取最优,不能当作可部署收益,比较时必须保留可运行的单模型与朴素纠错作为基线。

音频问答的主结果需要另一张表来回答:测什么、与谁比、条件是否一致。下表聚焦论文用连续正文明确报告的准确率,指标越高越好,比较对象是直接微调与级联纠错。

条件指标直接微调基线本方法并行智能体本方法加多数采样
生物声学准确率78.13%81.25%81.25%
稳健性准确率声景失败稳健最高

上表显示最终设置在平均准确率 77.37% 上超过所有基线与预训练模型,复杂问答 85.70% 与生物声学 81.25% 是两个亮点,说明既能处理抽象推理也能处理细粒度音频模式。未胜出项是标准有监督微调,它在生物声学 78.13% 尚可,但在声景 34.65% 明显失败。这支持了智能体框架在多样音频推理设置下的稳健性,但总体趋势不等于每组每步都成立,声景的绝对值仍低于复杂问答。

动作真的学会了吗,哪一类最难?

要回答动作是否学会,论文在语音识别下分析了 3 个动作在训练分布与测试精确率、召回率与调和平均上的表现。分布高度偏向内部,在干净有声书与长语音等集上内部超过 95%,外部在有声书上低于 1%,重写到处都极少,常低于 2%。尽管类别不平衡,内部在多数集上调和平均超过 0.8,外部即使监督稀少也有较高分数。

重写最难,多数集低于 0.4,有声书上为零,因为正例极少。细看精确率持续高于召回率,说明模型触发重写时一般是对的,只是不敢多触发,覆盖率可用针对性增强来补。

多数采样 × 重写判定: 多数采样指对外部音频问答模型采样 5 次后看多数是否命中正确答案,重写判定指当内部与外部都错时标记为需要重写,前者分工是降低外部随机性带来的标签抖动,后者分工是触发重新推理,搭配后外部与重写的边界更稳定。

音频问答的混淆分析在多数采样设置下进行,论文配了 3 个子集的混淆矩阵,横轴是预测动作,纵轴是标准动作。可见内部与外部之间的混淆相对较低,说明模型能有效区分信自己还是信外部。重写行是难点,容易被判成内部或外部,这与重写监督稀少一致。教学例子可以帮助理解:当内部与外部给出相同但错误的选项时,重写需要有信心拒绝两个假设,这正是论文强调的挑战情形。

推理时的小例子也值得复述。语音识别例子中内部、外部与重写各给一个相近转写,最终动作选了内部并输出正确结果。音频问答例子中内部与外部都选雷暴,而动作选了重写并答对森林火灾。这类例子说明重写不仅处理冲突,也处理一致但错误的情况,但不能把单个例子推广为整体准确率。

哪些边界没有测,代价在哪里?

论文明确列出 3 类局限。第一是动作不平衡与重写稀疏,某些音频问答集很少需要重写,上下文信息稀疏既是数据现象也是建模挑战,未来可用更合理的平衡或自适应决策边界来改善。第二是语音识别只用了受限子集,虽然已超过强基线,但可能未用尽信号,扩大数据或合成音频变体可能继续提升。

第三是没有研究迁移与多外部设置,例如用一个外部识别模型训练而用另一个测试,也没有同时接多个外部模型,扩展到多外部与各自决策标记可能提升稳健性。附录还有一个主动感知小实验,扩展动作到降噪与工作室语音修复两类信号处理工具,在会议与声景等噪声敏感任务上报告了改进。但论文把它定为额外小实验,不是主方法的组成部分,复现主结果时不应把它计入默认流程。

资源状态方面,本次收到的证据未绑定完成超文本传输协议状态验证的资源,因此不能声称代码、模型或数据当前已公开或可用,需要补验证才能谈可运行下载。这个边界提醒读者区分论文报告的实验可复现性与实际可下载性。

复现先做什么,需要保留什么条件?

复现应先做三件事。第一是按论文构造 3 路推理:用全模态模型生成内部一遍结果,用外部模型生成外部假设,再用全模态模型结合音频与外部文本生成重写预测,三者缺一不可,否则动作标签无从比较。第二是按任务构造标签:语音识别比较三者与标准答案的词错误率,音频问答比较选项对错并对外部做 5 次多数采样,再把决策标记与标准答案拼接成统一目标字符串。

第三是固定优化与解码:扩展 3 个特殊标记,训练 5 轮、半精度、批量 64、初始学习率 1e-4 加余弦衰减,推理统一用贪心解码,并做两段式先动作后答案的解码。需要保留的关键超参数与信息条件包括每集至多 20,000 样本的采样上限、外部用 5 个转写假设、音频问答外部采样 5 次、贪心解码。

何时值得尝试:如果手头同时有较好的外部识别系统与能听音频的全模态模型,且朴素融合出现改错现象,这套先裁决后生成的方法值得试。还需补的验证是重写类的覆盖率、跨外部系统的迁移、多外部同时接入,以及延迟与计算开销的测量,因为原文未系统报告这些量,不能承诺它们得到改善。

一句话收束:何时信自己,何时重写?

把全文连起来,学习依赖是先看到朴素融合的失败,再看到显式动作的构造,最后看到动作准确率与主结果的对应。模型在自己能做对时被鼓励信任自己,在外部更好时转交外部,在两者都错时重写。证据支持内部与外部动作在不平衡下仍有较高分数,重写精确率高但召回低。

最终的可运行策略在语音识别平均词错误率与音频问答平均准确率上都超过了单模型与朴素级联纠错,但重写稀疏、受限训练子集与未测的迁移边界仍是待验证部分。记住这个顺序,就能不靠修辞复述方法:输入 3 路证据,先输出动作,再按动作输出答案。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总