在一直开着的麦克风下藏攻击:在编码瓶颈处对齐掩蔽的平滑防御
针对全双工语音对话持续暴露声学通道的问题,论文用掩蔽阈值约束的不可闻扰动形式化劫持、静默与越狱三类攻击,并以码本几何与掩蔽匹配的潜变量平滑加一致性训练把劫持从 91.7% 降到 8.3%,代价是 UTMOS 相对下降 2.3% 且认证半径只到 0.616 的保底水平。
针对全双工语音对话持续暴露声学通道的问题,论文用掩蔽阈值约束的不可闻扰动形式化劫持、静默与越狱三类攻击,并以码本几何与掩蔽匹配的潜变量平滑加一致性训练把劫持从 91.7% 降到 8.3%,代价是 UTMOS 相对下降 2.3% 且认证半径只到 0.616 的保底水平。
该工作把实时语音交互拆为思考、行动与说话协调三层,用文本教师蒸馏加可执行环境强化学习提升多轮约束跟踪与工具执行,在半双工语音版 τ-Voice 上总成功率从 78.4% 升至 82.0%,代价是部分流畅性与延迟指标并未同步最优且长时程口语任务仍未验证。
针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。
共分析 62 篇语音/AI 论文
针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。
共分析 29 篇语音/AI 论文
Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。
共分析 26 篇语音/AI 论文
针对全双工语音模型工具调用弱的问题,论文用前端判何时委派、后端做多轮工具调用再预填回前端复述的办法,在单轮调用召回 92%-97% 与多域语音代理任务上取得可比效果,代价是打断率偏高与合成数据带来的识别与暂停处理退化。
该研究用同一话题下只换触发句并压缩停顿的配对独白,检验五个模型家族何时抢话,结果显示被直接提问和静音可靠地触发开口,而错误事实与危险行为几乎不触发,且把话轮交出去后纠错与警告比例仍很低。
针对全双工语音到语音模型缺用户侧流式转写的问题,论文在复用同一解码器大模型主干上并行增加轻量 ASR 头并用帧级强制对齐训练,在双工框架内报告平均 WER 为 10.21%,独立识别配置报告为 7.73%,代价是平滑轮转延迟上升与部分打断指标未占优。
Realtime-Venus 用两个 9B 前端分别处理音视频与纯音频全双工对话,用双环运行时把即时说话与后台推理工具执行解耦,最强证据是 Omni 在六项视频基准领先与 Audio 在 MMAU 等四项音频问答领先,代价是打断响应与参数准确率仍落后及委派判断存在漏委派与过度委派的权衡。
StepAudio 3 Realtime 针对实时语音交互中深度推理与低延迟的矛盾,用听-说-想-做循环组织感知、双工话轮管理、边说边想与异步工具调用,在 MMSU 90.6、全双工 98.9 等报告结果上保持领先,但多轮约束保持与零售工具任务仍有明显短板。
共分析 19 篇语音/AI 论文
该研究把听者重叠贡献分为回馈、协作与打断,把说话人行为分为不变继续、回合内适应与让出,用 300 个人工确认线索对比录音人与 PersonaPlex 的配对延续,最强证据是 66 个协作对中录音人 68.2% 适应而模型仅 34.8%,代价是其余行为分流为不变继续与让出且评估依赖转录打分与受限复现条件。
DuplexDrama 针对全双工对话训练数据稀缺问题,用四阶段管线同时合成人设场景、三种全双工行为、表情语音与剧本对齐的声音事件,最强证据是相同语音加背景仅带来 UTMOSv2 与 NISQA 的可控下降,主要代价是全双工轮次占比仅 3.8% 且剧本合理性依赖 LLM 判断。
SteerDuplex 针对全双工语音模型可操控性不足,用 Moshi 骨干加针对性监督微调建立语气人设语速操控,再用两阶段连续性感知的混合奖励强化学习改善打断响应与暂停等待,代价是仍存在过早让出话轮与奖励钻空子的权衡。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。
F-Actor 用冻结音频编码器加只微调语言模型的单阶段方案,在约 2000 小时数据上实现对音色、话题、打断与应答和起话方的指令跟随,最佳配置以词级文本对齐加 2 步音频延迟取得低困惑度和高起话准确率,但打断等稀有行为仍只能给出方向性控制且语音自然度未达真值。