论文解读
不是每句被听清的话都是叫你:用事后反馈纠正误唤醒
针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。
针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。
论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
语音唤醒 | 6.9/10
语音交互 | 3.8/10
语音唤醒 | 5.9/10
语音唤醒 | 7.1/10
语音唤醒 | 6/10