论文解读

不是每句被听清的话都是叫你:用事后反馈纠正误唤醒

针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

背景噪声也能操纵语音大模型:从数字优化到空中播放的定向与非定向攻击

论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

A Multiplication-Free Feature Extractor for Signal Classification: Keyword Spotting Case Study

语音唤醒 | 6.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7078 字 阅读 →
论文解读

Homebot: A Personal AI Agent for Conversational Home Assistance and Automation

语音交互 | 3.8/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4457 字 阅读 →
论文解读

Cumsum-Composable Phase Transport for Low-Cost Streaming Keyword Spotting

语音唤醒 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6381 字 阅读 →
论文解读

Scalable Keyword Spotting via Modular Network Expansion

语音唤醒 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7687 字 阅读 →
论文解读

Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack

语音唤醒 | 6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6409 字 阅读 →