论文解读

背景噪声也能操纵语音大模型:从数字优化到空中播放的定向与非定向攻击

论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
论文解读

何时想、如何想:用四路奖励教音频大模型做难度自适应的推理

针对音频问答中显式推理不稳定、提示词无法自适应开关思考的问题,Audio-Thinker 用自适应思考准确率奖励加一致性和思考质量奖励在 GRPO 下训练,只用约 4 万条后训练样本就在 MMAU、MMAR 和 AIR 上超过同基座的显式推理基线,代价是依赖外部 Qwen3-8B 做推理裁判并增加强化学习采样开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →
论文解读

AudioJudge:拼接与拆分提示如何让大音频模型做语音评测

该文研究用大音频模型直接做成对语音评测是否可行,发现基础提示在副语言细粒度判断上接近随机猜测,而测试音频拼接加 4 样本上下文与多方面集成可在系统排名上达到 0.91 左右的人类偏好相关,但冗长与位置偏置仍需处理。

 · 更新于 2026-09-24 · 约 17 分钟 · 8027 字 阅读 →
论文解读

答对不等于听懂:用六维过程分拆开音频推理的感知与推进

针对大音频语言模型只看准确率会把猜对误判为真推理的问题,论文提出免人工标注金链的六指标 ARIA-Rubrics 做过程评估,在 9 个模型与 2 个基准上显示准确率与过程质量系统性偏离,而完整 ARIA 与人评 Spearman 达 0.671,代价是仍需冻结的轻量打分模型与外部对齐模型。

 · 更新于 2026-09-24 · 约 20 分钟 · 9627 字 阅读 →
论文解读

不用自回归也能听懂语音:DIFFA 以冻结扩散模型加双适配器做理解

DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。

 · 更新于 2026-09-24 · 约 19 分钟 · 9250 字 阅读 →
论文解读

只转写不倾听:用四种词义声学关系测音频大模型的情绪依据

论文用词义中性、对齐、冲突和无词四种条件对照文本、音频和图文三种输入,测六个大音频语言模型,发现中性词下音频分仅三成左右、冲突时塌缩到少数类别、非言语接近猜测,说明模型主要依赖词义而非声学线索。

 · 更新于 2026-09-24 · 约 18 分钟 · 8786 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

只拉伸音频位置、不动文本位置:部分 YaRN 与虚拟长音频训练的长音频泛化

针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →
论文解读

藏在声音特征里的后门:语速与情感为何能绕过音频大模型对齐

论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。

 · 更新于 2026-09-24 · 约 16 分钟 · 7640 字 阅读 →
论文解读

按语系共享连接器:多语言语音大模型何时该合练、何时该单练

该文研究冻结语音编码器加冻结大语言模型、只训练轻量连接器的多语言识别中按单语言还是按语系组织训练数据的问题,在近四十种语言上报告家族级连接器多数更低更稳但在内部差异大的语系会失效,并以通用连接器对照说明增益来自亲缘性而非单纯数据量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8590 字 阅读 →
论文解读

讲法本身就是攻击面:叙事语音如何绕过音频大模型的文本对齐

论文把同一恶意叙事分别用文本、中性语音和五种心理风格语音送入端到端音频大模型,用三数据集攻击成功率证明讲法改变服从性,在 Gemini 上达到 98.26% 而代价是小模型解码不稳定与手工风格难优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8681 字 阅读 →
论文解读

先剪掉噪声再识别:语音感知的长上下文剪枝与融合

针对会议幻灯 OCR 等长而 noisy 的上下文导致识别偏置词困难的问题,论文用两阶段剪枝加语音驱动池化先筛关键词再做识别,在 SlideSpeech 上报告 WER 7.71% 并在 LibriSpeech 上报告 WER 1.12%,代价是两阶段流水线与池化压缩带来的实现复杂度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10216 字 阅读 →
论文解读

换一种说法、换一种声音,对齐就松动:StyleBreak 的风格化音频越狱

论文针对大音频语言模型的黑盒音频越狱问题,用两阶段语言与声学风格变换加查询自适应策略搜索 70 种风格组合,在 4 个开源模型和 2 个商用模型上验证了情感、年龄、性别扰动能提升越狱成功率,代价是需要可控 TTS 与多次查询评估。

 · 更新于 2026-09-24 · 约 20 分钟 · 9712 字 阅读 →
论文解读

归纳一次反复复用:从三段音频中提炼可迁移的听答步骤

针对音频问答中少样本演示不稳定且每次推理都要重复传入演示音频的问题,论文提出每个任务只归纳一次纯文字指令的 Audio-Induct,并在 9 个大音频语言模型与两个基准上验证其准确率与推理开销,代价是小模型自行归纳仍不稳定且对策略思维链仅边缘显著。

 · 更新于 2026-09-24 · 约 17 分钟 · 8402 字 阅读 →
论文解读

发音纠错不能只给分数:让音频语言模型说出错在哪、怎么练

论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。

 · 更新于 2026-09-24 · 约 18 分钟 · 8778 字 阅读 →
论文解读

眼睛看到不等于耳朵听到:用音频专属参考把多模态推理拉回声音证据

针对视觉存在但音频缺失的不对称输入,论文用 AV-ConfuseBench 暴露视觉主导误判,并用 RL-CoMM 的两阶段强化协作把 Qwen2.5-Omni-3B 的问答与幻觉指标提升 10 到 30 个百分点,代价是只在有限样本上做在线策略优化并依赖外部音频推理与嵌入裁判。

 · 更新于 2026-09-24 · 约 19 分钟 · 9458 字 阅读 →
论文解读

口吃与成人插话并存时,音频语言模型为何流畅却不忠实

论文在 22 名口吃儿童的 44 段朗读与访谈音频上用儿童专属摘要与三类蕴含判断对比端到端音频语言模型与 Whisper 与 Granite 转录后接文本大模型的级联基线,发现端到端能生成流畅且纯净的摘要但忠实度偏低且蕴含判断普遍偏向肯定类,口吃密度升高与成人干扰会进一步拉低保真度与矛盾类准确率。

 · 更新于 2026-09-24 · 约 24 分钟 · 11807 字 阅读 →
论文解读

音频幻觉为何总说“有”:用静默对照与首步门控校正肯定偏差的 TAD

针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9866 字 阅读 →
论文解读

声音去哪了:末层仍可线性读出却在选项字母上失准的读出瓶颈

论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11701 字 阅读 →
论文解读

猜对不算懂:用选项重排伪集成让音乐问答模型学会拒答

针对音乐音频语言模型在四选一问答中被迫作答而无法表达不知道的问题,论文用同一 TinyMU 检查点经答案不变扰动构造伪集成,主证据是四种选项排序平均将准确率从 55.7% 提升到 59.2% 并将误差保留曲线面积从 0.293 降到 0.261,代价是每次提问需要 4 次前向传播且无需重新训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8287 字 阅读 →