论文解读

答对不等于听懂:用六维过程分拆开音频推理的感知与推进

针对大音频语言模型只看准确率会把猜对误判为真推理的问题,论文提出免人工标注金链的六指标 ARIA-Rubrics 做过程评估,在 9 个模型与 2 个基准上显示准确率与过程质量系统性偏离,而完整 ARIA 与人评 Spearman 达 0.671,代价是仍需冻结的轻量打分模型与外部对齐模型。

 · 更新于 2026-09-24 · 约 20 分钟 · 9627 字 阅读 →
论文解读

语音把选择题变难了吗:语言、口音、性别与选项顺序如何动摇语音问答

该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10946 字 阅读 →
论文解读

同一事实换语言换模态就变答案:CCFQA 如何卡住多语言语音问答的一致性

论文针对多语言语音事实问答中跨语言与跨模态答案不一致问题,构建 8 语言平行语音文本基准 CCFQA 并用英语为桥的 5 样本迁移训练 LLM-SQA,最强证据是以极少目标语言样本达到与 GPT-4o-mini-Audio 可比的跨语言语音问答表现,代价是仍以英语为中心且仅覆盖语音与文本两种模态。

 · 更新于 2026-09-24 · 约 19 分钟 · 9136 字 阅读 →
论文解读

模型能听出尖与圆吗:用拟声词与伪词检验多模态大模型的语音象征

该研究用 10982 词、84932 条语义维度标注检验多模态大模型能否从发音形式推断意义,发现模型在多数维度上超过 0.50 基线并在深层更关注标志性音素,但与人类的维度分布仍有明显差距。

 · 更新于 2026-09-24 · 约 16 分钟 · 7936 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

只拉伸音频位置、不动文本位置:部分 YaRN 与虚拟长音频训练的长音频泛化

针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →
论文解读

藏在声音特征里的后门:语速与情感为何能绕过音频大模型对齐

论文提出以语速、情感、噪声、口音、音量等声学特征为触发器的后门攻击框架 HIN 与 AudioSafe 评测,在 5% 投毒下语速与情感触发达到 100% 攻击成功率而音量触发不足 6.2%,且训练损失几乎不波动,代价是防御仍需在安全性与可用性之间权衡。

 · 更新于 2026-09-24 · 约 16 分钟 · 7640 字 阅读 →
论文解读

野外长音频与多音频并存时,模型为何听得到却答不对

MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。

 · 更新于 2026-09-24 · 约 21 分钟 · 10274 字 阅读 →
论文解读

为俄语补上多模态标尺:MERA Multi 如何把 18 个任务拧成一套可复现评测

针对俄语尚无多模态基准的问题,论文用统一技能分类、块式提示、双指标评分与防泄漏机制构建 18 任务基准,最强证据是全覆盖全模态模型的 Total Score 达到 0.5 且提示 формулировка显著改变分数,代价是专家题人类基线仍低且音频视频能力明显弱于图像。

 · 更新于 2026-09-24 · 约 18 分钟 · 8752 字 阅读 →
论文解读

讲法本身就是攻击面:叙事语音如何绕过音频大模型的文本对齐

论文把同一恶意叙事分别用文本、中性语音和五种心理风格语音送入端到端音频大模型,用三数据集攻击成功率证明讲法改变服从性,在 Gemini 上达到 98.26% 而代价是小模型解码不稳定与手工风格难优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8681 字 阅读 →
论文解读

科学语音助手为何听懂却答不严:识别感知推理发音四段断链诊断

S3-Bench 用 1980 条科学语音问答与 213 段多轮对话把一次问答拆为识别感知推理发音四段测量,发现前三段正向耦合而生成与上游负耦合,严格事实性与听众适配仍是主要代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7925 字 阅读 →
论文解读

换一种说法、换一种声音,对齐就松动:StyleBreak 的风格化音频越狱

论文针对大音频语言模型的黑盒音频越狱问题,用两阶段语言与声学风格变换加查询自适应策略搜索 70 种风格组合,在 4 个开源模型和 2 个商用模型上验证了情感、年龄、性别扰动能提升越狱成功率,代价是需要可控 TTS 与多次查询评估。

 · 更新于 2026-09-24 · 约 20 分钟 · 9712 字 阅读 →
论文解读

归纳一次反复复用:从三段音频中提炼可迁移的听答步骤

针对音频问答中少样本演示不稳定且每次推理都要重复传入演示音频的问题,论文提出每个任务只归纳一次纯文字指令的 Audio-Induct,并在 9 个大音频语言模型与两个基准上验证其准确率与推理开销,代价是小模型自行归纳仍不稳定且对策略思维链仅边缘显著。

 · 更新于 2026-09-24 · 约 17 分钟 · 8402 字 阅读 →
论文解读

音频幻觉为何总说“有”:用静默对照与首步门控校正肯定偏差的 TAD

针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9866 字 阅读 →
论文解读

猜对不算懂:用选项重排伪集成让音乐问答模型学会拒答

针对音乐音频语言模型在四选一问答中被迫作答而无法表达不知道的问题,论文用同一 TinyMU 检查点经答案不变扰动构造伪集成,主证据是四种选项排序平均将准确率从 55.7% 提升到 59.2% 并将误差保留曲线面积从 0.293 降到 0.261,代价是每次提问需要 4 次前向传播且无需重新训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8287 字 阅读 →
论文解读

从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径

在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11722 字 阅读 →
论文解读

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

音频检索 | 7.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5356 字 阅读 →
论文解读

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

音频问答 | 7.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4940 字 阅读 →
论文解读

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering

音频问答 | 6.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 5003 字 阅读 →
论文解读

EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

音频问答 | 6.1/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10753 字 阅读 →