论文解读

单个都会、合在一起就不会:ART 要求模型同时听懂语音与声音再推理

论文针对多模态大模型只被单项音频能力考核的问题,构造 9 类 9000 条音频内嵌提问的推理基准,用是否问答与描述问答两种协议测得人类约 92.9% 而开源模型多在 50% 附近,代价是全合成语音与模板化问题限制了声学多样性。

 · 更新于 2026-09-24 · 约 16 分钟 · 7824 字 阅读 →
论文解读

宣称支持不等于可用:AfriVox 测出非洲语言与口音下的转写崩塌与翻译分化

AfriVox 用 20 种非洲语言与 100 多种非洲英语口音同时考转写与到英语翻译,对比单模态识别翻译模型与多模态语音大模型,发现转写仍是单模态更准而翻译是多模态占优,且用约每语言 280 小时微调 Qwen2.5-Omni 可大幅降低三门尼日利亚语言的错误率,但代价是噪声与自发口语下全系模型仍明显退化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

背景噪声也能操纵语音大模型:从数字优化到空中播放的定向与非定向攻击

论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
论文解读

AudioJudge:拼接与拆分提示如何让大音频模型做语音评测

该文研究用大音频模型直接做成对语音评测是否可行,发现基础提示在副语言细粒度判断上接近随机猜测,而测试音频拼接加 4 样本上下文与多方面集成可在系统排名上达到 0.91 左右的人类偏好相关,但冗长与位置偏置仍需处理。

 · 更新于 2026-09-24 · 约 17 分钟 · 8027 字 阅读 →
论文解读

把混叠的音频表示拆开:AudioSAE 用稀疏自编码器解剖 Whisper 与 HuBERT

该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。

 · 更新于 2026-09-24 · 约 21 分钟 · 10239 字 阅读 →
论文解读

语音把选择题变难了吗:语言、口音、性别与选项顺序如何动摇语音问答

该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10946 字 阅读 →
论文解读

既要指认合成语音来自哪台生成器,又要识破没见过的新生成器

论文用冻结语音基础模型做表示、图神经网络做已知生成器归因、近邻分支做未知检测并以置信度阈值分流,在 DiffSSD 上 Mamba-B 的联合配置取得 DEV 准确率 98.11% 与等错误率 2.33%,代价是仍依赖固定阈值且不对多个未知源做细粒度区分。

 · 更新于 2026-09-24 · 约 19 分钟 · 9354 字 阅读 →
论文解读

按频带分开压缩:BSCodec 用独立编解码应对语音音乐音效的谱差异

针对语音能量集中而音乐音效需全频保真的问题,BSCodec 把频谱切成独立频带并行编码量化解码,在相同混合训练下以 2.55 kbps 和 3.83 kbps 对标 DAC 的 4.5 kbps 和 6 kbps,代价是编码器解码器数量随频带数增加且语音对切分粒度敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8964 字 阅读 →
论文解读

把只有发音的埃及儿童对话变成可计算的带符正字法:ARABABYTALK-EGY 如何标注与设基准

该文把埃及阿拉伯语 CHILDES 的国际音标转写为全带符 CODA 正字法并加上引理与核心词性,得到约 2.6 万词例的语料,并在形态消歧与语音识别上给出基线,代价是语料规模小且 GPT-4o 初转写准确率低、需大量人工校对。

 · 更新于 2026-09-24 · 约 17 分钟 · 8252 字 阅读 →
论文解读

真实多人对话考验语音自监督表示:CSPB 用单通道与多通道同测内容与说话人

CSPB 针对噪声混响与重叠语音的真实多人对话,用冻结上游加轻量下游的统一协议在四套数据上考识别日志与增强分离,报告显示多样数据加增强预训练的模型更稳健而波束形成与原生多通道带来一致增益,代价是原生多通道预训练数据远少且基准仍以编码器结构为主。

 · 更新于 2026-09-24 · 约 18 分钟 · 8710 字 阅读 →
论文解读

把多模态 token 推迟送入:在中间层汇合为何能省算力

论文针对多模态 token 与文本从第 0 层共同走完全部语言模型层造成的算力负担,提出仅让文本走完全程而把多模态 token 直接送入中间层的 DeepInsert,并在视觉、音频、分子模态中显示第 4 层插入可持平基线,而更深插入可用可接受回落换取推理加速。

 · 更新于 2026-09-24 · 约 19 分钟 · 9123 字 阅读 →
论文解读

从快速重复音节到可解释的重度判断:CLINIC-GENIE 如何把分类、归因和病历类比装进一条管线

针对卒中后构音障碍的交替与顺序轮替发音任务,CLINIC 用临床可解释声学特征联合频谱与自监督语音表示做三级严重度分类并用 Shapley 值归因,GENIE 再用检索到的相似病例生成韩文四维度解释,报告显示平衡准确率 0.952 且重度召回 1.000,专家保真度 4.94,但重度样本少且仅覆盖任务化语音。

 · 更新于 2026-09-24 · 约 22 分钟 · 10523 字 阅读 →
论文解读

把共有的病和各自的信号分开:DIVINE 的多模态解耦评估

针对口面部神经疾病的音视频联合诊断与严重度估计问题,DIVINE 用分层变分瓶颈分离共享与私有表征并做稀疏门控融合,在 Toronto NeuroFace 上以 DeepSeek-VL2 加 TRILLsson 达到双模态高精度,但缺模态与跨库泛化仍受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9146 字 阅读 →
论文解读

只转写不倾听:用四种词义声学关系测音频大模型的情绪依据

论文用词义中性、对齐、冲突和无词四种条件对照文本、音频和图文三种输入,测六个大音频语言模型,发现中性词下音频分仅三成左右、冲突时塌缩到少数类别、非言语接近猜测,说明模型主要依赖词义而非声学线索。

 · 更新于 2026-09-24 · 约 18 分钟 · 8786 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

多人对话先找对说话人,再把文本的情绪理解教给声音和画面

该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。

 · 更新于 2026-09-24 · 约 17 分钟 · 8365 字 阅读 →
论文解读

低资源 TTS 要换声不要换口音:多语言训练跨语言迁移为何更稳

该文在 nêhiyawêwin 与 SENĆOTEN 上比较推理时改风格嵌入、现成 SeedVC 与英数据多语言训练三路线,报告带语言嵌入的多语言训练匿名化最稳,而无语言嵌入与 SeedVC 分别付出英语口音与质量下降代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7665 字 阅读 →
论文解读

只拉伸音频位置、不动文本位置:部分 YaRN 与虚拟长音频训练的长音频泛化

针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →
论文解读

前缀里藏着计划:用早期打分引导自回归音频走对语义

针对自回归文本到音频在复杂事件上指令跟随下降的问题,论文用前缀隐式计划探测加 Plan-Critic 早期剪枝做引导解码,在相同 token 预算下把 AudioCaps 总体 CLAP 从 26.67 提升到 36.47,代价是需要额外训练一个轻量打分器并依赖 CLAP 作为代理目标。

 · 更新于 2026-09-24 · 约 16 分钟 · 7909 字 阅读 →
论文解读

不用听原声也能评声音:先分维标注再用文字蓝图推理的语音评价

针对语音到语音评价只看文字会漏掉语气、直接听音频又贵又不透明的问题,论文用先分内容音质副语言三维标注再把廉价声学信号写成文字蓝图交给大语言模型推理并按确定性规则融合的方法,在两个公开偏好集上提高了与人的一致性并把音频评测成本降到约三分之一。

 · 更新于 2026-09-24 · 约 19 分钟 · 9444 字 阅读 →