论文解读

解码器不敢再自由发挥:用不确定性路由的稀疏编辑把语音识别拉回声学证据

针对注意力编码器解码器语音基座模型在无语音与弱证据下产生无声学支撑文本的问题,AURA 冻结原模型并只编辑解码器交叉注意力的少量头输出,用交叉注意力不确定性做逐词门控,在非语音上把幻觉率从 89.18% 降到 1.94%,代价是训练轮数增加后干净语音词错误率上升的权衡。

 · 更新于 2026-09-24 · 约 19 分钟 · 9337 字 阅读 →
论文解读

数据不够时别先加模型:无人机声音分类里方法缩放胜过模型缩放

在 3100 段 31 类无人机音频上,论文系统比较卷积与 Transformer 架构加全量微调与四种参数高效微调,最强证据是 EfficientNet-B7 批归一化微调加三倍增强取得最高验证精度且只训练极小比例参数,而轻量卷积在精度与训练效率上普遍优于 Transformer。

 · 更新于 2026-09-24 · 约 22 分钟 · 10986 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

在说话人不见面的严苛划分下,用冻结语音表示加轻量解码器做构音障碍分级

针对 HeyJay!数据集的三级构音障碍严重程度分类问题,论文用冻结的 wav2vec 2.0 Large XLSR-53 做特征提取加约 67000 参数的可训练解码器,在说话人独立五折交叉验证下取得话语级准确率 64.6%、说话人级准确率 80.2%,代价是中度与重度边界仍存在与专家分歧同构的混淆。

 · 更新于 2026-09-24 · 约 21 分钟 · 10082 字 阅读 →
论文解读

冻住大模型只调说话人旋钮:FiLM 条件化做病理语音识别

针对构音障碍等病理语音与常态语音声学失配问题,该研究在冻结 Voxtral-Mini 全部权重下用 x-vector 驱动的逐层 FiLM 做说话人条件化,在 TORGO 和 NeuroVoz 上以约 1.6% 可训练参数获得接近微调的识别与问答保持能力,但原始识别输出更依赖后处理纠错。

 · 更新于 2026-09-24 · 约 18 分钟 · 8992 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

不用指令做音频任务:用注意力头掩码锁定大音频语言模型的功能通路

针对大音频语言模型对同义指令敏感而不稳定的问题,论文用只训练注意力头开关的声学注意力头掩码替代文本指令,在 7 个单任务和 ASR 与性别识别组合任务上达到与指令相当或更好的表现,代价是每个任务需单独训练一张掩码且掩码不可跨模型复用。

 · 更新于 2026-09-24 · 约 16 分钟 · 7930 字 阅读 →
论文解读

热启动之后再听一次:用隐状态夹角找出语义词并只在那里纠错

论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7795 字 阅读 →
论文解读

十六种方言同一套音频:辨别与转写为何难同步提升

该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。

 · 更新于 2026-09-24 · 约 20 分钟 · 9576 字 阅读 →
论文解读

真假混在一起时:让大模型先分轨再判真伪的 ToolDF

针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。

 · 更新于 2026-09-24 · 约 15 分钟 · 7181 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10921 字 阅读 →
论文解读

一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调

语音识别 | 5.9/10

 · 更新于 2026-09-24 · 约 22 分钟 · 11018 字 阅读 →
论文解读

念对了也白搭:尼泊尔金融语音里被格式卡住的钱包

语音识别 | 6.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8167 字 阅读 →
论文解读

剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本

音视频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9837 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →
论文解读

把混音师的耳朵写成奖励:SPHERE 如何让 3B 音频语言模型学会摆位

音乐生成 | 6.9/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12674 字 阅读 →
论文解读

别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11536 字 阅读 →
论文解读

听见了,就要指得出来:用可验证的时间证据检验音乐大模型的耳朵

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9860 字 阅读 →