论文解读

联邦多语语音大模型:编码器与解码器谁更怕客户端漂移

该研究在 316 个按说话人划分的多语联邦客户端上比较四种语音大模型与 FedAvg 和 FedProx,最强证据是 Whisper 加 EuroLLM 在解冻编码器并调低其学习率时取得 0.1170 词错率,而 FedProx 只在该多语解码器上有效,代价是联邦仍远差于集中训练且对编码器预训练类型高度敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9442 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

词错率好看却漏掉关键信息:口音对话中实体与填充词如何被找回

针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。

 · 更新于 2026-09-24 · 约 19 分钟 · 9498 字 阅读 →
论文解读

先分清谁在说话、再转写说什么:Transsion 级联式多语说话人归属转写系统解读

针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8539 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

离线也要又快又准:Jarvis 用本地微调小模型做赛车语音指令分类

针对赛车高层行为指令的离线语音控制问题,Jarvis 用唤醒词加本地转写加微调 Mistral 7B 做文本到指令分类,在 17 类 1645 样本条件下报告 97.63% 准确率与 1.39 s 平均延迟,但数据集仍部分合成且指令空间严格预定义。

 · 更新于 2026-09-24 · 约 18 分钟 · 8797 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-21

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25432 字 阅读 →
论文解读

冻住检测器再多算一遍:CoReLoop 如何把循环输入做对

针对未见攻击泛化难且不扩充数据、不改动原参数的问题,CoReLoop 用 LoopBridge 构造循环输入、循环 LoRA 加门控更新与 ExitBridge 对齐分类器,在 14 个跨域测试集上 24 层模型以约 10M 可训练参数把池化等错误率从 4.85% 降到 3.74%,自适应停止以平均 1.18 次通过达到 3.73%,代价是第二次通过仍需完整 …

 · 更新于 2026-09-24 · 约 9 分钟 · 4181 字 阅读 →
论文解读

矛盾本身就是信号:用差异建模识别犹豫与矛盾

针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

生成式读标签为何不稳:用同一隐状态对比判别式读法

针对语音大模型用自回归解码做四分类情绪识别会产生无效标签并偏向多数类的问题,论文在冻结主干上对比同一最终提示词隐状态的生成式解码与单层线性分类头读出,最强证据是加入对话上下文后宏平均 F1 达到 78.14 且在 ASR 转写下从 74.47 提升到 76.50,代价是只验证了 IEMOCAP 四类设置且可解释关联暴露了预训练的文化偏置。

 · 更新于 2026-09-24 · 约 21 分钟 · 10279 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
论文解读

把谁说了什么写对:用真实失败做偏好优化的端到端角色转写

针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。

 · 更新于 2026-09-24 · 约 19 分钟 · 9324 字 阅读 →
论文解读

先唤醒编码器再整体微调:用轻量适配器补上语音大模型的声学短板

针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。

 · 更新于 2026-09-24 · 约 20 分钟 · 9557 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

图注意力加什么都有用吗:LoRA 微调下语音防伪造后端的受控拆解

该研究把 AASIST2 图注意力层拆成打分对称性、温度可学习性与路由粒度三条残差分支,在统一 LoRA 条件下用五个评测集和五个随机种子检验,发现 LearnT 平均统一等错误率最优而 GATv2 与 LearnT 联用反而明显退化,说明分支之间是非可加的相互作用。

 · 更新于 2026-09-24 · 约 23 分钟 · 11325 字 阅读 →
论文解读

不增加解码开销的领域适应:把目标域语言模型加进语音识别的参数里

针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。

 · 更新于 2026-09-24 · 约 22 分钟 · 10584 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →
论文解读

把多轮对话压缩成概念令牌,再用帧对齐参考流守住不改的部分

针对逐轮改歌时单轮编辑器记不住上文的问题,AURA 用多模态大模型把完整对话蒸馏成 9 个概念令牌并以帧对齐方式注入冻结的 MusicGen,在 Slakh 与 MoisesDB 上以 0.78 对 0.37 的 SSIM 和 +11.32 dB 的 SI-SDR 改善保持性,代价是抽取类任务仍弱于专用分离模型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8319 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-15

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 38 分钟 · 18639 字 阅读 →