联邦多语语音大模型:编码器与解码器谁更怕客户端漂移
该研究在 316 个按说话人划分的多语联邦客户端上比较四种语音大模型与 FedAvg 和 FedProx,最强证据是 Whisper 加 EuroLLM 在解冻编码器并调低其学习率时取得 0.1170 词错率,而 FedProx 只在该多语解码器上有效,代价是联邦仍远差于集中训练且对编码器预训练类型高度敏感。
该研究在 316 个按说话人划分的多语联邦客户端上比较四种语音大模型与 FedAvg 和 FedProx,最强证据是 Whisper 加 EuroLLM 在解冻编码器并调低其学习率时取得 0.1170 词错率,而 FedProx 只在该多语解码器上有效,代价是联邦仍远差于集中训练且对编码器预训练类型高度敏感。
共分析 42 篇语音/AI 论文
针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。
针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。
共分析 29 篇语音/AI 论文
针对赛车高层行为指令的离线语音控制问题,Jarvis 用唤醒词加本地转写加微调 Mistral 7B 做文本到指令分类,在 17 类 1645 样本条件下报告 97.63% 准确率与 1.39 s 平均延迟,但数据集仍部分合成且指令空间严格预定义。
共分析 26 篇语音/AI 论文
针对未见攻击泛化难且不扩充数据、不改动原参数的问题,CoReLoop 用 LoopBridge 构造循环输入、循环 LoRA 加门控更新与 ExitBridge 对齐分类器,在 14 个跨域测试集上 24 层模型以约 10M 可训练参数把池化等错误率从 4.85% 降到 3.74%,自适应停止以平均 1.18 次通过达到 3.73%,代价是第二次通过仍需完整 …
针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。
针对语音大模型用自回归解码做四分类情绪识别会产生无效标签并偏向多数类的问题,论文在冻结主干上对比同一最终提示词隐状态的生成式解码与单层线性分类头读出,最强证据是加入对话上下文后宏平均 F1 达到 78.14 且在 ASR 转写下从 74.47 提升到 76.50,代价是只验证了 IEMOCAP 四类设置且可解释关联暴露了预训练的文化偏置。
共分析 36 篇语音/AI 论文
针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。
针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。
共分析 29 篇语音/AI 论文
该研究把 AASIST2 图注意力层拆成打分对称性、温度可学习性与路由粒度三条残差分支,在统一 LoRA 条件下用五个评测集和五个随机种子检验,发现 LearnT 平均统一等错误率最优而 GATv2 与 LearnT 联用反而明显退化,说明分支之间是非可加的相互作用。
针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。
共分析 59 篇语音/AI 论文
针对逐轮改歌时单轮编辑器记不住上文的问题,AURA 用多模态大模型把完整对话蒸馏成 9 个概念令牌并以帧对齐方式注入冻结的 MusicGen,在 Slakh 与 MoisesDB 上以 0.78 对 0.37 的 SSIM 和 +11.32 dB 的 SI-SDR 改善保持性,代价是抽取类任务仍弱于专用分离模型。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共分析 19 篇语音/AI 论文