先唤醒编码器再整体微调:用轻量适配器补上语音大模型的声学短板
针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。
针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。
论文把在干净视频会议数据上训练的预测性轮次模型放到高重叠鸡尾酒会数据上检验,发现多模态加权 F1 从干净域掉到新域约三分之一,微调能提升多模态约三成但伴随原域遗忘,而纯音频分支几乎无法适应。
针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。
针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。
针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。
针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对两说话人 Hindi-English 医疗对话的说话人日志任务,论文比较 Diaper、Pyannote 3.1 与 DiariZen 并做域自适应,最强证据是解冻 WavLM 的 DiariZen-large 在 dev2 上达 8.57% DER、六系统融合后达 8.48% DER,代价是半监督策略高度依赖模型且融合增加系统复杂度。
针对三种真实退化信道下 11 种零样本克隆把验证错误率推高且预训练检测接近失效的问题,论文用混合标准库与域内退化语音的微调把已知攻击检测恢复到低错误率并改善部分未知攻击,代价是高保真未知攻击与小模型遗忘仍未解决。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。
针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。
针对实时通信中未知增强与编解码耦合失真问题,论文用真机穿越七个主流平台构建约 600 小时配对数据并提出音素引导一致性学习,在离线与在线混合评估上把平均等错率降到 5.81%,代价是对极端噪声与激进非线性失真仍有差距。
针对医疗语音数据稀缺与问诊能力缺失问题,论文用 405k 文本注入知识再用 198k 合成语音做模态重对齐,在多轮问诊与单轮问答上报告最优分数,代价是仍以普通话合成为主且只验证文本语音两种模态。
针对颅内语音神经假体跨会话漂移,ALIGN 用多源对抗会话不变学习加中间层对齐与时间拉伸增强,在 T12 与 T15 上相对基线降低音素错误率与词错误率,但远期大间隔与伪标签自训练仍是主要边界。