论文解读

先唤醒编码器再整体微调:用轻量适配器补上语音大模型的声学短板

针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。

 · 更新于 2026-09-24 · 约 20 分钟 · 9557 字 阅读 →
论文解读

干净环境练出的抢话预测,到鸡尾酒会为何失灵:音频敏感、视觉更稳

论文把在干净视频会议数据上训练的预测性轮次模型放到高重叠鸡尾酒会数据上检验,发现多模态加权 F1 从干净域掉到新域约三分之一,微调能提升多模态约三成但伴随原域遗忘,而纯音频分支几乎无法适应。

 · 更新于 2026-09-24 · 约 16 分钟 · 7571 字 阅读 →
论文解读

去掉语言方向:用残差做未见语言的音频伪造检测

针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。

 · 更新于 2026-09-24 · 约 18 分钟 · 8787 字 阅读 →
论文解读

不增加解码开销的领域适应:把目标域语言模型加进语音识别的参数里

针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。

 · 更新于 2026-09-24 · 约 22 分钟 · 10584 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

跨采集条件仍能判准吗:用迭代对抗自训练把源域边界搬向目标域

针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9191 字 阅读 →
论文解读

用无标注空管语音改造 Whisper 编码器:BEARD 为何要把自监督放在中间层并用蒸馏拴住解码器

针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8619 字 阅读 →
论文解读

冻住检测器、只训练回溯翻译器:持续伪造语音检测里的遗忘与适配矛盾

针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。

 · 更新于 2026-09-24 · 约 16 分钟 · 7753 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

说话很准、唱歌就失灵:用三路特征混合守住语音又学会歌声

针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

临床印地-英语混说下谁在说话:DiariZen 为何要解冻 WavLM 才跟得上

针对两说话人 Hindi-English 医疗对话的说话人日志任务,论文比较 Diaper、Pyannote 3.1 与 DiariZen 并做域自适应,最强证据是解冻 WavLM 的 DiariZen-large 在 dev2 上达 8.57% DER、六系统融合后达 8.48% DER,代价是半监督策略高度依赖模型且融合增加系统复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8756 字 阅读 →
论文解读

退化信道复制了伪造痕迹:混合域适应如何挽回检测失效

针对三种真实退化信道下 11 种零样本克隆把验证错误率推高且预训练检测接近失效的问题,论文用混合标准库与域内退化语音的微调把已知攻击检测恢复到低错误率并改善部分未知攻击,代价是高保真未知攻击与小模型遗忘仍未解决。

 · 更新于 2026-09-24 · 约 21 分钟 · 10485 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

用非言语笑声哭声做监督:韵律如何跨到多语言言语情绪识别

论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9179 字 阅读 →
论文解读

不改伪标签,在参数空间里纠正伪标签:Pseudo2Real 的跨口音修正向量

针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
论文解读

黑盒通话压碎帧级伪造痕迹:用音素级一致性守住可懂结构

针对实时通信中未知增强与编解码耦合失真问题,论文用真机穿越七个主流平台构建约 600 小时配对数据并提出音素引导一致性学习,在离线与在线混合评估上把平均等错率降到 5.81%,代价是对极端噪声与激进非线性失真仍有差距。

 · 更新于 2026-09-24 · 约 22 分钟 · 10638 字 阅读 →
论文解读

把医学知识先教给文字大脑,再用少量语音对齐:SpeechMedAssist 的两阶段医疗问诊适配

针对医疗语音数据稀缺与问诊能力缺失问题,论文用 405k 文本注入知识再用 198k 合成语音做模态重对齐,在多轮问诊与单轮问答上报告最优分数,代价是仍以普通话合成为主且只验证文本语音两种模态。

 · 更新于 2026-09-24 · 约 19 分钟 · 9049 字 阅读 →
论文解读

跨天解码为何会塌:ALIGN 用对抗对齐剥离会话线索

针对颅内语音神经假体跨会话漂移,ALIGN 用多源对抗会话不变学习加中间层对齐与时间拉伸增强,在 T12 与 T15 上相对基线降低音素错误率与词错误率,但远期大间隔与伪标签自训练仍是主要边界。

 · 更新于 2026-09-24 · 约 23 分钟 · 11050 字 阅读 →