仿真准、真实差:单通道说话人距离估计为何要按相关性选模型再做仿射校准
论文研究只用仿真训练的单通道距离估计器在真实语料上直接失效的问题,选择冻结估计器加几十条标注拟合仿射映射的路线,最强证据是 QMUL-TIMIT 干净条件下相关性 0.63 的模型经校准后明显优于常数均值,而代价是在低相关语料上斜率估计噪声会超过收益因而应退回常数预测。
论文研究只用仿真训练的单通道距离估计器在真实语料上直接失效的问题,选择冻结估计器加几十条标注拟合仿射映射的路线,最强证据是 QMUL-TIMIT 干净条件下相关性 0.63 的模型经校准后明显优于常数均值,而代价是在低相关语料上斜率估计噪声会超过收益因而应退回常数预测。
针对音节级声调标注缺数据、句子级数据切分噪声大的问题,ToneCL 用保持声调的增强做对比预训练再用每调 1 到 10 个样本微调,在六说话人普通话 10-shot 达到 91.6%,跨语言预训练仍达 91.0%,代价是自然连续语音与声门特征仍未解决。
针对前景与背景共现偏移导致的小样本音频分类失效,SampleSelect 在冻结编码器下为每个样本学习固定预算的特征掩码,在 SpurAudio 四个设置中取得相比方法的最高 OOD 准确率,并以 4.90-8.38 个百分点的提升超过匹配的 FullRep 对照,但选择预算与对比权重仍需按源域设定且诊断分析只建立关联而非因果。
论文把音效生产归纳为九项需求,用共享的参考到音频变体任务加原生能力分析比较五个异构基线,证据显示 AudioX 在保真与身份保持上最均衡而多样性、时序控制与局部修复各有所长且伴随效率与域外退化代价。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对有情绪语音下少样本说话头几何不稳定与音画情绪错位问题,EmoTaG 选择在 FLAME 参数空间预测运动并用门控残差分离音素与情绪,证据是在 5 秒适配的自重建与跨人跨语评测中取得更优的图像质量与运动误差,代价是适配仍需约 11 分钟与上脸辅助输入。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文研究无任务微调的说话脸生成,用冻结的稳定扩散加图像适配器做骨干并配三个无可训练参数的模块,在 CREMA 和 HDTF 上报告了最低的口型几何误差和最高的口型相关性,代价是依赖外部人脸先验与逐帧重绘加后滤波的推理链路。
针对音频文本对少、少样本适配易过拟合的问题,MUKA 用 Pengi 细粒度相似与 CLAP 全局相似的乘积核做免训练的核岭回归适配,在 11 个音频数据集 16 样本设置下平均准确率达到 80.90%,但在部分数据集上仍不敌线性探测且依赖超参数迁移。
针对基座会话与增量会话都只有极少标注音频的全少样本类增量音频分类问题,TAPE 冻结 CLAP 音频编码器并学习任务适配投影与推理期低熵原型演化,在三套音频任务上报告平均准确率与性能下降率的同步改善,代价是每类需维护推理期优先队列并按会话重置原型。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该文把攻击溯源做成验证问题,用自监督前端加角度间隔与混合正则训练与训练集完全隔离的嵌入器,在分布内用少样本后端取胜而在分布外用零样本余弦取胜,但两类等错率仍在 13% 至 30% 量级。
该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。
针对音频语言模型提示调优在基类上过拟合、新类上掉点的问题,论文提出用大模型生成语义邻居并以带间隔的拉近推远损失约束文本空间,在 11 个数据集平均上把 CoOp 新类准确率从 34.09% 提升到 42.98%,代价是训练时每个类要多编码 10 个邻居文本。
针对录音室训练的专用检测器在野外自发语音上泛化崩塌的问题,论文提出免训练的比较引导上下文学习框架,用成对证据生成与对账过滤幻觉,并用分布外路由把难样本交给音频语言模型,在三个野外数据集上报告了高于基线的宏平均 F1,但以录音室数据性能下降和依赖闭源模型生成证据为代价。
针对无文字低资源语言难以从原始音频发现音素单元的问题,该工作在 HuBERT 基础上用 55 语言的发音特征与音素监督做多语言续训,再以 ABX 可辨别性检验上下文不变性,最强有监督自适应在开发集与测试集取得 3.07% 与 3.39% 的平均误差,但自监督与有监督之间仍有差距且评估集中于 ABX。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对五类想象词跨被试解码零样本跌至机会水平的问题,论文用共享三维卷积前端加留一被试预训练再做小样本校准,最强证据是 64 通道三维卷积加仅调分类头在每类 60 样本约 25 分钟校准下达到 53.71%,代价是源域训练准确率高达 92.3% 且被试间方差大。
论文把新语言低资源表示学习定义为跨语言元学习,用多任务自适应预训练构造适应 эпизод并以一阶双层优化实现可扩展更新,在三语平均上用 1 小时无标注适应追平 6000 小时域内上限,但零样本起点变弱且外环仍依赖源语言音素标注。