多而不杂才有用:用来源与生成器多样性重组语音伪造检测训练数据
该文研究未见伪造方法下的泛化问题,选择先量化来源与生成器多样性的扩展规律再做异构数据混合,用 12k 小时 DOSS 加权训练在公开集和商用 API 集上超过 74k 小时基线,但大 Nc 与极端温度仍会退化且多语覆盖有限。
该文研究未见伪造方法下的泛化问题,选择先量化来源与生成器多样性的扩展规律再做异构数据混合,用 12k 小时 DOSS 加权训练在公开集和商用 API 集上超过 74k 小时基线,但大 Nc 与极端温度仍会退化且多语覆盖有限。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把声纹伪造检测的跨库崩溃拆成捷径依赖与域偏移两类失败,用有向图加受控声学干预证明非语音结构是主捷径,而针对性增强能解耦但要付出域内代价。
该文针对泰语、越南语、斯瓦希里语和印尼语构造六类复杂文本诊断集,用内容一致性、语言一致性和生成稳定性三维指标比较 OmniVoice、VoxCPM2 和 MMS-TTS,发现数字日期与混写输入带来最集中的内容与时长失效,而轻量文本风险分与内容错误呈中等正相关但几乎不能预测语言混淆。
针对三种真实退化信道下 11 种零样本克隆把验证错误率推高且预训练检测接近失效的问题,论文用混合标准库与域内退化语音的微调把已知攻击检测恢复到低错误率并改善部分未知攻击,代价是高保真未知攻击与小模型遗忘仍未解决。
针对噪声混响等导致语言向量漂移的问题,该文冻结语种识别器并在其输出向量上学习流匹配变换,用五语种失真配对实验把 ECAPA 整体准确率从 0.6900 提升到 0.8672,代价是推理需 50 步常微分方程求解且法语等个别情形仍弱于波形前端。
针对声学失配下说话人嵌入漂移问题,论文用条件流匹配在嵌入空间学习从高斯噪声到干净教师嵌入的映射,并用多次采样估计目标分数均值做分数归一化,在七个数据集上平均相对降低等错率约 17%,代价是推理需多步常微分方程求解且在干净匹配条件下几乎无增益。
针对未见合成方法泛化难的问题,论文把 WavLM-Large 部分高层的前馈块替换为多专家并用门控做整句选路,在 14 个评测集上把宏平均等错率从 5.46% 降到 4.81%,代价是参数增至 329M 且需全量微调。
论文研究说话人识别中速度扰动和混合拼接增强如何加大训练难度,提出用杰弗里斯损失约束非目标分布并用面向近邻的混合采样供给局部样本,在多组失配评估上报告稳健性方向,同时显示单阶段联合多种增强会使判别过难而分数融合更稳妥。
针对生成语音溯源需要的盲检测水印问题,论文选择在预训练编解码器隐空间做密钥控制的正交小旋转,最强证据是跨数据集干净条件下正确密钥可检而错误密钥回到随机猜测,主要代价是高通滤波下检测下降且仅做客观质量估计。
针对噪声导致语言结构坍塌与语义模糊,论文提出 Speech-MLM 用频谱视觉结构、复述文本语义与门控跨模态融合做重建,在多噪声集上报告词错误率与语义相似度同步提升,但多分支带来推理开销与复述质量依赖。
该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。
该文在 ASVspoof 2019 上用省略敏感性与熵损失诊断出 A1 与 A4 等高影响攻击,再用先学低影响后适配高影响的重放课程把跨数据集总体 EER 明显压低,代价是两阶段训练与四项正则的额外复杂度。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
OEA 用冻结多模态大模型加 LoRA 统一编码文本与音频,在文本到音频上与 M2D-CLAP 接近,在文本到文本与硬负例排除上明显占优,代价是更大的显存与离线音频编码开销。
该文用均匀 K 均值量化感知训练在 ResNet-36 与 ResNet-200 上定位 2 比特为主要退化区间,以分数漂移与阈值附近有害翻转解释退化,并用 2/3/4 比特校准级联在接近 FP32 性能下降低平均计算代价,但三模型常驻带来内存代价。
论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。
该文以 ECAPA-TDNN 嵌入为基础比较余弦与多种 PLDA 后端,提出嵌入提取器与判别式 PLDA 端到端联合微调,在 VoxCeleb1 上联合模型取得 PLDA 类最优而余弦仍保持最佳区分性,在 ASVspoof2019 上余弦的 a-DCF 最优而联合模型是 PLDA 类中最优,代价是流程更复杂且 t-DCF 未见统计显著优势。
针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。