更难的重放与更真的合成:J-SPAW2 如何让日语说话人验证同时失守
J-SPAW2 在保留日语真实录制框架下系统控制重放距离音量与零样本合成参考噪声,用低音量远场重放使 w2v2+AASIST 的 t-DCF 升至 0.619、用 ElevenLabs 等合成使 CM 与 ASV 同时退化,但增强后更自然并不等于更难检测。
J-SPAW2 在保留日语真实录制框架下系统控制重放距离音量与零样本合成参考噪声,用低音量远场重放使 w2v2+AASIST 的 t-DCF 升至 0.619、用 ElevenLabs 等合成使 CM 与 ASV 同时退化,但增强后更自然并不等于更难检测。
Kiwano 用纯 PyTorch 的数据管理、前端嵌入与后端打分统一研究说话人确认,在 VoxCeleb2 训练下 fwSE-ResNet-200 取得全局平均 3.16% 等错误率与 0.193 最小检测代价,代价是 79 小时训练与 706.3 千瓦时能耗及跨域仍有明显退化。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
该文用均匀 K 均值量化感知训练在 ResNet-36 与 ResNet-200 上定位 2 比特为主要退化区间,以分数漂移与阈值附近有害翻转解释退化,并用 2/3/4 比特校准级联在接近 FP32 性能下降低平均计算代价,但三模型常驻带来内存代价。
该文以 ECAPA-TDNN 嵌入为基础比较余弦与多种 PLDA 后端,提出嵌入提取器与判别式 PLDA 端到端联合微调,在 VoxCeleb1 上联合模型取得 PLDA 类最优而余弦仍保持最佳区分性,在 ASVspoof2019 上余弦的 a-DCF 最优而联合模型是 PLDA 类中最优,代价是流程更复杂且 t-DCF 未见统计显著优势。
论文以多轮对话中同一说话人是否保持声学一致为问题,用检测、定位、判别三任务与 1818 个人审实例检验 12 个大音频语言模型与 6 种嵌入基线,最强证据是判别可达 81.5% 而检测仅 64.7% 且加文本上下文后不一致检出崩塌,代价是绝对判断阈值不稳与文本压过声学。
论文针对深度说话人嵌入后端仍需结构化建模与时长补偿的问题,提出各向同性 PLDA 与球面高斯 T-PSDA 及其时长扩展,在 NIST SRE 与 CN-Celeb 上以 EER 与最小代价显示时长建模带来可复现增益,但最小主代价改善有限且依赖前端与归一化条件。
针对跨语言说话人确认退化与语种识别走说话人捷径的纠缠问题,论文用冻结 W2V-BERT 2.0 加小波前缀调谐与减加双路径融合,在 TidyVoice 上报告 3.16% 和 4.35% 等错误率,代价是依赖后处理校准与多阶段调参。
论文用跨语言迁移矩阵比较四种说话人确认架构在 44 种语言上的迁移结构,发现 ECAPA-TDNN 最接近语言无关而 HuBERT-SID 语言依赖最重,代价是结论只在受控小数据区间和 AUC 度量下成立。
针对全量微调语音自监督基座模型代价高、MLP 适配器表达受限的问题,KanAdapter 以并行瓶颈中的 GR-KAN 可学习有理激活替换固定激活,在说话人验证、情感识别与伪造检测上以减少 94.7% 至 97.5% 可训练参数接近全量微调,并在两阶段持续学习上相对全量微调降低 83.6% 错误率。
针对未见说话人上情感识别易受说话人差异干扰的问题,论文用 wav2vec 2.0 做编码器、ECAPA-TDNN 做说话人判别器并以熵最大化做对抗,在 IEMOCAP 测试集报告 60.63% UA,代价是交替训练更复杂且存在原文内部数字不一致与未验证的跨库边界。
语音合成 | 7.5/10
说话人验证 | 7.8/10
说话人验证 | 5.6/10
说话人验证 | 7.1/10
说话人验证 | 6.0/10
说话人验证 | 6.0/10
说话人验证 | 5.7/10
语音交互 | 3.8/10
说话人验证 | 6.0/10