论文解读

余弦已很强时为何还要 PLDA:联合微调对齐嵌入与打分的防欺骗说话人确认

该文以 ECAPA-TDNN 嵌入为基础比较余弦与多种 PLDA 后端,提出嵌入提取器与判别式 PLDA 端到端联合微调,在 VoxCeleb1 上联合模型取得 PLDA 类最优而余弦仍保持最佳区分性,在 ASVspoof2019 上余弦的 a-DCF 最优而联合模型是 PLDA 类中最优,代价是流程更复杂且 t-DCF 未见统计显著优势。

 · 更新于 2026-09-25 · 约 16 分钟 · 7583 字 阅读 →
论文解读

说话人偏置当捷径:用教师引导加信息瓶颈做去身份的伪造检测

针对 ASVspoof 5 训练中说话人分布与真伪标签纠缠导致跨域失效的问题,论文用 VoxCeleb 教师经梯度反转引导学生去身份并以变分信息瓶颈控制抑制强度,在九个域外集的混合评估上相对 MHFA 基线降低混合等错率 25.7%,代价是在 ASVspoof 5 域内集上弱于挑战赛前列系统且部分数据集出现回退。

 · 更新于 2026-09-25 · 约 21 分钟 · 10515 字 阅读 →
论文解读

从打分到讲理:用多任务标注与两阶段训练让语音大模型当评测者

该文针对合成语音评测只有分数、跨任务跨语言泛化弱的问题,构建覆盖四任务四语言的 SpeechEval 并用指令微调加奖励优化训练 SQ-LLM,最强证据是在评估与对比维度相关性上超过专家基线,代价是约 43 个 A100 小时训练与对特定伪造来源泛化仍不稳定。

 · 更新于 2026-09-25 · 约 18 分钟 · 8767 字 阅读 →
论文解读

机器在打电话:先数录音重放,再问合成语音占多少

该研究用双轨应答蜜罐加音频指纹与商用合成语音检测器测量骚扰来电开场,报告机器发声至少占 26.9%,其中约一半是跨通话重放的录音,但合成标签只有约 54.4% 经盲听确认且阈值与播种历史显著影响读数。

 · 更新于 2026-09-25 · 约 25 分钟 · 12414 字 阅读 →
论文解读

深度冗余时做减法:用浅层对齐让伪造语音检测走得更远

针对 Transformer 伪造语音检测器深层冗余且域外泛化差的问题,论文用 XLS-R 加 1 到 4 层 MTLA 分类器并以角距离把浅层向末层对齐,在 19LA 训练、多域评测下以 479.11K 分类器参数取得域外增益,但过强对齐与过深堆叠仍会退化。

 · 更新于 2026-09-25 · 约 20 分钟 · 9858 字 阅读 →
论文解读

既要指认合成语音来自哪台生成器,又要识破没见过的新生成器

论文用冻结语音基础模型做表示、图神经网络做已知生成器归因、近邻分支做未知检测并以置信度阈值分流,在 DiffSSD 上 Mamba-B 的联合配置取得 DEV 准确率 98.11% 与等错误率 2.33%,代价是仍依赖固定阈值且不对多个未知源做细粒度区分。

 · 更新于 2026-09-25 · 约 19 分钟 · 9354 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

加了编解码器训练就掉音质:CRAW 用注意力、掩蔽与纠错把两者拉回平衡

CRAW 针对神经编解码器与去噪重合成导致后处理水印失效的问题,用加宽失真训练加注意力池化加推理时感知掩蔽加重复纠错码,在保持 PESQ 约 4.0 的同时把编解码器与去噪下的检测 F1 拉回 0.8 以上,代价是掩蔽带来约 150 ms 的额外推理延迟。

 · 更新于 2026-09-25 · 约 19 分钟 · 9217 字 阅读 →
论文解读

真假混在一起时:让大模型先分轨再判真伪的 ToolDF

针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。

 · 更新于 2026-09-25 · 约 15 分钟 · 7181 字 阅读 →
论文解读

听不见的指纹更可信?把语音伪造溯源拆成可感知与不可感知两条线索来验

语音伪造检测 | 7.4/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13039 字 阅读 →
论文解读

别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11536 字 阅读 →
论文解读

别让检测器猜伪迹:先把原声的压缩记忆藏回去

语音伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5792 字 阅读 →
论文解读

想找回被替换的原话,先接受水印不能再像哈希那样精确

音频水印 | 6.4/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3888 字 阅读 →
论文解读

Investigating voiced and unvoiced regions of speech for audio deepfake detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6842 字 阅读 →
论文解读

Explainability by Design: Structured Kolmogorov-Arnold Networks over Probabilistic Attributes for Speech Deepfake Source Tracing

语音伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4938 字 阅读 →
论文解读

Tracking the Trend in How Speech Synthesizers Deceive People

语音伪造检测 | 6.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4931 字 阅读 →
论文解读

The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report

语音伪造检测 | 6.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8140 字 阅读 →
论文解读

A survey of AI-generated voices and their detection

语音伪造检测 | 6.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4920 字 阅读 →
论文解读

AT-ADD: All-Type Audio Deepfake Detection Challenge Summary

音频伪造检测 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7256 字 阅读 →
论文解读

Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5887 字 阅读 →