英文题目:The Effect of Telephony Transmission on Source Tracing of Audio Deepfakes
会议身份:
conference:odyssey:2026:conference-paper-id:klein26_odyssey
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据增强 #鲁棒性 #语音 #音频深度伪造检测
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:应用研究
👥 作者与机构
- Nicholas Klein:机构信息未能从会议 PDF 纯文本可靠映射
- Hemlata Tak:机构信息未能从会议 PDF 纯文本可靠映射
- Nikolay Gaubitch:机构信息未能从会议 PDF 纯文本可靠映射
- David Looney:机构信息未能从会议 PDF 纯文本可靠映射
- Tianxiang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Elie Khoury:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
源追踪输入为经公共电话网传输的窄带语音,输出为已知生成模型类别标签与未知模型检测,难点在于带宽压缩与编解码抹除生成器指纹并引入信道伪影。该工作先基于MLAAD构建宽带与窄带对照条件以分离带宽与编解码退化,其输出的对照性能进入下一步训练设计。接着以残差网络ResNet34学习判别嵌入并用柔性最大能量进行开放集检测,其输出的嵌入分数作为最终判决依据。最后将随机量化与原始增强联合仿真电话失真以替代真实电话数据训练,从而扩大训练分布。相比直接干净训练后测试编解码条件的已有范式,关键差异在于将增强放在重采样与编解码之后以掩蔽易过拟合的高频伪影,实际意义是免除昂贵的真实电话采集。在MLAAD窄带VoIP/PSTN评测条件下,8k→Quantize→RawBoost+G711训练模型的EERc错误率为15.1%,低于直接VoIP/PSTN训练模型的EERc错误率18.9%。该结论适用边界受限于MLAAD所含声码器与Twilio单一路线的英语为主电话场景,对丢包与多运营商级联等更复杂失真尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/TakHemlata/ — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/swshon/multi-speakerID — 链接可访问(HTTP 200)
- 数据相关资源:https://deepfake-total.com/sourcetracing — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/speechbrain/ — 暂时无法访问
- 第三方资源:https://www.twilio.com/docs/voice/api/sip-interface — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
输入是一段待鉴定的合成语音,目标是判断它来自哪一个语音合成或变换系统。论文研究的是音频深度伪造的来源溯源,也就是在多个已知生成器加未知生成器的开集条件下做归因,而不只是真假二分类。读者需要先建立这个区别:二分类靠真假边界,溯源靠生成器之间的细微指纹,电话传输恰好最容易破坏后者。
本文的输出是 1 篇可复述的技术解读,保留全部可核对的动作:数据如何重采样与过编码,模型如何提取特征与打分,增强以什么顺序施加,指标如何聚合,关键数字在什么训练测试配对下得到。凡是教学举例都会标为例子的,不把例子当作论文报告的效果。
来源溯源 × 二分类真伪检测: 二分类真伪检测只回答是真人还是合成,来源溯源要进一步回答是哪一个合成系统生成的,二者分工不同:前者学真与假的边界,后者学不同生成器之间细微伪影的边界;论文把二者搭配的原因是溯源需要比检测更稳定的生成器指纹,而电话信道恰好会磨掉这些指纹,所以不能把检测鲁棒直接当成溯源鲁棒。
学习路径按依赖展开:先讲任务与已有路线,再讲方法全景与组件计算,然后讲训练构造与推理打分,接着讲实验条件、结果与反证,最后讲复现与收束。资源可达性按本次收到的官方状态交代:RawBoost 代码链接与多说话人评测代码链接以及溯源数据集链接本次确认可用,Twilio 语音接口文档本次确认可用,语音大脑模型库链接本次未能确认可达,因此涉及说话人嵌入的部分只讲论文已报告的做法,不承诺权重可下载。
已有路线在解决同输入同目标的哪一段?
第一条路线是模型属性估计,不直接点名具体生成器,而是估计输入类型是文本还是音频、声学模型家族、声码器类型等管线属性。它的优点是能利用多系统共享组件来泛化,缺点是法医颗粒度粗,无法回答到底是哪一个发布版本或哪一个训练配置。
第二条路线是具体模型溯源,也是本文所在路线。Interspeech 2025 用多语言反欺骗数据集 MLAAD 组织了开集溯源专题,评估集有 43 个训练未见系统,催生了度量学习、无需微调的 k 近邻匹配、Softmax 能量引导训练与分布外检测、以及借鉴说话人验证的验证式方法。它们的共同点是输入相同、目标相同、运行阶段相同,都是在测试时同时处理已知类分类与未知类拒绝。
第三条路线是针对神经编解码生成模型的溯源,例如在 CodecFake 上做闭集分类加二分类未知检测。这类工作更接近编解码伪影,但论文指出它只覆盖干净音频或音频大语言模型生成的编解码条件,没有处理真实电话中的重采样、编解码、丢包与压缩叠加。本文的差异正在于此:把电话信道当作未见条件,单独拆出带宽与编码的影响,并检验廉价增强能否替代昂贵的真实电话采数。
电话信道把什么变难了?
论文把困难写成两层。第一层是信息丢失:公用电话网与 VoIP 会把宽带语音压到窄带,常见做法是降到 8 kHz 采样,同时用 Opus 或 G711 等编码压缩。生成器指纹往往藏在高频细节与声码器相位中,降采样直接砍掉高频,编码再引入量化噪声,指纹就被磨平。
第二层是条件不可控:真实电话要实时传输,采集耗时耗钱,且具体走了哪条编码链路、丢包与回声如何,训练时难以穷举。于是模型在干净宽带上学到的过拟合特征,一到未见编码就失效。论文要回答 3 个可操作问题:带宽与编码各自造成多大退化,未见编码是否比匹配条件更致命,以及随机量化加 RawBoost 加 G711 仿真能否在不采真实电话的情况下泛化到真实电话。
沿一个样本走完输入到输出
取一条 MLAAD 合成语音,先按实验条件决定路径:或重采样到 16 kHz 作为干净宽带,或重采样到 8 kHz 作为干净窄带,或再过 Opus、G711 编码,或经 Twilio 送过真实 VoIP 与 PSTN。训练时还可能在波形域先做增强,测试时取前 4 秒,训练时随机截 4 秒,保证输入时长一致。
接着提取 80 维对数滤波器组特征,窗长 25 毫秒、帧移 10 毫秒,再拼接 1 阶与 2 阶差分并做倒谱均值方差归一化,得到每帧 240 维向量。这个表示同时保留频谱包络与动态变化,是后段残差网络的输入。
主干是 ResNet34,初始卷积后接 4 个残差块,深度为 3、4、6、3,用于学判别性帧级表示。时间统计池化把变长帧级特征按通道求均值与标准差并拼接,得到定长话语表示,再经全连接映射到 128 维嵌入。训练用大间隔余弦损失,测试用 Softmax 能量做未知拒绝:能量越偏说明模型越确信属于某个已知类,越分散说明模型在多个已知类间犹豫,更可能是未知生成器。
开集识别 × 分布外检测: 开集识别指测试会出现训练没见过的生成器,分布外检测指判断样本是否属于已见类别,二者分工是前者定义任务形态、后者提供拒绝机制;论文把多分类配上 Softmax Energy 做阈值判断,搭配理由是只做闭集分类会在遇到新生成器时强行归入已知类,而能量分数给了一个可操作的未知拒绝旋钮,组合后才能同时报告分类对错与是否见过。
带宽、编码与打分组件各自负责什么?
数据组件负责构造 5 种条件。干净 16k 是把原始 22.05 kHz 重采样到 16 kHz 的宽带基准。Opus 16k 是用 ffmpeg 经 ogg 容器与 libopus 编码、比特率在 24、32、48、64 kbps 中随机选的宽带编码条件。干净 8k 是重采样到 8 kHz 的窄带基准,论文明说它不真实,因为真实窄带一般会过编码,但它能单独度量降带宽。G711 是用 ffmpeg 同时做 A 律与 μ 律的窄带编码,固定 64 kbps。真实电话是用 Twilio 可编程语音接口把音频送过 VoIP 与 PSTN,缩写为 Tel.。
带宽缩减 × 编码失真: 带宽缩减指把 22.05 kHz 或 16 kHz 降到 8 kHz 从而丢掉高频,编码失真指 Opus 或 G711 在压缩重建中引入的量化与建模噪声,二者分工不同:一个是线性丢信息,一个是非线性改细节;论文把它们分开搭配的原因是真实电话同时包含两者,只有拆开训练测试才能判断退化主要来自哪一个,组合意义是后续增强可以对准真正的短板而不是笼统加噪声。
打分组件负责把开集问题拆成两步。第一步是多分类给出每个已知生成器的对数几率,第二步是用 Softmax 能量把对数几率先做 softmax 再算能量,温度系数控制平滑。直觉是已知样本的对数几率更尖,能量更高,未知样本在多个已知类上分散,能量更低。选模依据是验证集上 EERc 最低,而不是只看分类准确率,这保证了阈值选择同时考虑分类与拒绝。
训练如何组织,增强以什么顺序施加?
模型从零训练 50 轮,批量 40,余弦退火学习率初值 1e-3,权重衰减 1e-4。大间隔余弦损失的缩放因子取 16.0,间隔从 0 线性升到第 40 轮的 0.5。输入固定 4 秒,训练随机截,评估取前 4 秒。最优模型按验证集上用 Softmax 能量算得的 EERc 最低来选。论文未报告优化器具体名称与梯度截断等细节,此处记为缺项,不从模型名推定。
随机量化增强 × RawBoost: 随机量化增强是把 16 位波形除以 Q 再取整恢复,用可控信噪比模拟编码的精度损失,RawBoost 是在原始波形上加卷积性、脉冲性和平稳性 3 类噪声以模拟环境与通道变化;前者分工是模仿编码器的幅度离散,后者分工是扩大通道多样性,搭配理由是真实电话既有量化又有噪声,组合后训练集能覆盖更多未见电话条件而不必实际打电话采数据。
增强有两类。随机量化增强的动机是模拟 G711 等编码的压缩量化:对 16 位波形向量除以 Q 再取整恢复,再乘回 Q 并映射回 16 位范围,Q 越大失真越重,Q 随机采样到使量化信噪比落在 35 到 60 dB 之间。RawBoost 直接在原始波形加 3 类噪声:线性和非线性卷积噪声、脉冲型信号相关加性噪声、平稳信号无关加性噪声,宽带沿用原文配置,窄带把采样率与最高频率适配到 8 kHz 与 4 kHz。单独用 RawBoost 时每条都加,联合使用时 RawBoost 以概率 0.5 随机施加而量化对全部样本施加,以增加多样性又避免过度扰动。
顺序是关键实验变量。按真实信号路径应先加环境噪声再过编解码,但论文也试了相反顺序,理由是先仿真编码会留下特定滚降等可过拟合痕迹,后加 RawBoost 可以掩盖低能量高频残留,帮助泛化到未见编码。窄带实验发现先下采样再做 RawBoost 明显更好,后文用数字核对。
数据划分、指标方向与公平条件是什么?
数据用 MLAAD 来源溯源划分,只含伪造话语,分训练、开发与评估,评估有 43 个训练未见系统。已见记为分布内,未见记为分布外。原始采样率 22.05 kHz,所有条件都从同一源派生,保证比较的是信道而非说话内容。
指标有 3 个且方向不同。ID F1 是只在已见类上算的宏平均 F1,越高越好,只看已知类分对与否。FPR95 是已知类真阳率 95% 时把未知判成已知的假阳率,越低越好,只看拒绝能力。EERc 是同时要求已知分对且未知拒对的等错率,越低越好,是本文主指标。所有指标都按生成器样本量做类别加权,避免大类主导。
EERc × ID F1: ID F1 只在已见生成器样本上算多分类宏平均,只管分对哪一类,EERc 则要求同时做对两件事:先判断是不是已知,再把已知分对具体类;前者分工是看已知类内部可分性,后者分工是看开集整体可用性,搭配原因是论文既关心模型指纹是否可分,也关心未知生成器会不会污染已知类的精度,组合后才能避免只看 ID F1 时高估电话场景的法医价值。
公平条件是按带宽分组比较:宽带模型只在宽带测试集内比,窄带模型只在窄带与真实电话内比,对角线看匹配条件的难度,非对角线看分布偏移下的泛化。增强实验把真实电话严格留作未见,只用干净窄带加增强与 G711 仿真去考电话测试,避免用电话训电话的信息泄漏。
带宽与编码各自让溯源难了多少?
先看匹配条件下的难度排序,也就是用同种数据训练与测试,排除分布偏移,只看信道本身的难易。论文报告干净宽带最好,宽带 Opus 与干净窄带的退化幅度相近且温和,窄带 G711 进一步变难,真实电话最难。这个排序支持编码是主要退化来源之一,但真实电话还有编码之外的累积损伤。
| 条件 | 指标 | 干净宽带 16k | 宽带 Opus | 干净窄带 8k | 窄带 G711 | 真实电话 |
|---|---|---|---|---|---|---|
| 匹配训练测试 | EERc | 10.6% | 12.8% | 12.9% | 14.8% | 18.9% |
上表把对角线 EERc 放在同一行,比较问题是同分布下哪种信道更难,公平条件是训练测试同条件,指标越低越好。表后解释是主要收益在于分解:降带宽与加宽带编码各自只带来约 2 个百分点的上升,而真实电话比干净宽带高出约 8 个百分点,说明不能只用重采样模拟电话。未胜出项是真实电话本身,它在所有匹配条件中最差,提示仿真编码仍有差距。
再看非对角线的泛化,也就是训练一种条件去测另一种。干净宽带训宽带 Opus 测是最差的未见编码情形,比干净窄带训 G711 或电话测更差,论文解释是宽带有更多可过拟合的信息。用 G711 训练比用干净窄带训练能更好地泛化到电话,几乎追平直接用电话训练。这说明见过 1 次窄带编码,比只见过干净窄带更接近真实电话。
未见编码是否比匹配条件更致命?
这个问题用跨条件表回答,重点是训练没见过的编码在测试出现。与谁比很清楚:基线是干净训练干净测,挑战是干净训练编码测与电话测,补救是用编码仿真训练再测电话。条件一致性在于同一模型结构与同一打分阈值选择,只换训练数据源。
| 训练 | 指标 | 宽带 Opus 测试 | 窄带 G711 测试 | 真实电话测试 | 可部署性 |
|---|---|---|---|---|---|
| 干净 16k | EERc | 30.2% | 未评测 | 未评测 | 可运行 |
| 干净 8k | EERc | 未评测 | 18.4% | 24.7% | 可运行 |
| G711 仿真 | EERc | 未评测 | 14.8% | 19.4% | 可运行 |
上表提出的问题是未见编码的代价有多大,公平条件是同为开集评估与同为 EERc 越低越好。表后解释是主要判断与限制:干净宽带到未见 Opus 的 30.2% 是全文最差,支持未见编码是最大挑战;G711 训练把电话测试从 24.7% 降到 19.4%,几乎达到直接用电话训练的 18.9%,支持仿真编码可替代部分真实采数。代价是 G711 训练在自身匹配条件之外的宽带上未被验证,不能推广到所有编码。反例是直接用电话训练的模型在干净 8k 上反而更差,说明电话数据并非全能,存在向电话噪声过拟合。
增强顺序与组合带来什么,代价是什么?
先看窄带上的顺序消融。把 RawBoost 放在下采样前与后相比,放在后明显更好,电话测试从 23.3% 降到 19.5%,且在干净窄带测试上也从 19.2% 降到 13.8%。论文的解释是后加的噪声能防止过拟合重采样痕迹。单独量化也能把电话测试做到 19.2%,与后加 RawBoost 相近。同时加两者并未进一步超越单独使用,后加 RawBoost 略好于后加量化。
| 训练构造 | 指标 | 干净 8k 测试 | G711 测试 | 真实电话测试 | 备注 |
|---|---|---|---|---|---|
| 干净 8k | EERc | 12.9% | 18.4% | 24.7% | 基线 |
| 下采样后再 RawBoost | EERc | 13.8% | 14.8% | 19.5% | 推荐顺序 |
上表比较的是增强顺序与是否加入 G711 仿真,公平条件是电话始终未见,指标越低越好。表后解释是主要收益与代价:最优组合在未见电话上做到 15.1%,相对直接用电话训练的 18.9% 有 20.1% 相对改进,且在干净与 G711 上也不差;代价是训练条件更多、在干净窄带匹配上略高于纯干净基线的 12.9% 到 13.8% 区间,且论文报告对 G711 与电话训练再加增强反而变差,因此增强只应对干净窄带施加。宽带侧只验证了推荐顺序,量化加 RawBoost 把未见 Opus 从 30.2% 降到 14.9%,但干净宽带从 10.6% 微升到 11.9%,存在小幅匹配代价。
| 训练构造 | 指标 | 干净 16k 测试 | 宽带 Opus 测试 | 适用条件 |
|---|---|---|---|---|
| 干净 16k | EERc | 10.6% | 30.2% | 基线 |
| 加 RawBoost | EERc | 10.1% | 16.1% | 可运行 |
| 量化加 RawBoost | EERc | 11.9% | 14.9% | 最优泛化 |
这张宽带表说明增强在宽带同样有效,但不能代替窄带结论,未评测把宽带增强直接用于电话。
下面看逐类误差分析。导读:上方面板是逐已知类的 F1,比较干净宽带最优与电话最优在两类测试下的表现,下面板是训练说话人多样性,排序按电话上分布外退化从大到小,3 类评估无样本的已知类已省略。
看图路径: 1. 先看上方面板每类两根柱子:蓝色是干净宽带最优模型,橙色是电话场景最优模型,深色是计入分布外误判后的 F1,浅色是忽略分布外样本时的 F1;2. 再看两根柱子深浅差值:差值越大说明该类吸入了越多本应拒绝的未知生成器样本;3. 最后对照下面板说话人多样性:左侧低多样性类分居两端,中间高多样性类退化更均匀,检查说话人是否为 shortcuts
论文图 1。原论文 Figure 1:“Per-class F1 scores for our best model on clean wide-band data (blue) and for our best model on real telephony (VoIP/PSTN) data (orange).”。
解释可见内容:左侧低多样性类出现两极分化,要么吸入大量未知误判,要么几乎不受影响,右侧低多样性类则保持高 F1,说明是否撞上同说话人的未知生成器很关键;但 4 个共享同一说话人的 ljspeech 类在两种信道下已知类内部仍接近 1.0,且右侧低多样性的意语男性声音即使被未知模型复用,调整后 F1 仍接近 1.0,支持模型在一定程度上分离了说话人与模型伪影。中间高多样性类退化更均匀,电话下调整后 F1 普遍低于宽带,且 xtts v2 与 vixTTS 在电话下互相混淆,说明电话主要伤害的是未知拒绝而非已知类互分。像素不能精确读出的具体 F1 小数不硬写,以正文报告的整体 EERc 为准。
哪些结论有边界,什么还没有测?
已验证的是相对排序与可部署策略:在匹配条件下真实电话最难,未见编码比匹配更难,干净窄带加量化加 RawBoost 加 G711 能在未见电话上超越直接用电话训练。这些判断有数字支持,但只限于 MLAAD 溯源划分、ResNet34 加 Softmax 能量这一套流程,不等于所有溯源结构都如此。
未验证的是因果归因与成本承诺。说话人多样性与分布外误判的关系是相关性观察,论文用外部说话人嵌入估计多样性,但数据集本身无说话人标签,且该嵌入库本次未能确认可达,复现时需另找可达的说话人表示并重新校准。论文未测量误判率之外的延迟、算力与实时传输费用,因此不能承诺增强降低了推理延迟或总体拥有成本,只能说省掉了实时采电话训练数据的步骤。总体趋势不等于每类都成立,逐类图显示少数低多样性类几乎不受电话影响,不能把平均改进推广到每个生成器。
要复现先做什么,需要哪些超参数与信息条件?
先按论文列出数据管线:原始 22.05 kHz 出发,干净 16k 与干净 8k 分别重采样,Opus 经 ffmpeg 选 24 到 64 kbps 随机比特率,G711 同时做 A 律与 μ 律固定 64 kbps,真实电话经 Twilio 送 VoIP 与 PSTN。特征固定为 80 维对数滤波器组加 1 阶 2 阶差分与倒谱均值方差归一化,输入 4 秒,训练随机截,评估取前 4 秒。模型为 ResNet34 加统计池化到 128 维,大间隔余弦损失缩放 16.0、间隔线性升到 0.5,训练 50 轮,批量 40,余弦退火初值 1e-3,权重衰减 1e-4,按验证 EERc 选模。增强的量化信噪比控制在 35 到 60 dB,RawBoost 窄带适配到 8 kHz 与 4 kHz 上限,联合时 RawBoost 概率 0.5,顺序用先下采样后增强。
代码与数据状态按本次官方像素交代:RawBoost 仓库与评测用多说话人代码仓库以及溯源数据集链接本次确认可用,可用于搭管线;Twilio 接口文档本次确认可用,用于理解真实电话链路;说话人分析用的第三方模型库本次未能确认可达,若要复刻逐类多样性分析,需替换为本地可运行的说话人嵌入并说明口径差异。先跑干净宽带与干净窄带基线,再跑跨条件表,最后再加增强与 G711 仿真并始终把电话留作未见测试,这样才能复述论文的最强证据。
何时值得尝试,还需补哪项验证?
当部署场景是电话客服、语音风控或举报热线,且只能拿到干净合成数据时,值得尝试论文的可部署组合:干净窄带加随机量化加 RawBoost 再混入 G711 仿真,电话测试保持未见。这组策略在论文中把未见电话 EERc 从 24.7% 降到 15.1%,且超越了直接用电话训练的 18.9%,是明确的省采数路径。若场景仍是宽带为主,则用宽带版量化加 RawBoost 去对付未见 Opus,但要接受干净宽带小幅上升的代价。
还需补的验证有三项。第一是换主干与换打分,例如把 Softmax 能量换成其他分布外分数,看电话下的排序是否稳定。第二是增加已知类数量与每类样本量,检验论文提出的改善未知拒绝的直觉。第三是在二分类检测与真实丢包回声更重的电话上复测增强,确认溯源上的收益能否迁移。常见误解是把带宽当成主因,论文的分解显示编码与真实信道累积才是大头;另一个误解是增强越重越好,论文显示对已过编码的数据再加增强会变差,增强只应加在干净侧。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

