英文题目:ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
会议身份:
conference:interspeech:2026:conference-paper-id:mahapatra26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多任务学习 #韵律 #语音 #音频深度伪造检测
评分:8.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Aurosweta Mahapatra:机构信息未能从会议 PDF 纯文本可靠映射
- Ismail Rasim Ulgen:机构信息未能从会议 PDF 纯文本可靠映射
- Kong Aik Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Andrews:机构信息未能从会议 PDF 纯文本可靠映射
- Berrak Sisman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音深度伪造检测(Speech Deepfake Detection,SDD)需判断输入为真实人声还是文本到语音(Text-to-Speech,TTS)与语音转换(Voice Conversion,VC)合成,难点是现代富有表现力合成已高度自然且情感韵律严重外推,致使仅依赖伪造伪影的分类器极易失效。ProSDD先基于基频、浊音活动与能量构造说话人条件韵律目标并以掩码对比预测从纯真实语音中学习自然韵律变异,然后以该阶段权重初始化伪造判别训练并保留韵律预测作为辅助正则,推理仅用主干与轻量分类头输出真伪。与把韵律或情感特征拼入分类器的做法不同,该方法直接用监督掩码目标结构化自监督学习(Self-Supervised Learning,SSL)主干的上下文表示,从而以内化真实韵律为基准感知合成偏差并提升跨域鲁棒性。在ASVspoof 2024测试集上将等错误率(Equal Error Rate,EER)从25.43%降至16.14%,在ASVspoof 2024训练下从39.62%降至7.38%。结论适用于情感与表现力偏移及TTS与VC之间的跨攻击泛化,但对通道退化、多语言与未知高自然度系统的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://prosdd.github.io/ProSDD_website/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么情感让检测变难?
这篇论文研究的是语音伪造检测。输入是一段语音波形,输出是一个二分类判断:这段语音是真实人声,还是由文本转语音或声音转换系统合成的伪造语音。初学者可以把任务理解为安检,每来一段音频,系统要给出真或假的结论,常用指标是等错误率,数值越低表示把真判假和把假判真两类错误同时压得越低。
论文首先交代的标准场景是 ASVspoof 系列基准,系统在这些基准上已经表现很好。但难点在富有表现力和情感的攻击上。现代合成系统能生成很自然、很像目标说话人、带有情绪起伏的语音,训练分布之外的情感语音会让已有系统性能明显下滑。论文引用了两方面的观察:一是现有检测器在不同情感下表现不一致,可能被针对性攻击利用;二是人类听众并不是见过所有伪造才学会辨别,而是先内化了真实语音中自然的韵律和说话人模式,再把合成语音听成对这种结构的偏离。
论文的目标就是把这种直觉变成可训练的方法:先让模型学好真实语音的韵律变化,再学真假边界。需要保留的关键信息是,论文不主张只加大分类器复杂度,而是主张丰富自监督主干本身的表示。输出上论文承诺公开实现,资源状态显示代码链接当前可用,这为后续复现提供了入口,但代码可用不等于权重和完整运行环境都开箱即用。
已有路线做了什么,为什么还缺一块?
按输入、目标和监督方式可以把相关工作分成 3 条路线。第一条是端到端波形模型和手工谱特征加分类器,例如 RawNet2 和 AASIST 等,它们直接从波形或谱图学真假边界,在标准基准上很强,但论文指出它们对情感和富有表现力的合成语音鲁棒性有限。
第二条是自监督学习主干加分类器,例如基于 XLS-R 的系统。白话说,自监督学习主干就是先在大量无标注语音上做掩蔽预测预训练,学会上下文表示,再在伪造数据上微调加一个分类头。这类系统是当前主流,因为预训练带来了通用语音建模能力。但微调通常只用真假分类目标,且训练集里伪造样本占主导,容易学到数据集特有的伪造痕迹,而不是可迁移的自然语音线索。
第 3 条是引入情感或韵律线索的工作,例如用语音情感识别特征做辅助输入,或者用基频、浊音与清音模式、说话人嵌入融合。论文对这条路线的判断是,它们多把韵律或情感特征放在分类器输入端做拼接或融合,而不是直接去约束和丰富主干的表示,也没有系统地建模跨说话人和 utterance 内的时间韵律变化。所以缺的一块是把说话人条件的韵律变化作为监督信号,通过有监督的掩蔽预测直接塑造主干,再保留该目标做辅助任务。理解这个定位很重要,后面 2 阶段设计的每一步都是为了补这块,而不是重复做一个更大的分类器。
论文把泛化失败归因于哪两个训练范式问题?
论文明确提出了两个关键限制。第一个是训练目标的偏差。尽管系统用了预训练表示,下游微调往往只靠分类损失,在以伪造样本为主的数据集上优化。这会鼓励模型记住伪造和数据集特有的细微痕迹,而不是理解真实语音中可迁移的结构。一旦遇到新的合成器、新的情感风格或新的信道,这些痕迹就失效了。
第二个是合成语音本身的特点与人类感知的错位。现代合成语音整体很自然,但在韵律上仍有细微不一致,例如基频走向、能量起伏和浊音活动与自然说话习惯不完全吻合。人类正是利用对自然韵律变异性的内化来察觉这种不一致。论文据此提出假设:把这种感知线索建模进模型可以改善泛化。具体做法是围绕基频、浊音活动和能量来构造说话人条件的韵律变化,并用掩蔽预测让模型先学会它。
这里要区分论文直接报告的现象和假设:性能随情感变化、富有表现力攻击更难,这些是引用的已有发现;用韵律建模改善泛化是本文要验证的假设,需要靠后面的对照实验支持,不能当成已证明的结论直接接受。
两阶段框架如何组织:先学什么,再联合学什么?
ProSDD 的全景可以沿着一个样本走一遍来理解。输入是一段固定时长的语音波形,先经过卷积编码器和投影得到潜表示,再经过 Transformer 得到上下文嵌入。第 1 阶段只用真实语音,不见任何伪造样本。做法是把潜表示做跨度掩蔽,让 Transformer 基于上下文去预测被遮住位置的说话人条件韵律目标,用对比损失训练主干和一个线性映射层。这个阶段的目标是内化自然韵律变异性。
第二阶段用第 1 阶段的权重初始化主干,训练数据换成真实加伪造。每个训练步骤做 2 次前向:1 次是掩蔽前向,计算同样的韵律掩蔽预测损失,作为辅助监督;另 1 次是非掩蔽前向,把 Transformer 输出做时间平均池化,再送入轻量分类头计算真假分类损失。2 次前向之后做 1 次参数更新。推理时只用主干加分类头,不需要韵律目标和掩蔽分支。
这样的安排理由在原文写得很清楚:分开掩蔽和非掩蔽两遍,可以防止分类器在训练早期依赖被部分重建的表示;轻量分类头是为了证明增益来自表示本身,而不是复杂的池化或图注意力结构。
下面这张图把左右两路并排放出,左边是真实数据的第 1 个阶段,右边是双路联合的第二阶段,值得对照着看图中掩蔽块、双通路和顶部损失的连接关系。
看图路径: 1. 先沿底部波形经编码器到 Transformer 再到顶部损失的主路径看数据流向;2. 对比左图只用真实数据的单路掩蔽结构与右图真实加伪造数据的双路结构;3. 找到右图中分类分支的均值池化与掩蔽分支的线性映射分别接在 Transformer 的哪一侧;4. 确认顶部总损失把分类损失和第二阶段掩蔽损失汇合为一次权重更新
论文图 1。原论文 Figure 1:“Two-stage training framework of ProSDD.”。
从像素可见,左面板底部标注只用真实数据,波形经编码器后出现一段被涂黑的掩蔽块,上方是多层 Transformer,顶部经线性层后指向粉色对比损失框,再向上连接到虚线框内的说话人条件韵律目标,其中区分了正样本与同说话人不同韵律、不同说话人同韵律两类负样本。
右面板底部标注真实加伪造数据,同一编码器分出蓝色分类通路和紫色掩蔽通路,分类通路经均值池化和两层线性层输出真假判断,掩蔽通路经线性层后指向同样的韵律目标,顶部总损失把两项加权求和后用一个向下的箭头表示 1 次权重更新,主干明确标注由第 1 阶段初始化。读图时不要把颜色深浅当成性能高低,它只区分分支和数据类型;也不要把顶部损失框的大小理解为权重大小,真正的加权系数在正文另有说明。
韵律目标怎么做:身份和变化如何拼成一个监督信号?
这一节讲监督信号的构造。白话说,韵律就是说话的腔调起伏,包括音高怎么走、哪里浊音哪里清音、能量哪里强哪里弱。英文对应 prosody。说话人嵌入就是一段向量,代表这是谁的声音,文中用预训练的 ECAPA-TDNN 提取 192 维 utterance 级嵌入,再把同一说话人的所有 utterance 嵌入平均并做归一化,得到每个说话人唯一的向量。韵律嵌入是帧级别的向量,文中用引用的韵律编码器融合基频、浊音活动和能量,得到每帧 256 维。
构造时对一个有 T 帧的 utterance,把说话人向量在每 1 帧重复,再和该帧韵律向量拼接,得到每帧 448 维的目标序列。重复的意义是让每个掩蔽位置的预测都同时对身份和局部韵律负责。训练时对掩蔽帧定义正样本为同一说话人加当前帧真实韵律,负样本分两类:一类是同说话人但取同一 utterance 内其他时刻的韵律,用来逼模型分辨时间变化;另一类是不同说话人但取相同韵律帧,用来逼模型分辨身份。每掩蔽帧采样 100 个负样本,两类各半,用余弦相似度和温度系数的对比损失做优化。温度在第 1 阶段设为 0.07。
自监督学习主干 × 韵律监督: 自监督学习主干的分工是把波形变成上下文语音表示,提供通用的语音建模能力;韵律监督的分工是规定被掩蔽位置应该恢复什么样的说话人与韵律组合。二者搭配的理由是只用真假分类微调会让主干记住伪造痕迹,而韵律监督把表示空间拉回到自然韵律结构上,组合意义是让同一套主干参数既表达内容又保留可用于辨别合成韵律不一致性的结构。
说话人嵌入 × 韵律嵌入: 说话人嵌入的分工是给出 utterance 级别的身份锚点,文中用预训练 ECAPA-TDNN 提取后按说话人平均并做归一化;韵律嵌入的分工是给出帧级别的基频、浊音活动和能量变化,文中用韵律编码器逐帧提取。二者搭配的理由是同一句话由不同人说韵律不同、同一人不同时刻韵律也不同,必须把身份和局部变化拼在一起才能定义合理组合,组合意义是拼接成高维目标后对比学习可以同时惩罚配错身份和配错韵律的情况。
需要提醒的是,原文没有给出韵律编码器本身的训练细节和全部超参数,只说明遵循已有工作并固定输出 200 帧以匹配主干预测 token 数。复述时不应脑补该编码器的结构,只能把它当作已有的特征提取器。
两遍前向如何执行:掩蔽、分类与加权何时发生?
训练过程分两个阶段执行。第 1 阶段只用真实语音,掩蔽采用跨度掩蔽,掩蔽块长度为 8,掩蔽概率为 0.25。潜表示被掩蔽后送入 Transformer,输出经线性层映射到 448 维,再与上面构造的目标做对比。这 1 阶段更新主干和映射层,目的是得到懂韵律的初始化。
第二阶段把主干换成第 1 阶段权重,数据换成 ASVspoof 的真实加伪造。掩蔽概率降为 0.15,温度改为 0.1。总损失是分类损失加掩蔽损失的加权和,分类是加权交叉熵。系数设置为前 4 个轮次韵律权重为 0.2,之后降为 0.05,分类权重始终为 1。原文的安排理由是先让韵律监督起较大作用稳住表示,再让分类占主导,把韵律项当作正则项。
学习率采用分层设置:主干很小,映射层较大,分类头居中,并使用权重衰减。两个阶段都训练 50 轮,批量大小为 64,每段截为固定 4 秒。第二阶段还使用了 RawBoost 方法 3 做增强,对照的 XLSR-SLS 也用相同增强以保证公平。模型选择上,2019 训练时按训练损失选模型,因为开发集没有引入新的攻击变化;2024 训练时按验证准确率选,因为开发集包含未见攻击类型。推理时只走非掩蔽分类通路。
掩蔽预测 × 伪造分类: 掩蔽预测的分工是在遮住部分潜表示后要求模型恢复说话人条件韵律目标,它只关心自然语音内部是否自洽;伪造分类的分工是看完整语音后判断真实还是伪造,它关心真假边界。二者搭配的理由是如果只做分类模型容易走捷径记住训练集伪造痕迹,保留掩蔽预测相当于在学边界时不忘掉自然韵律结构,组合意义是在第二阶段用加权总损失同时优化两项,使分类器建立在更具迁移性的表示上。
理解梯度路径时注意,掩蔽分支的梯度会回传到主干和映射层,分类分支的梯度回传到主干和分类头,主干同时收到两路梯度,这正是联合优化的含义。未报告的缺项要明确指出:原文没有给出优化器类型和学习率调度曲线的完整描述,也没有报告每轮耗时和显存占用,因此不能从模型名字推定训练成本。
在什么数据和基线上测,用什么指标比较才公平?
实验按 3 组数据组织。训练数据分两类:第 1 阶段只用 LibriSpeech 的 train-clean-100 和开发集中的真实语音;第二阶段用 ASVspoof 2019 LA 的训练和开发集,或者 ASVspoof 2024 的训练和开发集,分两种训练设置分别报告。传统基准是 ASVspoof 2019 LA 和 2021 LA,用于检验分布内和信道变化下的表现。
情感和富有表现力基准是 EmoFake、EmoSpoof-TTS(表中简写为 EmoSpoof)和 ASVspoof 2024 第一轨,其中 2024 包含多种现代富有表现力的合成系统。所有实验遵循各数据集官方的训练、开发和评测划分。基线选择了广泛使用且公开可得的系统:端到端的 RawNet2、AASIST,以及基于自监督的 XLSR-SLS。在 2019 训练设置下,RawNet2 和 AASIST 用官方预训练检查点,XLSR-SLS 按原文协议训练;在 2024 训练设置下,所有基线都从头按发表协议训练。
指标统一用等错误率,数值越低越好。比较公平性上,论文在第二阶段对 ProSDD 和 XLSR-SLS 使用了相同的 RawBoost 增强,避免把数据增强的增益误算成方法增益。论文特有的细节有两类值得初学者注意:一是 2024 训练只用文本转语音样本,而 EmoFake 只含声音转换攻击,这种跨攻击类型错位是故意保留的难度,用来检验泛化;二是固定 4 秒输入和固定 200 帧韵律目标的对齐方式,这决定了复现时必须做同样的切分和填充,否则掩蔽位置和目标帧会对不齐。
主结果:在保住标准基准的同时情感集降了多少?
比较的问题是,在同样的训练数据和同样的等错误率指标下,韵律增强的主干是否比最强的自监督基线更好。下面先看在 ASVspoof 2019 LA 上训练时的表现,表头单位为百分比等错误率,数据格为原文裸值,指标方向都是越低越好。
| 训练设置 | 评测集 | RawNet2 | AASIST | XLSR-SLS | ProSDD |
|---|---|---|---|---|---|
| 2019 训练 | 2019 | 4.60 | 0.83 | 0.56 | 0.42 |
| 2019 训练 | 2021 | 8.08 | 8.15 | 3.04 | 3.87 |
| 2019 训练 | 2024 | 40.67 | 35.53 | 25.43 | 16.14 |
| 2019 训练 | EmoFake | 21.71 | 13.64 | 8.84 | 3.70 |
| 2019 训练 | EmoSpoof | 43.04 | 31.06 | 18.92 | 9.54 |
表后解释要同时讲收益和代价。收益是明显的:在 2019 训练下,ProSDD 在 2019 上优于 XLSR-SLS,在 EmoFake 上大幅降低,在 EmoSpoof 上大约减半,在 2024 上也明显降低。代价和反例也要指出:在 2021 上 ProSDD 略差于 XLSR-SLS,说明在该信道变化条件下并没有全面胜出,这是一个未胜出项,不能略去。总体判断是,方法在保持标准基准竞争力的同时改善了情感泛化,但不是每个子集都最优。
情感伪造 × 标准基准: 情感伪造的分工是检验分布外泛化,例子是 EmoFake、EmoSpoof-TTS 和包含现代富有表现力合成系统的 ASVspoof 2024;标准基准的分工是检验分布内没有退化,例子是 ASVspoof 2019 和 2021 LA。二者搭配的理由是只看标准基准会高估系统、只看情感集又可能牺牲常规场景,组合意义是要求方法在两类评估上同时报告,才能判断韵律建模带来的是真正的表示改进还是在某 1 数据集上的过拟合。
需要强调百分点和相对百分比不同:例如从高位降到低位时,下降的百分点数与相对下降比例是两个概念,复述时不要混用两种说法。下面再看换到 2024 训练设置时结论是否还成立,比较问题、公平条件和指标方向与上表一致,数值越低越好。
| 训练设置 | 评测集 | RawNet2 | AASIST | XLSR-SLS | ProSDD |
|---|---|---|---|---|---|
| 2024 训练 | 2019 | 24.75 | 23.16 | 27.00 | 19.04 |
| 2024 训练 | 2021 | 25.59 | 22.74 | 26.54 | 18.08 |
| 2024 训练 | 2024 | 43.61 | 25.77 | 39.62 | 7.38 |
| 2024 训练 | EmoFake | 49.49 | 62.71 | 58.57 | 25.06 |
| 2024 训练 | EmoSpoof | 27.13 | 15.19 | 25.92 | 11.96 |
该表显示,在 2024 训练下 ProSDD 在 2024 测试集上明显优于基线,在 EmoSpoof 和 EmoFake 上也保持优势,尽管训练只见文本转语音而 EmoFake 只含声音转换攻击,仍支持跨攻击泛化的判断。但绝对误差在 EmoFake 上依然较高,不能把相对改善夸大为已解决问题。
增益来自哪一步,拿掉韵律监督后会发生什么?
比较的问题是拿掉掩蔽预测和第 1 阶段真实语音预训练后性能如何变化,条件是同样在 2019 LA 上训练、用等错误率衡量,数值越低越好。下表整理消融对照,表头单位同样为百分比等错误率。
| 训练设置与模型 | 2019 | 2021 | 2024 | EmoFake | EmoSpoof |
|---|---|---|---|---|---|
| 无掩蔽无第 1 个阶段 | 6.78 | 25.18 | 28.12 | 14.02 | 10.02 |
| 无第 1 个阶段 | 5.14 | 7.83 | 15.55 | 6.37 | 15.02 |
| 完整 ProSDD | 0.42 | 3.87 | 16.14 | 3.70 | 9.54 |
表后解释先讲失败条件:同时去掉掩蔽预测和第 1 阶段后,2019 和 2021 上明显退化,说明没有韵律监督时泛化很差;只保留第二阶段掩蔽而去掉第 1 阶段真实语音预训练,部分指标回升但不稳定,例如 EmoSpoof 反而升高,说明仅在分类阶段加辅助任务不够,必须先在真实语音上内化韵律结构。
论文还对比了把韵律线索只给分类器的已有思路,认为直接塑造主干表示是更关键的差异,这属于有限解释,需要更多对照才能确立因果。总体上消融支持第 1 阶段不可省略的判断,但也显示完整模型在个别评测上并非每项最低,总体趋势不等于每组都成立。
哪些边界没有测,哪些结论不能推广?
论文的证据边界需要如实交代。首先,未评测的边界包括多语言、真实野外噪声、压缩信道和对抗攻击下的表现,原文没有报告这些条件,因此不能把富有表现力集上的增益推广到所有分布偏移。
其次,成本类指标缺失:原文没有报告训练时长、参数量变化、推理延迟和显存占用,轻量分类头的描述只说明避免了复杂池化,不能据此承诺推理更快或更便宜。总体趋势不等于每组都成立已经在 2021 的反例中体现,引用时要保留这个反例。
再次,韵律目标依赖外部说话人模型和韵律编码器,如果这些外部模块本身有偏置或在新语言上失效,整体效果可能打折扣,但原文没有做这方面的敏感性分析,属于待验证的环节。最后,情感集上的绝对误差在某些设置下仍然较高,说明方法减轻了问题但没有消除问题。把这些边界讲清楚,恰恰是为了让后续工作知道还需补哪项验证:更细的按情感类别拆分、按合成器拆分,以及统计显著性检验,原文都没有提供,不能自行脑补。
要复现先做什么,需要哪些数据、代码和超参数?
复现可以按学习依赖列一个可执行的清单。数据方面,先准备 LibriSpeech 的 train-clean-100 和开发集真实语音用于第 1 个阶段,再准备 ASVspoof 2019 LA 或 ASVspoof 2024 的官方训练和开发划分用于第二阶段,评测时按官方划分在 2019、2021、EmoFake、EmoSpoof-TTS 和 2024 第一轨上测试。
代码方面,论文给出公开网站链接,本次资源状态显示该链接当前可用,可以下载实现和说明,但要区分代码开源不等于权重可直接下载,也不等于开箱即用的完整系统,实际运行时要核对环境和检查点。实现细节方面,关键超参数包括:输入固定 4 秒,韵律目标固定 200 帧,第 1 阶段掩蔽块长度 8、掩蔽概率 0.25、温度 0.07,第二阶段掩蔽概率 0.15、温度 0.1,总损失中分类权重为 1、韵律权重前 4 轮为 0.2 之后降为 0.05,分层学习率分别为主干、映射层和分类头设置不同量级并使用权重衰减,第二阶段使用 RawBoost 方法 3。
模型选择要按训练设置区分:2019 训练看训练损失,2024 训练看验证准确率。先跑通第 1 阶段的掩蔽预测损失下降,再进入第二阶段联合训练,最后只用主干加分类头做推理,这个顺序不能颠倒。如果复现中发现 2021 或某一情感子集不升反降,应先检查切分长度、目标帧数对齐和增强是否与基线一致,再判断是否为方法本身的波动。
何时值得尝试这个思路,一句话如何带走?
综合所有证据,可以给出一个克制的行动指南。当你的伪造检测系统在标准基准上已经不错,但在情感、风格化或新合成器上掉点很多,且怀疑模型记住了数据集痕迹时,值得尝试 ProSDD 的思路:先在真实语音上用说话人条件韵律目标做掩蔽预训练,再把同一目标当作辅助损失与分类联合优化。
它的适用条件是能获得可靠的说话人嵌入和帧级韵律特征,并且能接受两遍前向带来的额外训练开销。不适合的情况是推理预算极紧且无法承担任何训练改造成本,或者目标场景与韵律关系不大,这时应先补验证再决定。复现时优先保证数据划分、输入时长、目标帧数和增强条件与原文一致,保留 2021 上的反例和 EmoFake 上的较高绝对误差作为对照,避免只报相对降幅。
带走的一句话是:把自然韵律的结构先学进主干,再学真假边界,是本文在富有表现力攻击上获得泛化的关键,而第 1 阶段的真实语音预训练是不可省略的一步。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
