英文题目:Deepfake Word Detection by Next-token Prediction using Fine-tuned Whisper
会议身份:
conference:interspeech:2026:conference-paper-id:tran26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#SFT #语音 #语音识别 #音频深度伪造检测
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Hoan My Tran:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Wanying Ge:机构信息未能从会议 PDF 纯文本可靠映射
- Xuechen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Junichi Yamagishi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为个别词被替换为合成语音的部分伪造话语,要求同时输出完整转写文本与每个词的真假判定,难点在于篡改片段短且与真实上下文衔接自然,传统整句二分类无法定位。该方法先用WhisperX获得词级对齐并构造含标记的训练文本对,再对选中词做声码器复制合成并用交叠相加回贴以保证边界平滑,随后在被选词前后插入复用词元构成扩展序列,最后对Whisper Large v3整体微调以联合预测文本与标记,解码时解析标记对判定合成词。相比增加分类头与多任务损失的定位方案,该方法无需改动架构与训练算法,将检测转化为语言建模问题,可直接复用现有识别系统。在E.TTS测试集下,Ft.TTS微调Whisper的WER为2.20%,低于预训练Whisper的WER 8.13%。其适用边界受限于训练与测试在领域和合成方式上匹配,跨合成器与跨域时检测与转写均显著退化,声码器数据未能弥合真实生成模型的差异。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/RVC-Boss/GPT-SoVITS — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/jitsi/jiwer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,先做什么复述准备?
这篇解读的对象是刚进入语音与音频方向的研究生,输入是论文正文与两张官方原图,目标是把方法讲到能复述和能核对。阅读前要先固定三件事。第一,任务不是整句真假二分类,而是部分伪造定位:输入是一句话的波形,其中一到多个词被换成合成语音,输出既要给出转写文本,又要指出哪几个词是合成的。第二,必须保留的信息是实验条件:微调用了什么数据、测试是否同域同合成器、指标是词错误率与词级误接受和误拒绝。第三,输出形式是转写文本中用 1 对标记包住合成词,推理不增加额外分类头。
按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算,然后讲训练数据构造与推理,接着讲实验条件、结果与反证,最后讲复现与收束。文中例子会明确标为例子,不把例子当成论文报告的数值。术语第一次出现会先用白话解释,再给英文名,后文简称固定。判断用词区分 3 层:论文直接给出数字的写报告或显示,数字支持的机制解释写支持,没有证据的猜测写可能或待验证。
部分伪造定位与整句检测有何不同,既有路线怎么走?
整句检测只对一句话给出一个真或假的分数,做法相对简单。部分伪造定位要求对句子内部给出词级或帧级序列判断,哪个片段是合成的都要标出来,因此需要序列分类能力。论文提到的一种已有思路是从二分类深伪检测模型抽出序列隐特征,再经过循环层、边界匹配图或注意力来做定位,这类做法需要完整走一遍数据整理、模型设计、训练与调参,上线时还要多存一个专用检测模型。
另一类背景是整句检测的数据构造经验:用神经声码器做拷贝合成可以高效产生带痕迹的训练数据。论文把这个经验借用到词级任务,但做了关键区分:这里不是整句重合成,而是只对随机选出的词段提取声学特征再重合成,然后贴回原句。理解这点才能明白后文声码微调数据为何被当作低成本替代,而不是与真实文本转语音系统等同。论文还提到语音编辑系统的例子,例如把原句中的词换成语义不同的合成词,这类篡改痕迹更不明显,也是后文域外测试要覆盖的难点。
要解决的问题如何形式化,评测口径是什么?
形式化上,输入是采样点序列,长度为采样点总数,每个点是幅度值。白话说就是一段波形。自动语音识别的目标是把它变成词元序列,每个词元通常对应子词文本单元,来自预先定义的分词词表。合成词检测的目标是把同一输入变成与词元对齐的真假标签序列,每个位置属于真或假。朴素做法是给模型再加一个分类头,同时输出文本与标签,但这会改结构并引入识别损失与检测损失的权重等超参数。
论文把问题改写为单一的下一词预测任务。训练时若某个词元属于合成词,就在它前后插入开始标记与结束标记,记为 <TOF> 与 <EOF>,得到新的目标词元序列。微调就用波形与新序列配对,不改模型结构与微调算法。推理与原来相同,逐词元生成,凡是落在成对标记之间的词就判为合成。评测口径分两层。
转写用词错误率,计算前先去掉输出与真值中的前后标记。检测用词级误接受率与误拒绝率:前者是合成词中被判为真词的比例,后者是真词中被判为合成词的比例。即使词面识别错了,只要真假判对就不计为检测错误。专用基线为了公平比较也被转成词级硬判决:把与该词对齐的帧级真假概率平均,再比较大小。
方法全景:一个样本如何从波形走到带标记文本?
先沿一个样本走完全程。假设输入是真人说的我的课本,其中课本这个词段被声码器重合成后贴回,形成部分伪造音频。构造训练目标时,原文本对应的词元序列中,课本前后被加上前后标记。微调时模型看到的是伪造波形,学的是生成带标记的文本。推理时输入另一句部分伪造音频,例如 This is a good example 其中 good 是合成词,模型逐词元生成并在 good 前后输出前后标记,读到标记就能同时得到转写与定位。
下图是论文给出的流程示意,左下是数据构造,右上是推理,中间是声码训练数据,箭头把两者连成闭环,读图时注意标记只出现在文本侧,音频侧的合成段是待检对象。
自动语音识别 × 合成词检测: 自动语音识别负责把波形转成词序列,合成词检测负责判断每个词是真人说的还是合成的,二者搭配的理由是共用同一解码过程,把检测变成转写时顺带输出前后标记,从而新增的作用是不加分类头和多任务权重就能在一个模型里同时给出文本和词级真假。
看图路径: 1. 先看右下输入波形中被浅色标出的合成词段,再看右上输出文本中对应词如何被前后标记包住;2. 再看左下从原始文本经声码器到加标记词元与声码训练数据的箭头走向;3. 确认虚线表示声码训练数据用于微调 Whisper,实线表示推理时音频进 Whisper 直接出带标记文本
论文图 1。原论文 Figure 1:“Illustration of fine-tuned Whisper for speech-to-text transcription and synthetic word detection. <TOF> and <EOF> denote tokens surrounding synthetic word.”。
这张图左侧画出原始波形经声码器只重合成被选词段,再与加标记的词元一起存成声码训练数据,右侧画出带合成词的测试音频进入 Whisper 后直接输出带前后标记的文本。虚线表示训练数据的流向,实线表示推理的数据流向。图中用浅色块同时标出音频中的合成段与文本中的被标记词,直观对应了词级对齐的监督来源。教学上要记住:标记是文本符号,不提供音频时间戳,定位精度依赖模型学到的音频与词元对应关系。
前后标记与词表复用:改了什么,没改什么?
关键组件是前后标记的选择与复用。白话说,模型要在文本流中凭空多出两个符号来表示假词从哪里开始到哪里结束。论文没有向词表新增词元,也就没有新增嵌入向量,而是复用词表中不太可能用于识别任务的两个现成词元来充当开始与结束标记。原文写的是感叹号串与波浪线串作为二者的具体实现。其他复用选择也可能成立,但论文只验证了这一组。
下一词预测 × 前后标记: 下一词预测是 Whisper 逐个生成词元的原有机制,前后标记是包住合成词的 <TOF> 与 <EOF>,搭配理由是检测标签被改写成文本流中的普通词元,组合意义是训练与推理都不改结构和算法,只改微调数据的词元序列就能让模型在转写中直接标出假词位置。
没改的部分同样重要:编码器解码器结构不变,微调算法不变,推理流程不变。这样做的好处是部署时不需要额外检测模型与额外计算分支,代价是检测只能做硬判决,不能像专用检测器那样直接输出连续分数再调阈值。复述时不要把前后标记说成时间戳或帧标签,它们是词元级符号,后续评测需要借助对齐工具把词与音频对应起来才能算误接受与误拒绝。论文用 WhisperX 做词级对齐,用 JIWER 做转写与对齐,这是复现时必须对齐的工具链。
训练与数据构造:声码词怎么做,模型参数怎么动?
训练分两条数据线。第一条是声码微调数据,记为 Ft.Voc。它基于多语言有声书数据,每种语言随机选两千一百句,覆盖英语、意大利语、德语、法语和西班牙语。每句随机选 1 到 5 个词,用 WhisperX 先拿到词级对齐,再对这些词段做拷贝合成:提梅尔谱等声学特征,用声码器重合成波形,再用交叠相加算法贴回原句以保证真假交界平滑。声码器共 6 种,前 4 种基于深度网络,后两种基于信号处理,包括 HiFi-GAN、WaveGlow 等与 WORLD、Griffin-Lim。
若某句因基频提取失败等原因无法重合成则丢弃,最终约六万句。验证集另取每语言三百句同样构造。
第二条是语音合成微调数据,记为 Ft.TTS,取自 LlamaPartialSpoof 语料,随机抽与声码集相同数量的句子,合成词来自 6 种文本转语音系统。第三种是二者各半混合,记为 Ft.V+T。模型用预训练 Large 第三版 Whisper,微调时更新整个模型,学习率与批量大小按原文设置,训练 5 个轮次并用验证集选最优检查点。论文说明尝试过低秩适配但未见提升,因此主结果是全量微调。
拷贝合成 × 声码器伪造词: 拷贝合成指从原句提声学特征再重合成对应词段并贴回原波形,声码器伪造词指这样得到的模拟假词,分工是前者提供低成本构造流程、后者提供训练用的假词样本,搭配理由是不需要额外文本或源音频就能保留音色并引入类似合成的痕迹,组合意义是降低为每种 TTS 收集数据的成本。
专用基线是 ResNet152,输入是与 Whisper 前端相同设置的梅尔谱,约每 16 毫秒输出一个检测分数,训练标签按真值时间对齐每 16 毫秒给真或假,用二元交叉熵训练最多 30 轮,同样用验证集选优。理解这条基线才能公平看后文对比:它是帧级分数平均到词级再硬判决,而 Whisper 是直接生成带标记文本再按标记判词。
实验条件:测什么数据,与谁比,指标方向如何?
测试分 4 组。E.Voc 与微调声码集同流程构造且句子不重叠,用于测声码词。E.TTS 取自同一伪造语料的三千句且与训练不重叠,用于测同域文本转语音词。E.AV1M 取自音视频伪造数据集验证集的子集,合成词来自两套语音合成系统,来源是 YouTube,属于域外。E.PE 取自 PartialEdit 子集,合成词来自两个基于大语言模型的语音编辑系统,来源是录音室,属于域外。论文的表格还列出语言、领域与生成器,域内两组是 Audiobook,域外两组分别是 Youtube 与 Studio 录音。
比较对象是微调 Whisper 自身的不同数据源版本、预训练 Whisper 的转写,以及专用 ResNet 的检测。指标方向是越低越好:词错误率越低转写越准,误接受率越低漏检越少,误拒绝率越低误报越少。资源状态方面,论文引用的第三方链接本次核查为可用,包括语音合成界面仓库与评测工具仓库,但这只说明链接当前可达,不代表论文代码权重可运行。论文正文声明了检测代码仓库地址,复现时应以该地址实际可达为准。
下表整理训练与基线的运行配置,读表时注意规模、优化与帧率是不同维度的量,不能互相推导延迟。
| 配置项 | 数据规模 | 学习率 | 批量大小 | 检测帧率 |
|---|---|---|---|---|
| 声码微调与基线训练 | 约 60k 句 | 1e-5 | 8 | 每 16 ms 1 分 |
| 训练轮次与选优 | 5 轮选优 | 全量更新 | 单卡 H100 | 验证集选优 |
上表说明低成本主要来自数据构造与免新模型:声码集约六万句由每语言两千一百句乘五语言乘六声码器量级得到,微调全量更新而非只训小适配器,批量大小受单卡显存限制,基线约每 16 毫秒给 1 分。代价是全量微调仍需大模型算力,且训练 5 轮的绝对耗时原文未报告,不能从批量大小推定训练成本已很低。
同域匹配时转写与检测各得到什么,代价是什么?
先看声码训练测声码的匹配条件。问题是同为有声书且合成器集合相同时,微调 Whisper 能否同时做好转写与检测。公平条件是训练与测试句子不重叠,指标方向都是越低越好。下表是该条件下的关键数字,基线是预训练 Whisper 的转写与专用 ResNet 的检测。
| 条件 | 指标 | 预训练 Whisper | 本方法 Ft.Voc | 比较对象 ResNet |
|---|---|---|---|---|
| E.Voc 同域声码 | 词错误率 | 23.89% | 0.87% | 未报告转写 |
| E.Voc 同域声码 | 误接受率 | 未适用 | 7.22% | 7.15% |
| E.Voc 同域声码 | 误拒绝率 | 未适用 | 0.52% | 3.81% |
上表显示,微调后词错误率从 20% 以上降到 1% 以下,报告支持同域微调大幅改善有声书转写。检测上误接受率与 ResNet 接近,误拒绝率更低,支持在匹配条件下附加检测功能与专用模型相当。但不能把转写提升完全归因于检测能力,其中一部分来自从通用预训练到有声书域的适配。论文还给出例子标为例子:真值中多个词被标记为合成,微调模型能完整复现标记;另 1 例中合成词被误识别为相近词形但仍被正确包住标记,说明检测正确不要求词面完全正确。
再看合成训练测合成的匹配条件。问题相同,只是合成器换成文本转语音集合。下表是对应数字。
| 条件 | 指标 | 预训练 Whisper | 本方法 Ft.TTS | 比较对象 ResNet |
|---|---|---|---|---|
| E.TTS 同域合成 | 词错误率 | 8.13% | 2.20% | 未报告转写 |
| E.TTS 同域合成 | 误接受率 | 未适用 | 1.38% | 0.15% |
| E.TTS 同域合成 | 误拒绝率 | 未适用 | 1.79% | 3.13% |
上表显示,同域合成条件下微调同样降低词错误率,检测两项错误率都保持低位,与 ResNet 处于同一量级。论文报告显示这种相当关系,但未胜出项也要看到:在误接受率上 ResNet 更低,在误拒绝率上微调 Whisper 更低,二者各有代价,不能只取一端宣布全面胜出。
误接受率 × 误拒绝率: 误接受率统计合成词中被判为真词的比例,误拒绝率统计真词中被判为合成词的比例,二者必须成对看的原因是只看一端会掩盖把所有词判真或判假的偏置,组合意义是能区分漏检与误报两种不同代价的错误方向。
域外编辑与跨数据集测试退化到什么程度?
域外问题是换到 YouTube 与录音室及未见编辑系统后,微调是否还可用。论文报告在 E.AV1M 与 E.PE 上微调 Whisper 与 ResNet 都退化。即使合成器在训练中出现过,例如 YourTTS 与 VITS 被训练覆盖,跨数据集后两者仍在 E.AV1M 上变差,支持论文的判断:理解数据集间差异可能比加复杂结构更重要。
在 E.PE 上,用声码或合成数据微调都出现转写词错误率高于预期,检测不稳定,例如声码训练测编辑数据时误拒绝率较低但误接受率很高,意味着大量假词被漏过。混合训练 Ft.V+T 在部分域外指标上有所折中,但没有稳定地解决泛化。重提结果时要增加适用条件:同域同合成器时可尝试该方法做转写附带检测,域外或未见编辑系统时不应直接部署,必须补跨域验证。由于原文域外表格的连续原句证据不足,这里不硬列每格数字,只转述退化方向与不稳定,具体数值以原文表格为准。
交叉合成器与词长、语言如何影响错误,失败条件是什么?
论文做了同域但交叉合成器的反证。问题是训练用声码、测试用合成,或反过来,会发生什么。结果显示性能不同程度退化。用合成数据训练再测声码时,误拒绝率可高达 80% 以上;用声码训练再测合成时,误接受率可高达 70% 以上。这说明模型对训练见过的痕迹敏感,换痕迹后要么大量真词被误报,要么大量假词被漏检。
按词长分组的分析进一步定位失败条件。在声码测试上,用合成训练的模型误拒绝率几乎不随词长下降,长期处于高位,而用声码训练的模型误拒绝率贴近零。论文按语言分解发现,用合成训练再测声码时,英语的误接受与误拒绝都在 40% 以上,其他语言误接受与声码训练相近但误拒绝接近 90%,支持退化主要来自未见语言,而不只是未见声码器。在合成测试上,用声码训练的模型误接受率不随词长下降而长期高企,说明它难以发现文本转语音词。
同时两种训练的误拒绝率都随词变长而上升,论文提出一种待验证解释:模型似乎只有在词内找不到痕迹才判真,词越长越可能含有类似痕迹的模式。
下图把上述趋势画成按词长的错误率曲线,上面板是声码测试,下面板是合成测试,灰色柱是词数量,黑色与红色区分训练数据源,读图时先分清实虚线再看升降。
看图路径: 1. 先对照图例确认黑色为 Ft.Voc 微调、红色为 Ft.TTS 微调,实线为误接受率、虚线为误拒绝率;2. 再看上面板 E.Voc 中红色虚线长期处于高位而黑色虚线贴近零的分离;3. 最后看下面板 E.TTS 中黑色实线长期高企与词变长后两条虚线同步上扬的趋势
论文图 2。原论文 Figure 2:“Analysis of synthetic-word detection error rates based on word duration. Black and red profiles correspond to fine- tuned Whisper using Ft.Voc and Ft.TTS, respectively.”。
这张图上面板中红色虚线代表合成训练在声码测试上的误拒绝率,长期处于高位,黑色虚线代表声码训练的误拒绝率贴近横轴;下面板中黑色实线代表声码训练在合成测试上的误接受率长期高企,两条虚线在词变长后同步上扬。像素能辨别的是趋势与相对高低,不能读出每点的精确数值,原文补充说明应明确归因。总体判断是交叉条件不可靠,声码数据没有自动带来跨合成器泛化。
哪些边界未评测,哪些推测尚未验证?
先明确未评测边界。论文没有报告推理延迟、实时率与额外存储之外的运行成本,也没有测量阈值可调下的检测均衡点,因为 Whisper 输出是硬标记而 ResNet 被强制硬判决,缺少分数级曲线对比。训练资源的绝对时间、显存峰值与多语言比例的消融也没有完整报告,不能从批量大小与轮次推定总体预算。长音频、多假词密度、重叠说话等条件同样未覆盖。
再区分已验证与待验证。已验证的是匹配条件下转写不退化且检测与专用基线相当,以及交叉合成器与跨语言时退化方向。待验证的是词长效应的机制解释,即词越长越可能含类似痕迹因而被误报,这只是论文提出的假设。声码器种类增加能否改善跨合成器检测也被留作未来工作。
域内评测 × 域外评测: 域内评测指微调与测试同为有声书且合成器集合相同,域外评测指测试换成 YouTube 或录音室及未见语音编辑系统,分工是前者验证方法在匹配条件下是否成立、后者检验泛化,搭配比较的意义是把性能下降归因到合成器差异还是数据域差异。
域外退化 calling 的是泛化策略,不是简单换更大模型就能解决。论文结论明确说声码训练数据没有缓解来自不同域或未见合成器的退化,未来需要研究更多样合成器与多域的声码数据。阅读时不要把相关性当因果:误拒绝随词长上升可能与词频、语言模型先验或对齐误差有关,在没有控制实验前只能写可能。
复现先做什么,需要哪些数据、工具与超参数?
复现先做数据与评测链,再做微调。第一步准备有声书多语言数据,按每语言两千一百句抽取,每句随机选 1 到 5 个词,用 WhisperX 拿词级对齐,对选中词段提声学特征并用 6 种声码器重合成,再用交叠相加贴回,失败句子丢弃。验证集另取每语言三百句。合成线用 LlamaPartialSpoof 同量抽取,混合线各半随机采样。第二步固定评测:转写前去掉前后标记再用 JIWER 算词错误率,词级检测用 JIWER 对齐后算误接受与误拒绝,基线 ResNet 把词内帧概率平均再硬判决。
超参数按原文保留:预训练 Large 第三版 Whisper 全量微调,学习率十万分之一,批量大小八,训练 5 轮并用验证集选优。专用基线用梅尔谱输入,约每 16 毫秒 1 分,二元交叉熵最多 30 轮。代码方面,论文给出检测仓库地址,第三方工具包括语音合成界面与评测工具链接本次可达,但可用不等于权重可下载或一键可运行,运行时要核对环境与权重版本。常见误解是把前后标记当成新增词表,最省事的核对动作是检查分词器是否新增嵌入,若复用现成符号则嵌入维度不应变化。
何时值得尝试,何时不应照搬,还需补哪项验证?
当系统里已有 Whisper 做转写,又希望顺带标出可疑词,且数据域与合成器可控时值得尝试。这种场景下该方法的价值是改动最小:只改微调文本加标记,不改结构与算法,不额外部署检测模型,同域上能同时给出可用转写与词级标记。当测试涉及未见语言、未见文本转语音或大语言模型语音编辑,或音频来源从有声书换到 YouTube 与录音室时不应照搬,因为论文显示此时漏检或误报会大幅上升。
还需补的验证至少三项。一是跨域与跨合成器的系统性划分,固定文本内容只换合成器,或固定合成器只换领域,才能把退化归因说清。二是分数级评测,若能让模型输出标记置信或结合声学分数,就能画出阈值曲线并与基线公平比较。三是成本与延迟实测,包括微调耗时、推理增量与长音频行为。记住核心矛盾:把检测并入下一词预测换来了低成本与易部署,但也失去了可调阈值与帧级精度的灵活性,泛化仍是主要代价。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

