英文题目:J-SPAW2: A Japanese Corpus for Speaker Verification and Anti-Spoofing with Challenging Replay and Speech Synthesis Attacks
会议身份:
conference:odyssey:2026:conference-paper-id:shiota26_odyssey
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集 #数据集构建 #说话人验证 #语音伪造检测
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Sayaka Shiota:机构信息未能从会议 PDF 纯文本可靠映射
- Suzuka Horie:机构信息未能从会议 PDF 纯文本可靠映射
- Sawato Furubayashi:机构信息未能从会议 PDF 纯文本可靠映射
- Shinnosuke Takamichi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为日语真实环境录制的目标语音与非同意录音衍生的攻击语音,输出为说话人验证判决、防欺骗对策判决及其级联风险,难点在于需同时抵御物理接入重放失真与逻辑接入高保真语音克隆的联合威胁。该方法链分三步:先沿用40人多环境真实录音划分评测用真实试验与攻击源语音,再在安静室内系统改变四种播放设备、近距离与远场距离及高低音量重录重放攻击并送入下一阶段评测,然后以短时含噪参考驱动零样本语音合成生成候选并经语音活动检测、识别字错率与UTMOS自然度筛选最优攻击样本后统一级联评测。与前作固定重放和较弱合成相比,该设计以低信噪比远场重放暴露对策模型脆弱性,并以含噪提示激发克隆保真度,从而同时压测感知自然度与机器可欺骗性。在低音量远场重放协议下,w2v2+AASIST级联系统的t-DCF指标为0.619,高于前作J-SPAW的t-DCF指标0.096。该结果表明即使强对策模型在恶劣重放条件下仍会被联合绕过,而高保真合成攻击在逻辑接入任务中同样维持高风险。该结论的适用边界受限于日语安静重放室与所测三款合成器威胁模型,尚未验证跨语言跨信道与自适应攻击下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 数据相关资源:https://github.com/we/will/ — 链接不可用(HTTP 404)
- 第三方资源:https://www.asvspoof.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/TakHemlata/SSL — 链接不可用(HTTP 404)
- 第三方资源:https://github.com/your-org/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/snakers4/silero-vad/ — 链接可访问(HTTP 200)
- 第三方资源:https://elevenlabs.io// → https://elevenlabs.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?要解决的安全问题是什么?
本文的输入是日语语音,做的事情是同时评估说话人验证与反欺骗。目标读者可以这样理解任务:系统先登记目标说话人的几句真实语音,测试时来了一段语音,系统要决定是否开门。攻击者有两条路,一是把偷录到的声音再放出来,二是用合成模型仿造声音。论文要解决的是已有日语资源攻击偏容易、重放与合成条件变化不够系统,导致强模型也能轻松通过,无法看清高风险条件下的失效模式。
白话先讲 3 个词。自动说话人验证,英文为 Automatic Speaker Verification,缩写为 ASV,后文简称验证,负责比对登记语音与测试语音的身份。欺骗对策,英文为 Countermeasure,缩写为 CM,后文简称对策,负责判断语音是真实还是伪造。物理接入,英文为 Physical Access,缩写为 PA,后文简称重放攻击,指扬声器播放加 2 次录音。逻辑接入,英文为 Logical Access,缩写为 LA,后文简称合成攻击,指语音合成与声码器生成的深度伪造。
自动说话人验证 × 欺骗对策: 自动说话人验证负责判断两段语音是否为同一说话人,输出接受或拒绝,欺骗对策负责判断输入是真实人声还是重放或合成,输出真或假,二者搭配的理由是验证只看身份相似度会被高仿语音欺骗,必须由对策先拦截可疑输入,组合后形成串联决策链,新增作用是以联合风险而非单模块正确率衡量安全。
输出是什么必须保留。验证输出等错误率,英文为 Equal Error Rate,缩写为 EER,后文简称等错误率,数值越高表示攻击越成功。对策同样报告等错误率。联合系统报告最小串联检测代价函数,英文为 tandem Detection Cost Function,缩写为 t-DCF,后文简称联合代价,数值越大表示系统级风险越高。论文必须保留的关键信息是同一批说话人、同一协议下同时给出验证、对策与联合代价,并区分高音量近场与低音量远场等条件。本文解读只讲论文实际做的日语联合评估,不扩展到通用声纹识别产品选型。
已有路线在测什么?J-SPAW 处在什么位置?
已有路线主要有 3 条。第一条是 ASVspoof 挑战系列,从 2019 年建立重放与合成分赛道的大规模基准,到 2021 年强调更真实多样的误用场景,再到 ASVspoof 5 强调新一代流程与跨条件泛化,并确立联合代价作为级联系统风险度量。第二条是专用语料,重放侧有 ReMASC 与 VSDC,提供信道与环境多样性,合成侧有 SpoofCeleb 提供野外大规模深度伪造,但前者不做统一的验证与对策联合评估,后者以英语为主。第 3 条是日语基线 J-SPAW,用真实多设备多环境录音支撑验证、重放与合成的对齐评估,但已有报告显示其伪造语音对强对策相对容易检测,且重放与合成条件种类有限。
物理接入攻击 × 逻辑接入攻击: 物理接入攻击指把偷录语音经扬声器再次播放后录入系统,分工是考验信道与环境鲁棒性,逻辑接入攻击指用语音合成或转换直接生成波形注入系统,分工是考验对声码器痕迹的辨别力,二者搭配的理由是真实攻击者两条路都会走,组合意义是要求同一批说话人与协议同时支撑重放与合成评估,避免只防一类。
论文把 J-SPAW2 定位为首个系统控制重放与合成条件、同时兼容验证与对策联合评估的日语语料。学习依赖是先理解挑战赛的协议划分,再理解专用语料为何不能直接回答系统级风险,最后才能理解 J-SPAW2 为何要在同一说话人集合与句子集合上同时加难两类攻击。教学例子:这好比同一份考卷同时考听力与辨伪,若只给一类题就无法知道考生是身份比对弱还是伪造辨别弱。
为什么强模型在旧数据上显得太强?
问题来自条件覆盖不足。旧 J-SPAW 的重放变化主要在播放设备,距离与音量控制不系统,合成管线也不是针对含噪偷录的强零样本流程。结果是 w2v2 加 AASIST 这类强对策在有利条件下等错误率可以低到百分之几,联合代价此前报告为 0.096,给人以系统很安全的印象。但真实攻击恰恰发生在远距离、低音量、有空调或音乐干扰的偷录条件下,此时伪造语音的声学痕迹被噪声与混响掩盖,对策难以利用稳定的伪造线索。
论文因此提出两个可操作的问题。第一,重放距离拉远、音量调低后,对策退化与验证被绕过的方向是否一致。第二,用短时含噪非自愿录音做参考的零样本合成,能否在不重叠评估文本的条件下同时欺骗对策与验证。两个问题都要求数据角色严格分离:评估用的真实语音不能出现在攻击者的参考材料中,否则会高估攻击或低估泛化。
J-SPAW2 的全景是如何组织的?
J-SPAW2 继承 J-SPAW 的说话人、句子与真实录制框架,共 40 名日语母语者,每人 50 句,覆盖安静室内、空调室内、音乐背景室内与室外 4 种环境。真实评估语音用 Pixel 3 与 iPhone 8 录制,非自愿攻击源语音用 iPad mini 录制。每人 50 句中 5 句用于评估,剩余 45 句作为攻击者可自由使用的非自愿录音,评估文本与攻击参考文本不重叠。沿一个样本走完全程有助于建立全景:某说话人在空调室的一句被 iPad 偷录,攻击者要么经扬声器重放后被手机 2 次录制,要么作为零样本合成的参考去生成评估文本的新语音,最终都与该说话人的登记真实语音配对打分。
在进入具体构造前,先看论文对数据角色的示意,左侧是登记与偷录并存的采集,右侧是重放攻击的 2 次录音,箭头标明了哪支麦克风负责哪一路。
看图路径: 1. 先看左侧同一说话人同时面对两支麦克风的分支结构;2. 再看右侧攻击者用扬声器与录音麦克风构成的二次录音闭环;3. 最后确认用于攻击的 45 句与用于评估的 5 句不重叠的数据角色划分
论文图 1。原论文 Figure 1:“Illustration of genuine recording, non-consensual recording (source recording), and replay attack. Utterances by the non-consensual recording are used in the spoofing attacks.”。
上图左侧显示说话人同时面对蓝色真实录音麦克风与红色非自愿录音麦克风,右侧显示重放扬声器到蓝色重放录音麦克风的单向传播,桌椅与人物剪影标明了攻击者不在场的偷录设定。解释是该图只讲数据分工不讲具体距离音量数值,真正的难度控制在重放小节用距离与音量实现,在合成小节用含噪参考与增强选择实现,评估时真实与伪造在同一协议下配对,从而支撑验证、对策与联合代价 3 类指标。
重放与合成两个部件各自做了什么计算?
重放部件的计算是物理重录,不是数字混音。做法是把 J-SPAW 的非自愿录音经 4 种扬声器播放,在安静室内房用两部手机重录,关键新增是两档距离与两档音量。近场约 10 厘米,远场约 1 米,高音量与低音量构成 4 种重放条件,再乘以 4 种原始环境、4 种扬声器与两种录音手机,得到 128000 句伪造。信噪比定义为每句内语音活动段与静音段的平均声压比,单位为分贝,用于事后度量条件难度。
合成部件的计算是生成加筛选 2 阶段管线。第一阶段把参考语音与目标文本送入零样本合成模型,因随机生成导致韵律与静音异常,论文用 Silero 的语音活动检测过滤无效候选,保留有效池。第二阶段对全部候选运行 Whisper 中型日语语音识别,计算相对输入文本的字错误率,英文为 Character Error Rate,缩写为 CER,取最低者,若并列则用 UTMOS 强模型预测的 1 到 5 分自然度取最高者。可选地在合成前用 DPTNet 或 DCCRNet 做语音增强,以压制空调与环境人声。3 种合成系统为 CosyVoice2、ElevenLabs 与 VALL-E X,每种条件生成 800 句伪造。
零样本语音合成 × 语音增强: 零样本语音合成负责用几秒到几十秒的非自愿录音作为参考来克隆音色与韵律,语音增强负责在合成前压制空调与音乐等背景噪声,分工是前者提供攻击能力后者净化参考条件,搭配理由是真实偷录必然带噪而合成调节依赖干净的说话人表征,组合意义是把参考污染与去噪作为可控攻击因子,检验更自然是否等于更难检测。
需要指出论文未报告的内容:合成模型的权重是否冻结、增强与合成之间是否有梯度路径、筛选阈值的具体数值均未给出,因此不能从模型名称推定实现细节,只能把该管线理解为实际调用已有模型加规则筛选的攻击构造流程,而非端到端训练新合成器。
本研究训练了什么?没有训练什么?
本研究没有训练新的验证或对策模型,也没有训练新的合成声码器,方法职责由语料构造、调用已有模型与规则筛选承担。真实计算过程是 3 类。第一类是物理仿真式采集,即按距离、音量、设备与房间组合实际播放与重录,得到带标注的伪造波形。第二类是已有模型推理,即用公开的 LFCC 加高斯混合模型、AASIST、w2v2 加 AASIST 做对策,用 ECAPA-TDNN 做验证,用 Whisper 做识别,用 UTMOS 做自然度预测,用 Silero 做语音活动检测。第 3 类是规则选择,即按字错误率最低、UTMOS 最高保留候选。
论文明确给出调用来源:LFCC 高斯混合来自 ASVspoof 2021 发布模型,AASIST 来自 ASVspoof 5 发布模型,w2v2 加 AASIST 按 ASVspoof 2019 协议训练并在 GitHub 发布,ECAPA-TDNN 用 VoxCeleb2 预训练权重。未报告训练超参数、优化器、冻结层与计算预算缺项应在复现时如实记录,不能把无训练等同于确定性求解,因为合成随机性与房间声学都会引入波动。
评估条件如何对齐?指标方向是什么?
重放评估集由 128000 句伪造与 800 句真实组成,真实为 40 人乘 5 句乘 4 环境。验证协议共 670400 个试次对,其中真实目标对 7600 个,不同说话人真实非目标对 30000 个,同说话人真实登记对伪造 632800 个。关键口径是真实对伪造按非目标计分,因此验证等错误率越高表示伪造越常被当成目标本人,即攻击越成功。对策等错误率越高同样表示越易漏过伪造。联合代价越大表示级联系统越脆弱。
合成评估每种合成与增强条件生成 800 句伪造,对应 800 句真实,从感知质量、能否骗过对策、能否拖垮验证三视角分别用 UTMOS、对策等错误率、验证等错误率度量,再用最小联合代价做系统级汇总。汇总是把四环境语音合并为统一数据集后计算,而非四环境分数算术平均,因此合并值可能与分环境均值明显不同。基线保留 ASVspoof 2021 的合成参考与原始真实基线,用于判断绝对难度。
等错误率 × 串联检测代价函数: 等错误率负责在单一模块内取误接受等于误拒绝的操作点,分别报告对策错误与验证错误,串联检测代价函数负责把对策与验证的错误与先验代价折成系统级风险,分工是前者诊断部件后者裁决部署风险,搭配理由是部件变好不等于系统变安全,组合意义是当合成让验证大量误接受时即使对策中等也会算出高代价。
在看具体数字前,先看重放距离的实际摆位,左图扬声器紧贴两部手机,右图扬声器在长桌远端,两部手机在近端,共同说明距离是独立于设备的控制变量。
看图路径: 1. 先对比左图扬声器紧贴手机与右图扬声器远离手机的摆位差异;2. 再确认两张图中 iPhone 与 Pixel 两部录音手机同时在位;3. 最后观察蓝色 Bose 扬声器作为四种播放设备之一的实例位置
论文图 2。原论文 Figure 2:“Example recording scenes for replay attacks under close-range and far-field conditions using a Bose speaker.”。
上图左面板显示蓝色 Bose 扬声器与标有 iPhone 与 Pixel 的两部手机近距离同桌摆放,右面板显示同一扬声器在长桌远端而两部手机在近端,红色座椅与木纹桌面确认同一安静室内房间。解释是该图只展示 Bose 一种扬声器的两种距离实例,完整评估还包含 iPad、MacBook 与 Sony 3 种播放设备以及高低两档音量,像素不能读出分贝值,具体难度需结合信噪比与错误率表格判断。
重放攻击:谁在低音量远场失守?谁在近场被冒充?
要回答的比较问题是 4 种距离音量组合下,3 种对策的伪造检出错误如何变化,公平条件是同一批说话人、同一真实集与同一试次划分,指标方向是对策等错误率越低越好。下表整理重放设备与条件相关的对策行为,保留原文报告的设备划分与高低音量、近场远场划分,用于复述低信噪比条件的难度。
| 攻击条件 | 指标 | LFCC 混合基线 | AASIST 基线 | 强对策 w2v2 加 AASIST | 比较对象 |
|---|---|---|---|---|---|
| Mac 低音量远场 | 对策等错误率 | 82.99% | 53.87% | 37.40% | 同设备其他 3 个条件 |
信噪比 × 重放距离: 信噪比负责量化重放录音中语音段与静音段的平均声压比,重放距离负责控制扬声器到录音手机是约 10 厘米还是约 1 米,分工是前者是结果度量后者是成因控制,搭配理由是拉远距离与调低音量都会降低信噪比,组合意义是把物理条件映射为可解释的难度轴,说明低信噪比主要伤害对策而非同等伤害验证。
上表显示强对策在有利条件下可低至 1% 以下,但在低音量远场显著退化,Mac 上达 37.40%,iPad 与 Sony 上约 14%,而传统两基线在该条件下多在 40% 到 80% 区间。代价是不能只看有利条件,内置扬声器如 iPad 与 Mac 普遍比专用扬声器更难检测,论文解释为回放能力限制与噪声混响敏感性。未胜出项是 LFCC 混合在 Bose 高音量近场仍有 50.50%,说明经典特征对真实重放几乎失效,这是重要的负结果。
验证与联合代价呈现相反的脆弱方向。下表比较验证等错误率与联合代价,验证基线仅用真实时为 1.69%,加入伪造后高音量近场升至 23.91%,低音量远场仍有 9.79%,联合代价中强对策在高音量时为 0.103 与 0.095,在低音量远场升至 0.619,远高于旧 J-SPAW 报告的 0.096。
| 评估维度 | 条件 | 基线值 | 本 corpus 难条件值 | 方向说明 |
|---|---|---|---|---|
| 验证等错误率 | 高音量近场对真实基线 | 1.69% | 23.91% | 越高攻击越成功 |
| 验证等错误率 | 低音量远场对真实基线 | 1.69% | 9.79% | 越高攻击越成功 |
| 联合代价 w2v2 加 AASIST | 高音量近场远场 | 0.103 与 0.095 | 低音量远场 0.619 | 越大系统风险越高 |
| 联合代价 AASIST | 低音量两条件 | 0.976 至 1.000 | 临界值附近 | 越大系统风险越高 |
表后解释是实践权衡:低信噪比最伤对策,高音量近场因保留说话人线索更伤验证,因此必须用联合代价而非单部件指标判断部署风险。限制是标准差在 Bose 高音量近场曾出现极大值,论文说明为两机构房间声学差异而非测量错误,跨机构合并时需注意方差来源。
合成攻击:增强为何让声音更好听却未必更难防?
要回答的比较问题是 3 种零样本合成在 4 种环境与 3 种增强下,感知质量、对策错误与验证错误是否同向变化,公平条件是同一参考时长范围、同一文本集合与同一真实对照集,指标方向是 UTMOS 越高越自然,对策与验证等错误率越高攻击越强,联合代价越高系统越危险。下表先看汇总感知质量以建立自然度基线,再看检测与验证分工。
| 合成系统 | 无增强 UTMOS 汇总 | DCCR 增强 UTMOS 汇总 | DPT 增强 UTMOS 汇总 |
|---|---|---|---|
| CosyVoice2 | 2.32 | 3.32 | 3.27 |
| ElevenLabs | 2.20 | 3.28 | 3.18 |
| VALL-E X | 1.85 | 2.58 | 2.65 |
表后解释是感知基线的作用:增强一致提升自然度评分,尤其在空调与音乐环境下提升更明显,但该表只说明人耳层面的自然度,不能直接代理对策是否会被绕过,因此必须继续对照下表的对策等错误率才能判断威胁是否同向变化。
第二组比较问题是在同一汇总口径下对策等错误率是否随增强下降,以及是否仍高于外部参考,公平条件是同一 w2v2 加 AASIST 对策与同一 ASVspoof2021 参考对照。下表保留可运行的合成策略与增强对照,另行标明 ASVspoof2021 参考为外部基线而非可部署收益。
| 合成与增强 | 感知质量趋势 | 对策等错误率汇总 | 验证等错误率汇总 | 联合代价汇总 |
|---|---|---|---|---|
| CosyVoice2 无增强对 DCCR/DPT | 2.32 对 3.32/3.27 | 14.75% 对 12.88/13.75% | 13.98% 对 10.78/10.50% | 0.45 对 0.45/0.46 |
| 外部参考 ASVspoof2021 合成 | 未报告 | 0.82% | 未报告 | 0.21 |
表后解释是核心反证:增强一致提升 UTMOS,尤其在空调与音乐环境,但在多数设置下对策等错误率反而下降,意味着去噪后更自然的语音反而更容易被检出为伪造。论文的有限解释是残留背景噪声会掩盖合成伪影,去噪暴露了声码器痕迹或相位不一致,而 w2v2 加 AASIST 恰好利用这些结构。代价是不能用感知质量代理攻击成功率,ElevenLabs 无增强时对策错误高达 29.00% 且联合代价达 0.99,说明即使对策中等,若验证行为利于冒充,端到端风险仍可主导。未胜出项是 VALL-E X 无增强时对策错误仅 6.75%,但验证错误也仅 3.67%,整体仍高于外部参考,说明威胁真实但模型间差异大。
第三组比较问题是验证端与联合代价是否与对策同向,公平条件是同一 ECAPA-TDNN 验证后端与同一真实基线对照,指标方向是验证错误越高冒充越成功。下表把验证与联合代价并列以检验分工组合原因。
| 合成系统 | 验证等错误率汇总无增强对 DCCR/DPT | 联合代价汇总无增强对 DCCR/DPT |
|---|---|---|
| CosyVoice2 | 13.98% 对 10.78/10.50% | 0.45 对 0.45/0.46 |
表后解释是分工与组合原因:对策负责检出合成痕迹,验证负责判断说话人相似度,联合代价负责级联后的运行风险,三者缺一不可。CosyVoice2 增强后验证错误下降而后两者变化较小,支持把增强视为可控攻击因子而非普遍有益或有害操作。环境分解上空调与音乐环境的 UTMOS 退化最明显,论文归因于背景噪声与语音共振峰谐波区的频谱重叠,模糊了说话人表征与韵律,增强部分恢复了这些线索。
哪些结论有边界?什么还没有测?
论文直接报告的是在给定房间、给定设备与给定合成版本下的错误率与联合代价变化,支持的判断是低音量远场更难检测、高音量近场更易冒充、增强后自然度与可检测性分离。可能与待验证的是跨语言泛化、跨房间泛化与对抗自适应攻击,原文未做跨语料训练与条件感知训练对照,不能推出换一个城市房间或新合成器仍保持相同排序。
缺失证据不是技术错误,但复现时必须补记。未测量误判率之外的延迟、算力与存储成本,不能承诺这些量得到改善。训练资源、推理开销、输出帧率与实际延迟应分别讨论,总体趋势不等于每组每步都成立,例如 VALL-E X 增强后对策错误上升而 ElevenLabs 下降,方向取决于合成特性与噪声内容。原文表头与算术若出现冲突应标注冲突,本文未发现核心数字自相矛盾,但合并分数与分环境均值不可直接比较,引用时必须注明聚合口径。
要复述方法,先做什么?需要哪些信息条件?
复现先做数据角色划分。准备 40 人每人 50 句的四环境真实录音,用 Pixel 3 与 iPhone 8 作为评估麦克风,用 iPad 作为偷录麦克风,固定每人 5 句为评估集、25 句为重放源、45 句为合成参考池,确保评估文本不进入攻击参考。重放按四扬声器乘两距离乘两音量乘两录音手机在安静室内重录,记录房间尺寸与机构差异。合成按参考加目标文本生成多候选,经语音活动检测过滤后按字错误率最低、UTMOS 最高保留,再可选地在合成前做 DCCR 或 DPT 增强。
评估先跑验证与对策的公开权重,再按 7600 真实目标、30000 真实非目标、632800 真实对伪造的划分打分,分别计算对策等错误率、验证等错误率与最小联合代价。关键超参数与信息条件是距离约 10 厘米与约 1 米、高低两档音量、四环境标签、Whisper 日语设置与 Silero 检测,这些决定条件可比性。资源状态必须如实写:论文给出临时地址 https://github.com/we/will/ ,本次核对显示该链接当前不可用,状态为 404,因此不能写已公开或当前可用,只能写计划发布而本次未能获取;第三方 ASVspoof、Silero 与 ElevenLabs 链接本次可达,但合成权重与版本仍需按原文引用锁定。
何时值得尝试 J-SPAW2?带走什么判断?
当研究目标是日语语音认证的系统级风险而非单模型分数时值得尝试,尤其需要同时分析重放距离音量与含噪零样本合成的场景。带走的判断有 3 条。第一,用有利条件下的低错误率论证安全会误导,低音量远场与高音量近场分别考验对策与验证,必须看联合代价。第二,更自然不等于更难防,增强可能暴露合成痕迹,选攻击条件不能只听主观质量。第三,设备与环境差异不可平均掉,内置扬声器与空调音乐环境的弱点会被平均掩盖,部署分析应保留分条件视图。
常见误解是把无训练等同于无计算,本文实际包含大量物理重录与多模型推理加规则搜索,复现成本主要在采集与推理而非梯度训练。另一误解是把高验证错误直接当成验证模型差,本文口径下它是攻击成功度量,基线在纯真实上仅 1.69%,加入伪造后升高恰恰证明伪造保留了说话人相似性。后续还需补的验证是条件感知对策训练、跨语言与跨设备的泛化测试,以及对新零样本合成器的持续追踪。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

