论文解读
把归属藏进说话人行为:TTS-Guard 如何用对抗说话人对验明黑盒语音模型
针对零样本语音合成模型被微调、剪枝、量化与蒸馏后仍可经黑盒接口验明归属的问题,TTS-Guard 以双空间关键说话人对选择加课程化影子模型优化构造参考音频扰动,并在五个主流系统上报告平均单查询指纹成功率 96.4%、误报率 5.8%,代价是验证需 20 到 40 次查询且蒸馏与强自适应擦除仍会明显拉低成功率。
针对零样本语音合成模型被微调、剪枝、量化与蒸馏后仍可经黑盒接口验明归属的问题,TTS-Guard 以双空间关键说话人对选择加课程化影子模型优化构造参考音频扰动,并在五个主流系统上报告平均单查询指纹成功率 96.4%、误报率 5.8%,代价是验证需 20 到 40 次查询且蒸馏与强自适应擦除仍会明显拉低成功率。
针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。
该文把攻击溯源做成验证问题,用自监督前端加角度间隔与混合正则训练与训练集完全隔离的嵌入器,在分布内用少样本后端取胜而在分布外用零样本余弦取胜,但两类等错率仍在 13% 至 30% 量级。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
该研究用双轨应答蜜罐加音频指纹与商用合成语音检测器测量骚扰来电开场,报告机器发声至少占 26.9%,其中约一半是跨通话重放的录音,但合成标签只有约 54.4% 经盲听确认且阈值与播种历史显著影响读数。
论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。
音频分类 | 7.4/10