论文解读

把归属藏进说话人行为:TTS-Guard 如何用对抗说话人对验明黑盒语音模型

针对零样本语音合成模型被微调、剪枝、量化与蒸馏后仍可经黑盒接口验明归属的问题,TTS-Guard 以双空间关键说话人对选择加课程化影子模型优化构造参考音频扰动,并在五个主流系统上报告平均单查询指纹成功率 96.4%、误报率 5.8%,代价是验证需 20 到 40 次查询且蒸馏与强自适应擦除仍会明显拉低成功率。

 · 更新于 2026-09-24 · 约 20 分钟 · 9668 字 阅读 →
论文解读

不存更多指纹,只在查询时多算一步:POLARIS 的显著性地标与查询侧扩展

针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9405 字 阅读 →
论文解读

训练没见过的攻击怎么验:把声纹验证搬到深度伪造溯源

该文把攻击溯源做成验证问题,用自监督前端加角度间隔与混合正则训练与训练集完全隔离的嵌入器,在分布内用少样本后端取胜而在分布外用零样本余弦取胜,但两类等错率仍在 13% 至 30% 量级。

 · 更新于 2026-09-24 · 约 23 分钟 · 11067 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

机器在打电话:先数录音重放,再问合成语音占多少

该研究用双轨应答蜜罐加音频指纹与商用合成语音检测器测量骚扰来电开场,报告机器发声至少占 26.9%,其中约一半是跨通话重放的录音,但合成标签只有约 54.4% 经盲听确认且阈值与播种历史显著影响读数。

 · 更新于 2026-09-24 · 约 25 分钟 · 12414 字 阅读 →
论文解读

跨航次重识别为何难:去重门控与原始波形选择性核的诚实评估

论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。

 · 更新于 2026-09-24 · 约 20 分钟 · 10002 字 阅读 →
论文解读

Turning music identification into a neural forward pass

音频分类 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6103 字 阅读 →