论文解读

不是越不像越好:把遗忘相似度锚定到陌生人水平的说话人遗忘

针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。

 · 约 18 分钟 · 8712 字 阅读 →
论文解读

开放收集为何仍数不出酷儿声音:六个语音数据集审计与四组实践张力

论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。

 · 约 19 分钟 · 9464 字 阅读 →
论文解读

谁来定义酷儿语音数据:从众包采集到共同设计的策展转向

本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。

 · 约 21 分钟 · 10463 字 阅读 →
论文解读

残留说话人属性聚成可链接性:用针孔损失微调已训好的匿名框架

针对解耦不彻底导致内容与韵律流残留说话人可链接性的问题,该文在冻结说话人编码器下用针孔损失微调内容编码器、韵律编码器与波形生成器,探测显示学习型韵律泄漏明显下降而词错误率与情感召回仅小幅波动。

 · 更新于 2026-09-24 · 约 21 分钟 · 10284 字 阅读 →
论文解读

只看等错误率会误判匿名语音:五维泄漏评估如何拆开隐私与可懂度

该研究用说话人去标识任务同时检验验证抵抗、软生物属性、检索重识别、嵌入结构和可懂度五个维度,显示没有系统在全部维度占优且最保护隐私的系统可懂度损失最大。

 · 更新于 2026-09-24 · 约 20 分钟 · 9896 字 阅读 →
论文解读

只传内容不传声音:DECAF 把压缩本身做成匿名化

DECAF 针对云端语音传输中声纹泄露问题,选择只量化传输内容嵌入并在接收端用共享典型说话人重建,在 0.5 kbps 下报告 43.5% 等错误率和相对 33.2% 词错误率下降,但未压缩时仍需承担重建与微调依赖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8039 字 阅读 →
论文解读

语音问答记住了不该记的事实:切断声学理解与隐私记忆的四种遗忘路径

论文在语音问答大音频语言模型上对比梯度上升、任务算术与两种拒答对齐遗忘方法,报告在中度记忆检查点上可把隐私泄露率降低约 80% 且非隐私问答基本保持,但压到接近零泄露时非隐私准确率必然明显下滑。

 · 更新于 2026-09-24 · 约 20 分钟 · 9634 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

换词不换声:直接剪贴与编解码器重建哪条路更自然

该研究以保留原说话人听感为前提替换语音中的敏感词,对比直接波形剪贴与经神经编解码器重建的插入路径以及克隆嗓音与合成语境的选择,用自然度、可懂度和信号质量自动指标报告编解码器路径更优,其中自然度倾向于带原句嵌入的编解码器与克隆嗓音,而信号质量倾向于通用嗓音与孤立词合成。

 · 更新于 2026-09-24 · 约 18 分钟 · 8616 字 阅读 →
论文解读

强匿名反而练不出好模型?VoxTubeS 用七个对齐版本标定隐私与可用的边界

论文以 129 万条英语 VoxTube 语音为共同源集,用嵌入变换、隐空间转换与负引导合成三族七种方法生成内容对齐的匿名语料,并以每版独立训练说话人验证模型与会话级链接实验,报告了强抑制压缩说话人空间而高效用版本残留可链接线索的权衡。

 · 更新于 2026-09-24 · 约 9 分钟 · 4502 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

不只认出是谁:四种平行音频如何泄露身高体重与生活属性

该研究用 1000 人 227.3 小时四种平行音频与 11 个属性检验说话人属性隐私泄露,显示传统模型与微调后多模态大模型在多属性上明显高于随机猜测,但非语音信号与细粒度属性仍存在显著不确定性与评估代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9083 字 阅读 →
论文解读

编码器与解码器更新差十倍时,按参数量分配的差分隐私裁剪为何崩溃

论文诊断单池逐层裁剪在语音大模型中的跨组件预算崩溃,提出双池 α-split 在保持联合灵敏度与全局 DP 保证不变下恢复可用词错误率,并以编码器 4.47 倍等效噪声换取语言模型仅 2.6% 开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8457 字 阅读 →
论文解读

等错误率打平不等于匿名打平:用相似度秩泄露称量残留身份

论文把匿名评估从说话人验证的二值判定改到对特征表示的相似度排序,用秩泄露的平均与最坏比特揭示 2024 VoicePrivacy Challenge 中与等错误率矛盾的系统弱点,但结论依赖半知情强攻击与 40 人排序池。

 · 更新于 2026-09-24 · 约 17 分钟 · 8196 字 阅读 →
论文解读

只听声音就能画像:HearSay 揭示音频大模型的声纹隐私泄露

论文提出只用声纹推断八类隐私属性的 HearSay 基准,用 22,064 段真实音频证明模型在性别上平均达到 92.89% 准确率且几乎不拒绝,而思维链推理在强模型上进一步放大泄露,轻量提示防御难以根治生理属性泄露。

 · 更新于 2026-09-24 · 约 18 分钟 · 8534 字 阅读 →
论文解读

只换音色不够:用离散单元同时改写节奏的匿名化

该文针对仅混淆音色后韵律节奏仍会泄露身份的问题,用离散语音单元加时长预测与单元声码器同时改写音色与节奏,在非音色攻击下半知情评估取得相对 32% 的提升,代价是词错误率上升到 7% 量级且自然度轻微下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8068 字 阅读 →
论文解读

跨视觉语言视频音频的遗忘:在哪里动手比用什么优化更重要

该综述把多模态遗忘按实例级与概念级切分并按干预阶段组织方法,以遗忘强度与效用保留的权衡为主线,报告了身份隐私内容与安全基准的规模与评估维度,并指出跨模态泄漏与对抗再激活是主要代价。

 · 更新于 2026-09-24 · 约 22 分钟 · 10576 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

从单人声音到多人对话:互动本身如何泄露隐私属性

本文用范围综述梳理对话语音中可推断的个人与群体属性,指出话轮接管、语言趋同和互动词模式是单人声学之外的新推断通道,并提醒当前推断技术多不讨论隐私防护与威胁模型。

 · 更新于 2026-09-24 · 约 21 分钟 · 10242 字 阅读 →