留住语调、抹掉身份:用声门源与对抗损失学隐私韵律表示
该文以声门源波形为输入、声学韵律聚类为自监督目标、说话人归一化与对抗说话人损失为解耦手段,在音高重建与 ToBI 事件检测上超过 HuBERT-base 与原始韵律基线,并以说话人识别准确率大幅下降为代价证明了解耦效果。
该文以声门源波形为输入、声学韵律聚类为自监督目标、说话人归一化与对抗说话人损失为解耦手段,在音高重建与 ToBI 事件检测上超过 HuBERT-base 与原始韵律基线,并以说话人识别准确率大幅下降为代价证明了解耦效果。
论文针对音频大模型会无意收录并回答旁观者语音的问题,提出只听主说话人的选择性听觉任务与 SH-Bench 评测和 SE 统一指标,并用旁观者隐私微调 BPFT 在保持主说话人理解的同时学会拒答,最强证据是微调后选择模式下旁观者准确率与 SE 大幅超过 Gemini 2.5 Pro,代价是主说话人准确率轻微波动且仅覆盖单主说话人场景。
论文把短时傅里叶、Mel、倒谱和 Gammatone 直接搬到全同态加密上,用膨胀、贫民变换等近似降低累加器位宽,在 VocalSet 和 OxVoc 上把描述符统计错误率从常规方法的 5.9% 和 6.5% 降到膨胀 4 倍时的 4.7% 和 1.9%,代价是 64 毫秒音频加密计算约 12970 秒且高频谐波丢失。
该研究把冻结的语音编码器、投影器和大语言模型连成三阶段流水线,用多头分类器探测说话人属性在各阶段的可恢复性,并用频谱对抗掩蔽选择性压制目标属性,最强证据是编码器端说话人标识准确率从 0.51 降到 0.01 而词错误率几乎不变,代价是越抽象的表示越难控且情感属性跨数据集不稳定。
该文在 MPS 和 SpeechOcean 儿童朗读数据上比较 VTLN 加移调、McAdams 系数与神经编解码 NACLM,报告 VTLN 在 α=1.2 加负半音移调时隐私与可懂度韵律保持最均衡,而 NACLM 隐私最强但词错误率和韵律失真代价最大。
针对语音被人和自动语音识别系统窃听关键词的问题,论文用大语言模型选替换词加累积信号攻击做局部混淆、再用可逆信息隐藏嵌入扰动,在 LibriSpeech 上报告目标误导率 96.5% 与恢复音频 PESQ 4.45,代价是强扰动与可逆嵌入的存储开销和对齐依赖。
针对扩散语音克隆的先验防御梯度消失与动态条件问题,VoiceCloak 用异性中心引导加注意力上下文发散做身份混淆、用分数幅值放大加噪声引导语义破坏做质量降级,在相同扰动预算下报告了更高的防御成功率,但保护音频本身仍需付出可感知性代价。
AdoDAS 在不分发未成年人原始音视频的前提下提供 6000 人四会话的匿名化表征与文本,要求在隐藏测试集上完成 D/A/S 二分类筛查与 21 项 DASS-21 序数预测,音视频基线均值 F1 为 0.4604、均值 QWK 为 0.2675,最优提交分别达到 0.5921 和 0.2776,但提升主要来自时序多模态与跨会话建模而非原始编码器规模。
医疗音频 | 7.5/10
语音对话系统 | 8.0/10
语音匿名化 | 7.0/10
语音识别 | 7.5/10
语音匿名化 | 7.0/10
语音匿名化 | 7.5/10
音频事件检测 | 7.5/10