英文题目:AudioPrivacy: Parallel Audio Dataset for Speaker Profiling with Diverse Audio Types and Rich Attributes
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.283
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集 #数据集构建 #评测协议 #隐私保护 #语音属性识别
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Jiabei He:机构信息未能从会议 PDF 纯文本可靠映射
- Yanzhe Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoqin Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yong Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理说话人属性隐私推断,输入为日常室内手机窃听音频,输出为性别年龄身高等11维敏感属性,难点在于属性异构且信号横跨发声与非发声模态并与身份泄漏交织。先由被试自有手机在居家环境采集语音歌唱等四类平行音频并标注生理与社会属性,职责是构建平行语料,输出为227小时千人数据集。再将该数据集输入按多标签分层划分的训练验证评测协议,职责是隔离说话人并保持属性分布,输出为8:1:1的训练验证评测划分。最后将划分结果输入传统声纹模型与多模态大语言模型分别执行的验证与画像流程,前者单音频单属性训练,后者统一输出多维属性,职责是暴露泄漏风险,输出为EER与相对属性泄漏增益统一度量以实现跨属性比较。与仅关注声纹身份的已有语料相比,该工作把脚步拍手等非发声声学信号纳入威胁模型,使隐私评估从身份识别扩展到细粒度属性泄漏。在AudioPrivacy语音验证任务下,ResNet-TDNN的EER为0.26,低于ECAPA-TDNN的0.82。其结论适用边界受限于中文普通话手机近场室内与单音频单次推断,尚未验证多录音融合与跨设备泛化。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么只防声纹不够:窃听场景到底在担心什么
这篇论文的输入是日常室内环境中被手机麦克风意外录到的声音,目标是回答除了认出说话人是谁之外,还能不能还原出年龄身高体重地域教育等生活属性。初学者容易把语音隐私等同于声纹,也就是白话说的声音指纹,英文是 voiceprint,作用是区分不同说话人。论文提出更宽的说话人属性隐私,英文是 Speaker Attribute Privacy,简称 SAP,白话说就是声音里附带的个人标签。说话人验证,英文是 Speaker Verification,简称 SV,解决的是两段录音是否为同一人的问题;说话人画像,英文是 Speaker Profiling,简称 SP,解决的是一段录音对应哪些属性值的问题。
说话人验证 × 说话人画像: 说话人验证负责判断两段音频是否来自同一人,分工是身份关联;说话人画像负责从一段音频推断年龄身高等属性,分工是属性还原;两者搭配的理由是同一段被窃听音频可能同时泄露身份与属性,组合意义在于把隐私风险从声纹识别扩展到更直接的社会歧视与生活画像风险。
论文设定的威胁动作很具体:用户在室内说话唱歌咳嗽走路,手机被入侵后持续窃听,攻击者拿到音频后用基础模型或大模型做画像。初学者复述时要保留 3 个必须信息:被窃听设备是说话人自己的智能手机,环境是日常室内而非录音棚,攻击不只针对语音内容,还包括歌声副语言与脚步拍手等非语音声音。论文报告该数据集包含 1000 名说话人与 227.3 小时音频,并覆盖 4 种平行模态,这决定了后续所有泄露结论的适用边界。
下面这张示意图把上述链路画成左右两部分,读图时不要只看攻击者图标,要同时确认声音来源的多样性。
看图路径: 1. 先看右上虚线框内五个小图标代表的日常声音来源;2. 再看左侧手机与红色箭头表示的录音与窃听路径;3. 最后看右下攻击者经网络模型输出年龄性别体重框的链路
论文图 1。原论文 Figure 1:“The scenario of speaker attribute privacy leak- age from audio: the smartphone is corrupted and eaves- dropped by the hacker to inferences the users’ privacy.”。
这张图的上方虚线框给出 5 类日常声音图标,分别对应说话唱歌大笑走路拍手,下方虚线框给出攻击者经模型输出年龄性别体重的链路。左侧手机与红色箭头表示录音先变成文件再被送入模型。对初学者而言,关键观察是泄露起点不是一段精心朗读的语音,而是生活中难以避免的咳嗽脚步等短声,这正是后文要检验非语音信号的原因。
已有数据集为什么接不住这个窃听问题
按论文梳理,已有可用于画像的数据大致分 3 路。第一路为语音识别数据,例如 TIMIT 与 KeSpeech,白话说就是为把语音转文字而录的数据,英文是 Automatic Speech Recognition,简称 ASR。它们通常只有性别年龄地域等少量标签,且录音条件受控,适合研究发音与文字,不适合研究细粒度身体属性。第二路为说话人识别数据,例如 VoxCeleb 系列与 CN-Celeb,白话说就是为区分名人身份而收集的访谈与媒体音频,英文是 Speaker Recognition,简称 SR。它们人数多但属性浅,且名人面对镜头的说话方式与普通人在家里的声音存在差异。第 3 路为专用画像数据,例如 NISP 与 VCTK-RVA,前者提供身高体重等物理属性,后者提供明亮粗糙等音色描述,但覆盖的音频类型与隐私威胁建模仍然有限。
声纹保护 × 说话人属性隐私: 声纹保护的分工是隐藏或替换身份向量,防止被认出是谁;说话人属性隐私的分工是防止年龄身高地域教育等被推断出来;搭配理由是只保护声纹仍可能通过身高体重口音等间接定位到人,组合意义在于要求评估与防护同时覆盖身份与多维属性。
对照时要按同输入同目标来比较。输入维度看是否为普通人日常室内手机录音,目标维度看是否为包含身高体重肩宽腰围腕围鞋码鞋类地域教育的多维属性,监督维度看是否为可用于训练与评测画像模型的成对标注,运行阶段看是否为窃听后的离线推理而非实时转写。论文报告现有语料多在受控棚内录制且属性集受限,这句话是理解新数据集动机的关键。初学者不要把类别差异直接说成谁好谁坏,而要说在上述 4 个维度上旧数据与窃听评估条件不一致。
要测什么:两种任务与统一比较的困难
论文把评估拆成两个可执行问题。第一个问题是不同类型音频能否关联到同一身份,这用说话人验证来测,指标是等错误率与最小检测代价,白话说就是认错人的概率与加权代价,值越低表示身份泄露越严重。由于非语音信号不是声道产生,论文明确将其排除在验证实验之外。第二个问题是给定一段音频能否推断 11 个属性,这用说话人画像来测,离散属性按分类处理,连续属性按回归处理。
困难在于属性量纲不同,性别地域是类别,年龄身高是数值,直接比较准确率与误差没有意义。论文因此提出相对属性泄露增益,英文是 Relative Attribute Leakage Gain,简称 RALG,白话说就是模型比瞎猜好多少的归一化分数。分类时与只猜众数类别的宏平均分数比较,回归时与只猜中位数的平均绝对误差比较,统一映射到可比区间,越高表示泄露风险越大。复述时必须说明该指标的方向与基线含义,否则后文所有颜色深浅与百分比都无法解读。
数据集全景:四种声音与十一种标签如何配对
数据集设计遵循一条主线:同一个人提供 4 种平行音频,再配同一套 11 个属性标签。白话说平行就是每个说话人都有语音歌唱副语言非语音 4 个文件夹,方便比较同一人在不同声音下的泄露差异。4 类音频的英文缩写需要固定:语音是 SPCH,歌唱是 SING,副语言是 PRLG,非语音声学信号是 NVAS。语音是自由话题讲述且不含提问者声音,歌唱是无伴奏清唱,副语言包括你好咳嗽笑哭哈欠啊呃叹息等 8 种基本发声且每种重复多次,非语音包括拍手与走跳上下楼等动作声。
非语音声学信号 × 副语言信号: 副语言信号的分工是保留声带驱动但无完整语义的发声,如咳嗽笑声叹息;非语音声学信号的分工是完全不经声道的环境互动声,如脚步拍手上下楼;搭配理由是两者共同检验泄露是否必须依赖语音内容,组合意义在于发现即使没有说话内容,身体与环境互动仍可能携带可利用的隐私线索。
属性侧除常见年龄性别外,还收集身高体重肩宽腰围腕围省份教育鞋类鞋码。论文强调这些属性与声学信号可能相关但在已有研究中探索不足。内容标注方面,语音标注话题关键词,歌唱标注歌名,副语言与非语音标注类别,语义信息本身也可能增加泄露。
下图把总体设计细节设计采集标注串成四栏,是复述方法时最省力的路线图。
看图路径: 1. 从左到右依次确认总体设计细节设计采集与标注四栏;2. 在第二栏核对四种音频类型与 11 个属性的分组;3. 在第三栏确认采样率精度编码与手机设备两类信息
论文图 2。原论文 Figure 2:“Overview of the AudioPrivacy data construction process, including overall design, detail design, data collection, and annotation.”。
该图第一栏限定室内手机中文普通人 1000 人,第二栏列出 4 种音频与属性表,第三栏给出 44.1 kHz 与 16-bit 与 PCM 编码及安卓与苹果手机,第四栏给出属性收集语音活动检测自动标注与人工复核。初学者沿着一个样本走一遍就是:某说话人在家用自己手机录一段话题语音与一段清唱,再录咳嗽笑声与脚步声,全部转成统一采样格式后配上 11 个属性与内容标签,进入后续划分与建模。
录音与标注组件:采样格式与划分如何保证可比
采集组件的动作是直接可复述的:使用说话人自己的安卓与苹果手机,在各自生活环境中录音,采样率 44.1 kHz,精度 16-bit,编码为 PCM,白话说就是未压缩的高保真波形,保留细粒度声学细节。论文报告有效时长 227.32 小时与 140789 条 utterance 级样本,平均每条约 5.81 秒。实验前统一降采样到 16 kHz,白话说就是把采样率降低到语音研究常用设置,以对齐常用模型输入。
划分组件的动作是先把连续属性离散化再做多标签分层随机划分,白话说就是让训练验证评估三部分在多个属性分布上大致独立同分布。工具使用 scikit-learn 的多标签分层划分,比例为 8 比 1 比 1,对应 800 人与 100 人与 100 人。复述时要强调划分对象是按说话人划分而非按 utterance 划分,否则同一人同时出现在训练与评估会导致泄露估计虚高。论文未报告每个省人数完全均匀,并说明实际折中为七大地理区相对均衡,这是理解地域结论时的重要边界。
三条建模路线如何训练:传统模型与大模型各动了哪些参数
论文实际执行 3 条路线。第一条是传统深度学习,白话说就是为每个音频类型与每个属性单独训练一个分类或回归头。骨干有两种:基于滤波器组特征的 ECAPA-TDNN 与基于自监督表示的 WavLM 加线性层。ECAPA-TDNN 从 CN-Celeb 预训练版本初始化,WavLM 用说话人验证预训练版本初始化,下游各接 4 层线性层。训练时每个音频属性对单独优化,学习率分别为 1 与 10 的负 3 次方和负 4 次方量级,训练 20 个轮次并用验证集选最优检查点,输入最长限制为 3 秒。
预训练多模态大模型 × 监督微调: 预训练多模态大模型的分工是提供已从大规模音频文本学到的声学语义表示与零样本指令跟随;监督微调的分工是用本数据集的音频到多维属性配对调整编码器适配器与语言端参数;搭配理由是直接零样本只能反映已有能力而非潜在上限,组合意义在于检验 1 次多属性联合训练后模型能否形成更一致的人物画像并放大泄露。
第二条是预训练多模态大模型零样本推理,白话说就是不针对本数据集训练,直接用指令让模型看音频输出属性。评估对象包括 MiMo-Audio-7B-Base 与 Qwen2.5-Omni-3B 与 7B,针对数值与类别属性分别设计提示模板,要求严格输出允许空间内的单个数字或单个类别。第 3 条是监督微调,白话说就是在小模型上做轻量适配。论文选择 Qwen2.5-Omni-3B 微调 3 个轮次,语音编码器自注意力中插入瓶颈适配器,语言端加入秩为 8 的 LoRA,且 1 次输入同时预测全部属性以减少重复音频编码。论文未报告多次重复运行的方差,也未覆盖更多架构与规模,复述时应明确这是已验证对照的缺项而非实现细节。
实验条件:输入截断指标方向与公平性如何对齐
验证任务的公平条件是同音频类型内按 9 比 1 划分训练与测试,评估时每人取第一条做注册其余做测试,白话说就是模拟用一段已知录音去匹配多段未知录音。画像任务的公平条件是所有模型在同一评估集上测试,传统模型输入截断为 3 秒,大模型按提示输出标准化结果。指标方向需要记牢:验证的等错误率与最小检测代价越低风险越高,画像的 RALG 越高风险越高。
相对属性泄露增益 × 随机猜测基线: 随机猜测基线的分工是给出无音频输入时的保底成绩,分类用众数类别的宏平均值,回归用中位数的平均绝对误差;相对属性泄露增益的分工是度量目标模型相对该保底的提升并映射到可比区间;搭配理由是不同属性量纲与难度差异大,组合意义在于实现跨属性与跨音频类型的统一风险比较。
下图解释为什么输入截断与音频类型必须一起看,因为 4 类音频的原始时长分布差异很大。
看图路径: 1. 对比左上语音与右上歌唱的时长中心与分布宽度;2. 观察左下副语言在 1 到 2 秒附近的高峰与快速衰减;3. 观察右下非语音信号在短瞬态峰与 6 到 15 秒拖尾的双峰结构
论文图 3。原论文 Figure 3:“The bar charts of utterance-level duration distribution statistics of 4 types of audio”。
左上语音呈近似正态且中心在 11 秒附近,右上歌唱呈双峰且受最短 5 秒切分约束影响,左下副语言集中在 1.5 秒附近,右下非语音呈双峰,短峰对应拍手跳跃,长尾对应走路上下楼。复述时要指出验证与画像结论都可能部分受时长与语义丰富度影响,不能把 SPCH 优于 PRLG 简单归因于模型能力。
为便于核对,下面把论文连续原句中实际出现的规模与训练配置整理成两张条件表。第一张回答数据从哪里来、什么格式、如何划分,第二张回答基线模型有多大、训练多久、输入多长。读表时先看列名限定的条件,再看数值与单位,不要把不同任务的轮次混为一谈。
| 数据条件 | 规模指标 | 采集格式 | 划分对象与比例 | 总量与时长 |
|---|---|---|---|---|
| 日常室内手机中文 | 1000 名说话人,227.3 小时音频 | 44.1 kHz,16-bit,PCM 编码 | 1000 人按 8 比 1 比 1 划分为训练验证评估 | 140789 条样本,有效时长 227.32 小时 |
上述第一张条件表说明数据集不是棚内朗读语料,而是普通人用自有设备在家录制的高采样波形,且按人划分保证评估泄露不是记忆同一人。表中 44.1 kHz 与 16-bit 决定了原始细节上限,而后文实验降采样到 16 kHz 是为对齐常用模型,复现时两步都要保留。
| 任务分支 | 骨干模型 | 可训练参数量 | 训练轮次 | 输入截断与学习率 |
|---|---|---|---|---|
| 说话人验证 | ECAPA-TDNN,ResNet-TDNN,WavLM-ECAPA | 20.9M,15.7M,20.9M | 在 SPCH,PRLG,SING 上分别训练 20,30,50 轮 | 每条最长 3 秒 |
| 说话人画像传统路线 | Fbank 加 ECAPA-TDNN,WavLM 加线性层 | 沿用说话人预训练初始化 | 画像训练 20 轮并用验证集选优 | 每段最长 3 秒,学习率分别为 1 乘 10 的负 3 次方与负 4 次方 |
上述第二张条件表说明验证与画像的计算预算不同,验证按音频类型调整轮次,画像统一训练 20 轮。表中参数量与轮次直接影响复现时间,输入截断为 3 秒则决定了长语音与长脚步声都被切短,评估的是短时可利用性而非全文语义画像的上限。
主结果:哪些属性在哪些声音下更容易被还原
验证结果报告的顺序是 SPCH 优于 SING 优于 PRLG,白话说就是语音最容易关联身份,歌唱次之,副语言最弱但仍非零。论文指出即使平均时长不足 1.5 秒,副语言仍取得约 20.65% 的等错误率,说明短促的咳嗽笑声仍携带身份线索。复述时要补充论文自己的提醒:该顺序与平均 utterance 长度递减一致,因此不能排除时长带来的部分解释,语义与音素丰富度也是可能原因。
画像结果中传统模型的报告强调身高体重腰围腕围等身体属性在多类音频上呈现较高 RALG,性别在语音与歌唱上提升最明显,而鞋码教育鞋类等相对更难。论文还报告一个反直觉细节:语音与歌唱在鞋码预测上优于非语音信号,解释是声道与骨架的生理关联比受鞋底地面材质干扰的脚步声更稳定。另一处细节是非语音在鞋类与腰围上与副语言相比并不弱,提示振动材料的物体信息可能被利用。
预训练大模型的零样本结果显示身体相关属性已有非零泄露,但鞋码最弱,性别在部分模型上较高而地域教育鞋类接近零。微调后 Qwen2.5-Omni-3B 在近乎全部属性上大幅提升,并在超过一半属性上超过传统单属性专用模型。论文的判断是统一多属性建模能形成更一致的人物表示,从而放大风险。初学者要区分直接报告与有限解释:提升数字是报告,跨属性一致性是支持性解释,是否必然用于真实攻击则待验证。
下图帮助理解为什么性别地域教育等类别标签的基线强弱不同,类别不均衡直接影响随机猜测的难度。
看图路径: 1. 先看左上性别与左下教育分布的均衡与偏斜程度;2. 再看右上地域七类与鞋类四类的占比排序;3. 最后看右侧中国地图颜色深浅表示的省域人数差异
论文图 5。原论文 Figure 5:“Distribution of categorical speaker attributes and geographical coverage in AudioPrivacy.”。
左侧性别接近均衡,右侧教育高度偏向大学,地域 7 类相对分散但华东最高,鞋类以运动鞋为主。右侧地图显示 1000 人覆盖 27 个省级地区但省间不完全均匀。这种不均衡意味着众数基线在教育等属性上已经不低,RALG 的提升需要结合原始分布来读,不能只看百分比高低。
反证与边界:未胜出项与输入形式的代价
把结果当成消融来读,至少有三处反证值得保留。第一,副语言在验证中明显弱于语音与歌唱,说明仅靠短促发声不足以构成强身份威胁,但其非零误差又说明不能视为安全。第二,非语音在鞋码等本应相关的任务上反而弱于语音,说明 extrinsic 冲击声受材质噪声干扰,白话说就是脚步声里混入鞋底与地板的信息,掩盖了身体本身的线索。第三,预训练大模型在地域教育鞋类上多为零提升,说明仅靠大规模预训练的声学语义知识不足以还原社会属性,必须经过任务适配。
代价方面,传统路线需要为每个音频属性对单独训练模型,白话说就是 4 乘 11 量级的模型数量,威胁更直接但部署繁琐;微调大模型只需 1 次输入输出全部属性,白话说就是用一套参数做联合画像,效率更高但需要指令格式与适配器调参。论文还报告微调仅做 3 个轮次且选择最小模型,说明当前提升仍是在有限算力下取得,扩大轮次与模型规模可能改变结论,但论文未验证该方向。
为核对大模型评估的输入形式,下面整理提示与输出约束。读表时注意零样本是单属性单次询问,微调是 1 次询问输出全部属性,两者成本与可比性不同。
| 评估阶段 | 模型对象 | 输入音频 | 提示形式 | 输出约束 |
|---|---|---|---|---|
| 零样本 | MiMo-Audio-7B-Base,Qwen2.5-Omni-3B,Qwen2.5-Omni-7B | 评估集 4 类音频 | 单属性分类或回归模板 | 分类严格输出允许类别之一,回归输出带单位单个数字 |
| 监督微调 | Qwen2.5-Omni-3B | 语音等 4 类音频 | 1 次给出性别地域教育鞋类与 7 个数值属性的输出空间 | 联合输出 JSON 式多维结果 |
该表说明零样本与微调的比较条件并不完全一致,前者考查已有能力,后者考查适配上限。复现时若只跑零样本就声称大模型无威胁,会低估适配后的风险;若只跑微调就声称普遍高风险,又会忽略提示约束与数据分布的影响。
哪些结论不能推广:分布方差与多段融合的缺项
论文明确列出 3 类限制。第一是地域分布,1000 人难以在 34 个省级行政区完全均匀,实际保证的是七大地理区相对均衡,因此地域推断结论只适用于该分布下的评估,不能推广为全国口音识别能力。第二是实验方差,受算力限制未能充分重复运行,单次最优检查点的选择可能受随机性影响,复述时应把超过一半属性高风险表述为在本次划分与训练配置下的观察。
第三是模型覆盖与攻击形式,评估架构种类有限,且每次只用单段单类型音频推理,真实攻击者可能联合多段录音或跨类型融合,白话说就是把一个人的语音歌唱脚步拼在一起看,互补线索可能进一步放大泄露,但论文未系统验证。
伦理侧同样是限制而非附加说明。参与者均为 18 岁以上且知情同意,可自由选择话题与歌曲并获得 150 元报酬,姓名联系方式等可识别信息不公开,发布数据已匿名化并要求仅用于学术非商业研究,禁止重识别与再分发。初学者复述方法时必须同时复述这些使用边界,不能只讲技术流程。
复现先做什么:按依赖顺序重建数据与评估
复现的第一步是重建数据视图。按 800 人与 100 人与 100 人划分说话人,用多标签分层保证属性分布一致,检查语音歌唱副语言非语音四文件夹是否对齐到同一人,并确认原始 44.1 kHz 与实验 16 kHz 两档采样分别用于存档与建模。第二步是重建验证链路:合并原训练与验证做 9 比 1 切分,留出评估人做注册与测试,每条截断 3 秒,用 ECAPA-TDNN 与 ResNet-TDNN 按 SpeechBrain 流程训练,用 WavLM 冻结做特征加 ECAPA 后端训练,损失用 Softmax-AAM,学习率调度用 CyclicLR。第三步是重建画像链路:传统模型按音频属性对训练 20 轮,大模型先跑零样本单属性提示,再对 Qwen2.5-Omni-3B 做 3 轮轻量微调并 1 次输出全部属性。
关键超参数与信息条件要原样保留:验证按 SPCH 与 PRLG 与 SING 分别训练 20 与 30 与 50 轮,画像学习率分别为 1 乘 10 的负 3 次方与负 4 次方,适配器隐藏维度 256 与长度 128,LoRA 秩 8 与缩放 32 与丢弃 0.05。论文未报告硬件预算与推理延迟,复述时应明确这是缺项,不能从参数量推定实际耗时。资源状态方面,本次未发现来源绑定且完成验证的公开链接,因此不得声称代码模型或数据已公开,复现应先按论文描述自建流程并补做可达性核对。
何时值得尝试这个思路:给研究生的行动判断
当研究问题是日常窃听下的多维隐私而非单纯声纹识别时,这个数据集的思路值得借鉴,因为它把语音之外的歌唱咳嗽脚步都变成可比较的输入,并用统一增益解决跨属性比较。当已有模型是单属性专用分类器时,可以尝试论文的联合多属性微调,因为 1 次输出全部标签可能学到属性间一致性,但代价是需要设计严格输出空间与解析规则。当目标是验证非语音是否安全时,不要因为直觉上脚步与身份无关就跳过测试,论文显示身体与环境线索仍可能被利用,只是受材质噪声影响而不稳定。
还需补的验证包括多次随机种子下的方差区间、更多架构与规模的覆盖、多段与跨类型融合攻击,以及误判率延迟与算力成本的联合报告。常见误解是把曲线向下直接读成性能变差,或把某属性在某音频上的高分推广为所有音频都高风险,正确做法是回到时长分布类别均衡与输入截断 3 个条件再下判断。总体而言,该工作把音频隐私从认出是谁推进到还原出怎样的人,复现时先抓住平行音频按人对齐与统一基线比较这两条主线,就能完整重走论文的方法。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



