英文题目:Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition
标签:#语音识别 | #Adapter | #说话人分离标注 | #隐私保护 | #会议转录
评分:6.4/10 | 创新 1.6/2 | 技术严谨 0.9/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Bo Su:机构信息未在 arXiv HTML 中可靠披露
- Yueru Yan:机构信息未在 arXiv HTML 中可靠披露
- Thai Le:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
目标说话人遗忘识别以多说话人录音与拒转说话人注册音频为输入,要求输出保留说话人标签与时间戳的完整转写但删除遗忘者文本,难点在于重叠语音下同帧包含保留与遗忘内容且遗忘集合在推理时动态指定。方法先以冻结双流语音编码器分别抽取内容流与说话人流特征并由注册音频均值池化得到目标嵌入。接着由双层感知机根据帧特征与嵌入拼接及余弦相似度输出帧级匹配分并取多目标最大值。最后以该分数调制内容流后与未改动的说话人流共同送入大语言模型解码为可扩展标记语言转写。相比训练样本遗忘类机器遗忘,该机制在推理流上按说话人条件抑制语义而不破坏声纹分支,支持未见说话人免训练切换。在AliMeeting评测任务下,附ECG模型的CLR-all指标为27.3%,低于无ECG基线的CLR-all指标73.6%。该适用边界集中在短分段离线场景,失败条件包括重叠段与纯遗忘段的残留泄露。该结论限于0.5 s至80 s短分段离线评测且重叠与纯遗忘段仍有显著泄露,未验证长会议与实时流式外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
会议里有人不想被转写,系统该输入什么并输出什么?
这篇论文面对的是线上会议的自动转写场景。输入是一段多人会议录音,其中包含全部说话人的集合,输出是一份带说话人标签和起止时间的结构化文本。新增的要求是,在推理时给定一份退出名单,系统要在 1 次前向中转写所有人,但把名单上的人的词隐去,同时仍然标出他们在何时说话。例如转写本可以写明某说话人在 10 秒到 15 秒开口,但不显示其具体文字。
必须保留的信息有两类,一是退出者的活动时间与身份标签,二是保留者的文字内容,包括在与退出者语音重叠时尽量不受损。论文把会后按说话人过滤录音片段的做法视为事后补救,指出它不仅为时已晚,而且在语音重叠时会误删他人内容。把模型整体重新训练也被视为不可行,因为退出请求可能在部署后动态出现,而底层是复杂的大语言模型架构,重复训练代价高。
目标说话人遗忘转写 × 目标说话人抽取转写: 目标说话人遗忘转写负责转写除退出名单之外的所有人并隐去退出者的词,同时保留其何时说话的日记信息;目标说话人抽取转写只转写被选中的一个人。两者输入都是多人录音加语音线索,但分工相反,前者是做减法且要处理重叠,后者是做聚焦,搭配比较才能理解为什么不能直接复用抽取模型来解决遗忘问题。
初学者容易把遗忘理解成删除训练数据的影响。论文明确区分了两种路线,一种是机器遗忘中去除训练样本影响的工作,另一种是在推理流中压制特定内容的工作。当前任务属于后者,而且说话人此前可能从未出现在模型训练中,目标是在推理时按短注册语音动态排除。教学例子是,假设会议有甲乙丙 3 人,乙在会中提出不希望被转写,系统拿到乙的一小段纯净语音作为注册样本,输出应保留甲丙的发言文字,把乙的发言位置标记为有人说话但隐去文字。
如果乙与甲同时开口,时间轴上的同一帧同时包含 2 人声音,任何只按时间压制的机制都会两难,这正是论文强调的端到端多说话人框架下的非平凡之处。
同样输入下,抽取、重训与推理压制有何不同?
按同输入、同目标、同监督来对照,目标说话人抽取转写与本文任务输入相似,都使用多人录音加目标语音线索,但目标相反。抽取只保留目标人,遗忘要保留除目标外的所有人,因此抽取的掩码或注意力策略不能直接翻转使用,重叠段的取舍逻辑完全不同。机器遗忘中去除训练影响的一支工作,监督来自训练集成员关系,运行阶段在训练后做参数修正,与本文在推理时按未见过的注册语音做内容抑制不同,不能解决动态退出问题。
推理流压制内容的工作与本文运行阶段一致,都是在不重训主干的前提下干预生成,但会议转写还要求处理说话人切换与重叠,并保留日记信息,这是通用内容抑制未覆盖的约束。论文选择的可插拔门控路线,是为了在冻结主干的条件下获得可更换条件的抑制能力,而不是为每个退出者单独微调或重训。
本研究没有提供代码、模型或数据的可达性声明。证据中声明资源状态为未发现来源绑定且完成验证的资源,因此不能写代码或权重已公开,只能按论文文字复述方法与实验条件。这一点决定了后文复现部分只能讲数据划分、注册样本构造、指标计算与超参数,而不能给出可下载链接。
什么算忘干净,什么算没误伤他人?
论文把任务形式化为给定录音与每个退出者的一段短注册音频,计算 1 次输出。退出者集合在推理时选定,保留者集合是全集减去退出者。2 个条件是,退出者的任何话语不得以任何说话人标签出现在文本中,但其日记必须保留,即仍要报告有人说话及其时间;保留者的输出要与不做遗忘时的模型输出一致,包括目标与保留语音可能重叠的位置。论文指出这 2 个条件在退出者单独说话时可独立满足,在重叠时存在竞争,因为按时间轴作用的机制无法在同一帧只压制一个声音而不触碰另一个。
评价上论文把两类错误分开度量。内容泄露率检查退出者原文在整篇生成文本中的残留,即使把退出者的词错标给保留者也算泄露。保留者转写准确率则只统计与保留者对齐后的误差。论文特别提醒,交出空文本可以得到零泄露,因此低泄露本身不证明选择性遗忘成功,必须与保留者误差并列解读。纯遗忘段的正确行为是省略全部词但保留说话人信息,而混合段的同样输出可能丢掉本应保留的词,这是后文分组报告的原因。
双流冻结主干上,门控插在哪里并改变什么?
方法全景可以沿一个样本走一遍。输入是会议 utterance 与退出者的短注册语音。主干是 TagSpeech 架构,使用两个 Zipformer 编码器,一个语义编码器处理内容,一个说话人编码器处理身份,各自经过投影后作为 Qwen2.5-7B 大语言模型的输入特征,大语言模型输出 XML 格式的文字、说话人标签与时间。门控模块插在编码器与投影之间,它用说话人流估计每 1 帧是否包含退出者语音,然后对语义流做逐帧压制,同时让说话人流原样通过。这样大语言模型收到的内容信息在退出者活动时被削弱,但身份与时间信息仍在,因而更可能输出有人说话但无文字的结构。
以下导读帮助对照原文总览图理解主路径与干预位置,图中上方为多人话音示例,中间为冻结主干与可训练门控,底部为压制后仍保留标签的结构化输出,阅读时先看输入到输出的纵向箭头,再看横向双分支的汇合方式。
看图路径: 1. 先从顶部输入框沿箭头向下走,确认会议话音进入冻结双编码器再进入大语言模型的主路径;2. 对比中间语义投影与说话人投影两条分支,观察门控只作用在语义一侧的位置;3. 到底部结构化输出,核对被压制文本行与保留的说话人标签行的对应关系;4. 注意图例中冻结与可训练标记,确认只有门控模块是可训练状态
论文图 1。原论文 Figure 1::“Overview of TSU-ASR and the proposed ECG module that reduces information in the content stream during inference when target speakers are likely to be speaking.”。
该图显示输入框用不同颜色区分受保护说话人与保留说话人的话语区间,中间框标明语义编码器、说话人编码器、各自投影与大语言模型均为冻结,只有门控为可训练,箭头表明说话人特征进入门控,门控输出作用回语义流。底部输出示例把受保护者的文字行标记为被压制,而说话人标签行仍然列出对应编号与时间区间。这与文字描述一致,即内容流被按帧削弱,说话人流保持不变。训练时只更新门控,主干参数冻结,因此更换退出者只需提供新的注册语音,无需再次训练。
注册语音如何变成逐帧的压制强度?
组件计算从同一说话人编码器投影前特征出发,保证帧特征与注册嵌入处于同一特征空间。每个退出者的注册嵌入是对其短语音样本提取特征后平均并归一化得到。测试时论文对每个目标说话人收集 5 段单独说话区间,平均其嵌入作为该说话人的模板。对每一时间帧,轻量两层多层感知机接收帧语音特征、注册嵌入、两者逐元素乘积与余弦相似度,输出经逻辑函数压缩到零到一的匹配分数。
若有多个退出者,每帧取最大匹配分数,再用该分数逐点乘到对应时刻的语义流上。分数越高,内容流被压制越强。连续分数而非二值判决的设计是为了便于反向传播训练。
语义编码器 × 说话人编码器: 语义编码器负责提取用于识别文字的内容特征,说话人编码器负责提取用于判断是谁在说话的声纹特征。两者走两条独立投影后进入大语言模型,搭配理由是内容与身份可以分别干预,组合意义在于门控只压制语义流而保持说话人流不变,从而隐词但不丢日记。
符号与输入先说清楚,帧语音特征是当前帧的说话人流向量,注册嵌入是目标说话人的模板向量,余弦相似度提供显式的方向一致性,逐元素乘积保留细粒度交互,拼接后送入多层感知机得到匹配概率。计算目标是估计该帧含有退出者语音的可能性,并把它转化为语义流的保留比例。原文明确的实现是多退出者取最大,再做乘法压制。
\[\displaystyle g_{t,e_{k}}\]上式给出单帧对单个目标的门控分数,输入为帧特征、模板及其相似度,输出为零到一的连续值。下一式给出多目标下的压制操作,取所有退出者分数的最大值后与语义特征相乘。
\[\displaystyle s_{t}\leftarrow s_{t}*\max\{g_{t,e_{k}}\;|\;e_{k}\in\mathcal{F}\},\]该操作假设退出集合非空,空集时不做压制。需要强调的是,论文未报告门控分数是否经过阈值 2 值化后再作用,文字写的是直接用连续分数相乘,因此复述时不应脑补硬判决步骤。
内容泄露率 × 保留者词错率: 内容泄露率统计退出者原文有多少词或字以最长公共子序列形式残留在整篇生成文本中,保留者词错率只统计与保留说话人对齐后的转写错误。前者管是否忘干净,后者管是否误伤他人,两者必须并列报告,因为交出空文本也能得到零泄露,只有对照才能证明是选择性遗忘。
注册嵌入 × 帧级门控分数: 注册嵌入是对退出者短语音样本取平均归一后得到的身份模板,帧级门控分数是每一短时帧与该模板的匹配概率。注册嵌入提供推理时可更换的条件,门控分数提供逐帧可微的压制强度,两者组合使新退出者无需再训练即可在推理时被抑制。
泄露与保留误差各自如何计算才不互相掩盖?
评价组件需要先统一文本归一化,即转小写并去除标点,英文按词计分,中文按字计分。内容泄露率的分子是对每个段计算退出者原文与整篇生成文本的最长公共子序列长度,分母是退出者原文总长度。最长公共子序列只要求顺序一致,不要求连续,因此即使词被打散插入仍会计入。论文还报告仅在低频词或字上的泄露率,低频定义为文档频率低于 1%,目的是减少跨说话人共有常用表达带来的偶然匹配。两类分数都以百分比呈现,越低表示压制越有效。因为检查的是整篇生成文本,把退出内容标给保留者仍算泄露。
保留者准确率使用会议转写的标准词错率及其字符版本,后缀表示仅统计保留者。具体做法是把全部参考说话人同时与预测标签做联合匹配,取总转写误差最小的分配,再只统计匹配到保留者的输出。与退出者匹配的输出不计入, unmatched 输出被忽略。论文明确把保留者误差与泄露率并列报告,理由是单看低误差不能证明受保护内容已被移除,而空文本可通过省略所有人获得零泄露。这种设计避免了用单一指标掩盖误伤。
只训练门控时,监督信号从哪两处来?
训练阶段主干参数冻结,只训练门控模块。构造上以二分之一概率选择录音中出现的说话人作为目标,并从训练文本中移除其文字,但保留说话人标签与时间不变,否则不选任何排除对象而使用原文。每个训练样本还包含一个不在录音中的说话人的语音样本作为负例,帮助门控学习区分。损失由两项组成,一项是生成输出相对去掉遗忘者文本后的参考的下一词交叉熵,另一项是门控对数相对帧级二值标签的二值交叉熵,帧标签指示说话人匹配段。系数分别平衡两项,前者引导生成行为,后者优化说话人匹配能力。
训练时文本交叉熵 × 门控二值交叉熵: 训练时文本交叉熵监督大模型生成去掉退出者文字但保留标签与时间的期望输出,门控二值交叉熵直接监督每帧是否命中退出者的二值标签。前者管最终文本行为,后者管中间匹配能力,搭配原因是仅有文本损失时门控难以学到稳定的说话人判别,仅有帧损失时又不能保证语言模型真的省略,两项加权才同时成形。
原文给出的损失形式以加权和呈现,权重在全部结果中取为 1.0 与 1.0。先解释符号,预测文本是模型生成,期望文本是移除退出者文字后的参考,门控对数是逐帧匹配分数,帧标签是是否命中的二值指示。计算目标是同时让文本省略正确且门控判别准确。
\[\mathcal{L}=\alpha\mathrm{CE}(\hat{y},\,y^{-})+\beta\mathrm{BCE}(g,\,m),\]内容泄露率的计算形式如下,分子分母都是跨段求和,分子用最长公共子序列度量残留,分母用原文长度归一化。
\[\displaystyle\mathrm{CLR}=\frac{\sum_{x}\mathrm{LCS}\big(r(x),h(x)\big)}{\sum_{x}|r(x)|},\]论文未报告优化器类型、学习率、训练步数与硬件预算等细节,这些属于缺项,复述时应明确指出未给出,不能从模型名称推定实现。梯度路径上门控分数经乘法进入语义流再影响语言模型输出,因此文本交叉熵可经该路径回传,但原文未展开梯度细节,不做猜测。重置时机方面,更换退出者无需再训练,只需更换注册嵌入,这是推理时动态退出的关键。
数据、划分与注册样本如何保证测到未见过的人?
实验使用 AMI 英文单个远场麦克风与 AliMeeting 中文首个远场通道。按主干解码设置保留时长 0.5 秒到 80 秒的语音段,剩下 AMI 上两千多段与 AliMeeting 上四千多段,具体为 AMI 2607 段与 AliMeeting 4373 段。每个数据集先按约 10% 录音时长划分测试集,得到 AMI 16 人与 AliMeeting 60 人,剩余为训练集,并保证训练与测试说话人不重叠,以测试对训练未见说话人的泛化。每个测试划分随机抽取 25% 说话人作为退出集,即 AMI 16 人中抽 4 人,AliMeeting 60 人中抽 15 人,剩余为保留集,重复抽样 10 次并平均结果。每个退出者收集 5 段 3 到 8 秒的单独说话区间作为注册语音,测试时平均 5 段嵌入得到模板。
分组上分为仅保留、仅遗忘与两类混合。混合重叠指受保护与保留语音重叠超过 0.05 秒,其余混合为非重叠。论文指出混合非重叠段很少,因为切分时在停顿处断开。指标方向上泄露率越低越好,保留者误差越低越好,比较时必须同时看两者。以下表格整理论文连续正文中实际出现的规模与划分条件,用于核对实验量级与可重放的采样口径,表中数字与单位保留原文写法。
| 数据集 | 切分后语音段数 | 测试说话人总数 | 抽取退出者数 | 每人注册样本数 |
|---|---|---|---|---|
| AMI 英文会议 | 2,607 段 | 16 人 | 4 out of 16 人 | five 段 3–8 s |
| AliMeeting 中文会议 | 4,373 段 | 60 人 | 15 out of 60 人 | five 段 3–8 s |
上表说明实验在两个语言上都有数千段与数十人规模,测试说话人与训练不重叠,退出集按 1/4 比例重复 10 次抽样,注册样本限定为单独说话区间。代价是混合非重叠组样本极少,后文该组结论显著性较弱。未报告解码束宽、批大小与推理延迟,部署成本无法从本文直接得出。
退出者忘了多少,保留者又付出什么代价?
主结果要回答两个并列问题,一是退出内容残留下降多少,二是保留者误差变化多少,条件是否一致是同一门控开关前后的对比。论文报告在全部段上 AMI 的全部词泄露率从 72.3% 降到 48.2%,AliMeeting 的全部字泄露率从 73.6% 降到 27.3%。低频单位上的下降为 AMI 减少 25.4 个百分点、AliMeeting 减少 42.7 个百分点,保留者误差分别上升 1.2 个百分点与 2.3 个百分点。总体判断是退出者得到有效抑制,保留者基本持平,但平均数掩盖了分组差异。
以下表格用原文连续句中的数字整理核心可运行对比,基线为未接门控的主干,策略为接入冻结主干的门控,不引入事后最优或人工指定时间戳等不可部署对照。
| 数据集 | 评价粒度 | 未接门控泄露率 | 接入门控泄露率 | 低频泄露下降与保留代价 |
|---|---|---|---|---|
| AMI 英文 | opt-out words | 72.3% | 48.2% | CLR-rare 下降 25.4%,保留误差上升 1.2% |
| AliMeeting 中文 | opt-out characters | 73.6% | 27.3% | CLR-rare 下降 42.7%,保留误差上升 2.3% |
上表的主要收益是两语言上退出内容大幅下降,中文下降更明显。具体代价是保留者误差小幅上升,且后文分组显示代价集中在混合段。反例是即使纯遗忘段仍有残留,说明重叠不是唯一障碍,冻结大语言模型仍可能利用残余信息完成转写。
以下导读对应原文按分组展示的柱图,上排为低频泄露率,下排为保留者误差,左右分别为英文与中文,每组内浅色为基线、深色为接入模块,阅读时先看高度差方向,再结合升降好坏判断。
看图路径: 1. 先看顶部两幅泄露率柱图,对比每组内浅色基线与深色接入门控后的高度差;2. 再看底部两幅保留者误差柱图,确认只保留段几乎持平而混合段略有抬高;3. 重点观察右侧中文会议在纯遗忘段泄露率下降最陡的一组柱子;4. 核对横轴四种分组名称,区分纯保留、混合非重叠、混合重叠与纯遗忘的不同条件
论文图 2。原论文 Figure 2::“CLR-rare (top) and retained-speaker transcription error (bottom), without and with ECG.”。
该图可见纯保留组在两语言上深浅柱几乎等高,说明无退出者时门控几乎不干扰。混合非重叠与混合重叠组在接入后泄露柱明显变矮,但保留误差柱略有变高,其中中文混合非重叠组的保留误差抬高幅度在视觉上更突出,但该组样本量很小。纯遗忘组泄露柱下降显著,中文降到约十分之一左右,而该组无保留误差可报。像素可辨的数值标签与正文表格一致,支持选择性遗忘有效但混合段有代价的判断。
分组与训练构造如何影响对效果的归因?
论文的分组比较承担了消融式论证。按说话人是否同段出现,保留者存在会轻微阻碍退出者抑制,中文上更明显,英文上边际。这支持按时间压制在混合段更难的解释。纯遗忘组仍有泄露,排除了重叠是唯一障碍的假设,论文给出的有限解释是仍有足够信息到达冻结大语言模型以支持转写,这属于支持性解释而非因果证明。保留者方面,仅保留组误差几乎不变,损失出现在受保护与保留语音共享同段时,模型必须在压制部分内容的同时继续转写其余内容。混合非重叠组误差也上升,但样本小使比较显著性不足。
训练构造上以二分之一概率选择目标并移除其文字,否则用原文,每个样本还带一个缺席说话人负例。以下表格整理该构造的可重放细节,数字来自原文连续句,不做推断补充。
| 训练条件 | 目标选择概率 | 目标存在时文本处理 | 无目标时文本处理 | 损失权重 |
|---|---|---|---|---|
| 门控适配训练 | 0.5 | 移除目标词保留标签时间 | 使用原始 transcript | α1.0 与 β1.0 |
上表说明训练同时见到遗忘与不遗忘两种情况,并用负例抑制误匹配。未胜出项是混合段的保留误差未能完全持平,特别是小样本的混合非重叠组波动大。未评测边界包括退出者单独说话但注册语音质量差、注册样本含重叠或噪声、以及 3 人以上同时重叠时的行为,这些在本文条件下无法得出结论。
哪些结论成立,哪些还只是可能?
论文直接报告的是,在训练未见说话人上,门控能按注册语音降低泄露率,且纯保留段保留者误差几乎不变,这是可复述的事实。有限解释是,纯遗忘段仍有泄露可能源于残余信息到达冻结大语言模型,该解释与观察一致但未做干预验证,应表述为支持而非证实。未验证推测包括门控是否可迁移到其他语音大语言模型、是否在更长会议或更嘈杂注册条件下同样有效,原文未测量误判率、延迟与计算开销,因此不能承诺这些量得到改善。总体趋势不等于每组每步都成立,例如中文混合非重叠组的保留误差上升幅度远大于平均值。
另一个误解是把低泄露等同于成功。论文用两个发现提醒, finding 之一是仅看纯遗忘组的低泄露不充分,因为空文本也能得零分,必须检查混合段是否误删; finding 之二是门控是解决该任务的有力第一步,能学到说话人匹配并转化为对语义残差流的概率控制,但仍是起点而非终点。相关性不是因果,重叠与泄露的相关不能直接断言重叠导致全部残留,还需控制残余信息量的实验才能分离。
要复现先做什么,需要补哪些缺项?
复现先做数据与划分。按 0.5 秒到 80 秒保留语音段,划分约 10% 时长为测试集并保证说话人不重叠,重复 10 次随机抽取 1/4 说话人作为退出集。注册样本从退出者单独说话区间取 5 段 3 到 8 秒,平均嵌入得到模板。推理时对每帧计算与各退出模板的匹配分数并取最大,再乘到语义流,空退出集时不压制。训练时冻结主干,只更新两层感知机,以二分之一概率构造遗忘目标并保留标签时间,加入缺席说话人负例,损失权重取 1.0 与 1.0。评价时文本小写去标点,英文按词、中文按字计算泄露率与保留者误差,并同时报告低频单位结果。
还需补的验证包括优化器、学习率、训练轮数、批大小、硬件与推理延迟,这些原文未报告,无法直接复跑。统计方法上原文为 10 次抽样平均,未报告方差或显著性检验,复现时应补标准差与置信区间。硬件预算与输出帧率也未给出,实际延迟需单独测量。由于资源状态为不可用,不能假设代码或权重可下载,应按文字重新实现门控并适配自己的双流主干。
何时值得尝试这种只动内容流的遗忘?
当应用要求在 1 次会议中动态响应退出请求,又不能让退出者离开会议,且必须保留谁何时说话的日记时,这种只压制语义流、保留说话人流的设计值得尝试。它的前提是主干本身已分离内容与身份两条路径,且能提供投影前的说话人特征用于匹配。若主干是单流或身份与内容纠缠,门控无处下手。注册语音需要是目标人单独说话的短样本,若只能拿到含重叠或强噪声的样本,匹配分数的可靠性待验证。
行动建议是,先在纯保留段验证接入后误差不变,再看纯遗忘段泄露下降,最后才看混合重叠段的取舍。若纯保留段已出现明显漂移,说明门控误触发率高,应先调匹配特征与负例构造。若纯遗忘段残留仍高,说明压制强度不足或残余信息过多,需检查乘法位置与分数分布。部署前必须补测误判率、延迟与长时稳定性,因为本文未测量这些量。总体上论文提供了一个轻量、可更换条件的起点方案,其价值在于无需为每个新退出者再训练,而代价集中在混合段的保留者小幅损失与重叠帧的固有两难。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses