英文题目:Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios
会议身份:
conference:interspeech:2026:conference-paper-id:yang26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#评测协议 #模型比较 #目标说话人提取 #语音唤醒
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Yiming Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Guangyong Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Haixin Guan:机构信息未能从会议 PDF 纯文本可靠映射
- Yanhua Long:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
目标说话人提取 Target Speech Extraction / TSE 在本工作中输入为含唤醒词的连续单通道流经关键词检测 Keyword Spotting / KWS 切分后的唤醒片段加后续查询混合,输出为目标查询干净语音,难点是注册仅约1.0秒且本身被电视综艺噪声、节目人声与房间内干扰人声污染。关键词检测先从连续交互流中切分出唤醒片段与后续查询混合,其切分输出的污染唤醒片段直接作为短时注册线索送入后续环节。零样本语音合成 Zero-Shot Text to Speech / ZS-TTS再以该污染唤醒为声学提示重建干净注册文本语音,其合成输出通过干净重合成替代或拼接扩充增强原注册,并条件驱动判别式与生成式提取主干完成目标提取。与依赖预录多秒干净注册的传统范式相比,差异在于把交互固有瞬态信号变为注册源并用合成语音去污而非要求用户配合。在FarNoise-10场景下,CIE-mDPTNet以原始噪声唤醒为注册的词错误率Word Error Rate / WER为4.54%,低于以xTTS干净重合成Clean Re-synthesis / CR为注册的词错误率Word Error Rate / WER 6.41%。该结论仅适用于中文唤醒词 Hi Pandora 与 Hello Cube、单通道近远场电视干扰场景,未验证英文、开放域噪声与多麦克风外推,尚待验证的外推范围与适用边界受限于该实录语料。原文未披露训练硬件、批量大小与部署延迟成本。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Yym-line/EoW-TSE — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/IndexTeam/IndexTTS-2 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?为什么预注册会打断对话?
本文输入是真实人机对话录音,目标是从含电视综艺背景、室内干扰说话人和混响的混合中抽出唤醒人后续的查询句。传统做法要求用户先在干净环境预录一段高质量注册语音,系统用它提取说话人嵌入再去引导分离。论文指出这一步对初次用户和自发交互很不友好,需要先注册再使用,破坏流畅性。于是提出唤醒即注册的框架:用户说 Hi Pandora 或 Hello Cube 触发设备,这段约 1 秒的唤醒词被关键词检测模块自动截下来,直接当作注册去抽取紧接着的查询混合。
举例来说,输入流是唤醒词加查询问天气,输出是去掉了电视声和他人声的查询干净语音。学习时先记住这个设定,后面所有短脏线索、合成增强和听感与识别脱节的讨论都从这里展开。论文同时声明代码当前可用,第三方合成模型链接本次可达,但正文实验的核心是抽取模型在这种新条件下的行为,比较重点是同一唤醒注册条件下不同模型的退化程度与瓶颈位置。
同任务有哪些路线?为什么还缺唤醒注册的研究?
按论文梳理,目标语音抽取按线索可分 3 类。第一类是纯音频注册路线,用说话人验证模型或专用说话人编码器提嵌入,近年还有去掉显式编码器的交互式适配和波形拼接提示方法,在 Libri2Mix 等基准上表现稳健。第二类是音视频路线,用唇动等视觉线索辅助,在视线被挡、低功耗设备和隐私场景受限。第 3 类是空间多通道路线,用麦克风阵列和到达方向定位目标,需要特定硬件。
论文认为无论哪条路线,大多默认有干净预注册或特殊硬件,没有回答交互中自然产生的短脏唤醒词能否当注册。因此本研究不做新的分离网络,而是把 4 种已有先进模型搬到统一的唤醒注册条件下做首次系统比较,并引入大模型零样本语音合成来清洗或延长注册。这一定位决定了后文实验不是刷榜,而是测退化和找瓶颈。
唤醒注册的形式化问题与两大困难是什么?
传统抽取把观测混合建模为目标干净语音加噪声干扰之和,用预录干净注册为条件做映射。唤醒注册把条件换成唤醒片段,输出是对查询混合的条件映射。白话说,传统是拿干净证件照找人,唤醒注册是拿刚在嘈杂门口拍的 1 秒模糊照片找人。论文明确两个困难。第一是信息稀缺,测试集平均注册时长约 1 秒,远短于传统基准多秒或多句注册,身份证据少。
第二是线索污染,唤醒片段和查询混合都混入了同样的电视背景人声和房间混响,注册本身已带干扰,容易把干扰人声纹带入引导。公式上只是把条件从预注册换成唤醒片段,但训练和评估条件完全变了。理解这一点才能明白为什么后文合成清洗能提听感却难降识别错误率。
系统全景:一段录音如何走完切分到抽取?
论文给出的全景分 3 步。第一步是关键词检测切分,把连续流切成唤醒片段和查询混合。第二步是唤醒即注册,直接把唤醒片段当注册,不再等待额外录音。第 3 步是目标抽取,用该短脏注册为条件从查询混合中分离目标查询句。下面先看系统示意图的整体走向,再对应到真实信号。
关键词检测切分 × 目标抽取: 关键词检测切分负责把连续输入流切成唤醒片段 xwake 和后续查询混合 xquery,目标抽取负责以后者为混合、以前者为条件输出目标查询。搭配理由是交互自然发生不需要额外录音,组合后形成先触发后提问的流水线,但也把切分误差、唤醒词混响和噪声直接传给抽取,成为论文强调的真实条件。
以下导读帮你带着问题看系统框图,重点是两路输入如何汇入抽取模块并产生一路输出。
看图路径: 1. 先沿左侧两路输入箭头看哪一路标为 Wake on Enroll,哪一路标为 Noisy Mixture;2. 再看两路箭头如何汇入中间 Target Speech extraction 方框;3. 最后看右侧输出波形是否为单人干净目标语音
论文图 1。原论文 Figure 1:“Illustration of EoW-TSE system.”。
从像素可见左侧有两条波形输入,上路标注为 Wake on Enroll 对应唤醒词,下路标注为 Noisy Mixture 对应含天气查询的混合,两箭头汇入中间 Target Speech extraction 方框,右侧输出一路更干净的蓝色目标语音波形。该图不支持训练细节推断,只说明推理时注册来自交互本身。结合正文,短和脏是该架构的固有代价,后续 4 个抽取模型和两种合成增强都是为了缓解这一代价。
四个抽取模型各用什么方式利用注册?
论文选了 3 个判别式模型和一个生成式模型。先说白话,判别式是做减法去噪,生成式是重画出自然语音。SEF-PNet 是无说话人编码器模型,用交互式说话人适配加局部全局上下文聚合,在时频域让注册和混合反复交互,不依赖外部声纹模型。LExt 做法极简,把注册加一小段粘合拼到混合波形前面,让网络先听到目标人再抽后面,骨干可用 TF-GridNet 等分离网络。CIE-mDPTNet 直接在时频域用注意力算注册与混合的相关权重,再用双路径 Transformer 同时抓短时谱变化和长时依赖。SoloSpeech 是级联生成管线,含音频压缩器、无嵌入抽取器和时频扩散修正器,在隐空间迭代修正以减少失真并提升自然度。
目标语音抽取 × 注册语音: 目标语音抽取负责从混合声中分离出特定说话人的查询句,注册语音负责告诉模型要听谁。两者搭配的理由是混合声本身不含身份指向,必须靠一段同说话人的参考来锁定声纹或时频模式,组合后系统先从注册中提身份线索,再以该线索为条件对混合做掩蔽或生成,从而实现按人抽取。
唤醒词注册 × 线索污染: 唤醒词注册指把关键词检测切出的 Hi Pandora 或 Hello Cube 片段直接当注册,不再要求用户预录干净语音;线索污染指该片段本身只有约 1 秒且混入了电视综艺声、室内干扰说话人和混响。两者搭配的关键是省去了注册负担但线索变短变脏,因此后续必须讨论合成清洗或更鲁棒的线索利用,否则抽取会跟错人或丢音素。
判别式模型 × 生成式模型: 判别式模型分工是直接估计掩蔽或映射得到波形,保音素结构但残留失真较机械;生成式模型分工是用压缩加扩散修正重建更自然的语音,听感好但可能改写音素。论文把 SEF-PNet、LExt、CIE-mDPTNet 与 SoloSpeech 放在同一唤醒注册条件下比较,搭配理由是看短脏线索下保真与自然度的取舍,组合意义是揭示听感分高不等于识别率高。
沿一个样本走一遍,输入是约 1 秒的 Hi Pandora 唤醒波形和约 1.8 秒的查询混合,表示是各自的时频或隐特征,组件按上述交互、拼接提示、注意力加权或压缩扩散方式融合,目标是恢复查询干净语音,输出是估计的目标波形。论文未报告这些模型在唤醒注册上的梯度路径改动,视为直接沿用原有 Libri2Mix 训练权重或同协议重训后做跨域测试,不从模型名推定其内部已适配短注册。
合成增强如何清洗和延长注册?
针对短脏线索,论文用 3 种零样本合成模型做身份保持的干净合成,分别是 IndexTTS2、xTTS 和 CosyVoice3,以噪声唤醒词为声学提示生成干净注册。白话说,就是让合成器模仿唤醒人的音色重说一遍。两种用法需要区分。干净重合成是重念原唤醒文本,只用合成的干净唤醒词当注册,目的是替换污染。扩展拼接是用大模型随机生成的句子文本再合成一段辅助干净语音,拼到原唤醒词后面形成更长的注册,目的是同时清洗和加长。论文说明扩展拼接的句子文本是用 ChatGPT 随机生成,与抽取训练无关。
干净重合成 × 扩展拼接: 干净重合成指用零样本语音合成以噪声唤醒词为声学提示重念同一唤醒文本得到干净注册,负责去噪;扩展拼接指再用大模型生成的新句子合成一段辅助干净语音并拼到原唤醒词后,负责加长身份证据。两者都想用合成的干净声纹稳定目标引导,前者替换污染,后者延长时长,论文对比它们是为了检验加长是否比单纯洗净更能补可懂度。
实际操作是合成器输入为文本加唤醒声学提示,输出为干净波形,再送入抽取模型当注册。论文报告合成能提升注册的听感分,但只有部分合成器能同时降低注册本身的识别错误率,这预示后文抽取结果会出现听感与识别分化。
模型如何训练?本研究训练了什么、复用了什么?
本节明确训练与复用的边界,重点是区分在本研究重训的判别式模型与直接复用已有检查点的模型。判别式 3 个模型中,SEF-PNet、CIE-mDPTNet 和 LExt 都在 Libri2Mix 的 train-100 子集、双说话人加噪的最短时长模式下训练,采样率 16 kHz。SEF-PNet 和 CIE-mDPTNet 训练 130 轮,用 Adam 优化器,初始学习率 5e-4,做 L2 梯度裁剪,前 100 轮每两轮乘 0.98 衰减,之后按 0.9 衰减。LExt 初始学习率 1e-4 加权重衰减 1e-5,骨干用比原版更紧凑的 TF-GridNet 配置以加快训练,执行顺序是先在 Libri2Mix 上完成分离训练再冻结转入真实唤醒注册测试。
生成式 SoloSpeech 未在本研究重训,直接使用原作者在 train-360 同混合条件下训练好的检查点。合成器 IndexTTS2、xTTS、CosyVoice3 也是直接调用开源权重做零样本提示合成,没有为本任务微调。因此跨到真实唤醒注册测试时属于域外或条件外评估,性能下降不能归因于训练未收敛。论文未报告冻结层、梯度是否经合成器回传等细节,复现时应视为抽取与合成解耦调用,不猜联合训练。
在什么真实条件下测?指标方向如何看?
测试集是 Unisound 采集的内录真实数据,分 5 个声学场景,区别在距麦距离、混响时间和信噪比。近场干净场景距离 1m 混响 0.4s,其余远场距离 3m,混响 0.4s 或 0.6s,信噪比 10 dB 和 5 dB 两档。除近场外背景均为电视综艺声,注册和混合都含节目人声加室内自发干扰人。唤醒词为中文 Hi Pandora 或 Hello Cube,每场景 15 到 45 人不等,共 2000 多条,平均注册约 1 秒、混合约 1.8 秒,执行上先按场景划分再统一用同一套信号与感知指标打分以保证公平比较。评估用信号保真度的 SI-SDR、语音质量 PESQ、短时可懂度 STOI,感知用 DNSMOS 及其 OVRL 总体分,识别用 Fun-ASR 服务加 meeteval 工具算词错误率。
方向是前五者越高越好,词错误率越低越好。需要提醒,自动识别分与人工听感不是同一维度,不能互相替代,信噪比写法中 10 dB 和 5 dB 是两档条件,不是同一指标的差值。
Libri2Mix 基线是否扎实?唤醒注册后发生什么?
先看基线是否可信,再看迁移到唤醒注册后的反转。下面表格整理论文在 Libri2Mix 双说话人加噪条件下的对照,数值越高表示分离保真和质量越好,参数和计算量只说明成本不决定胜负。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句三 | 11 | 10.47 | 1.88 | 87.26;3;61 |
该表显示判别式中 LExt 最好,生成式 SoloSpeech 在 SI-SDR 和 PESQ 上最高,说明所选模型在传统条件下都有竞争力,为后文跨条件比较提供公平起点。计算量按架构理论估算,大模型不代表在唤醒注册下仍胜出。
转到唤醒注册 5 个真实场景,论文报告出现感知与识别脱节。以下导读帮你看听感总体分随场景恶化的趋势,重点是生成式是否始终靠上而判别式中文识别更稳。
看图路径: 1. 先按横轴五个场景从近场到远场混响低信噪比看整体下降趋势;2. 再对比同一场景下生成式 SoloSpeech 折线与判别式 CIE-mDPTNet 折线的高低;3. 最后看每组柱子中不同合成注册颜色段与 Raw Noisy 虚线的相对位置
论文图 3。原论文 Figure 2:“OVRL scores on five scenarios: Original EoW-TSE vs. TTS-augmented (CR).”。
从像素可见横轴从 CloseNoise-10 到 FarNoiseReverb-5,纵轴 OVRL 在 1.00 到 3.00 之间,SoloSpeech 蓝色折线在各场景多为最高,其次是 SEF-PNet 绿色和 LExt 橙色,CIE-mDPTNet 红色最低,但各折线都随距离变远、混响变大、信噪比降低而下滑。每组柱子内不同合成注册颜色段多高于 Raw Noisy 虚线,说明合成注册能抬听感。论文同时报告词错误率趋势相反,CIE-mDPTNet 最稳而 SoloSpeech 随环境变复杂急剧升高,且没有模型在困难场景超过原始混合的直接识别。这支持听感好不等于音素保真的判断,可能的原因是生成重建引入了改写,待进一步验证。
哪种合成器和哪种用法真正有用?代价是什么?
本节按合成器选择和增强用法组织,测的是注册本身质量和抽取后效果,条件是同一唤醒注册测试集,指标方向是 DNSMOS 越高越好、词错误率越低越好。下面先看 3 种合成器直接对注册的重合成质量,比较问题是哪种合成在提升听感的同时不恶化识别。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | -10 | 2.029 | 2.472 | 2.564;2.609;14.61;39.76;11.23;40.36 |
| 来源句二 | -10 | 1.590 | 2.464 | 2.237;2.428;27.74;40.04;19.27;54.88 |
| 来源句三 | -10 | 1.262 | 2.549 | 1.917;2.114;19.69;33.45;16.10;59.71 |
| 来源句四 | -5 | 1.440 | 2.274 | 2.063;2.400;45.13;46.57;36.58;80.62 |
| 来源句五 | -5 | 1.251 | 2.473 | 1.743;2.107;70.58;55.86;44.47;102.54 |
表后解释是 xTTS 和 CosyVoice3 虽拿到更高 DNSMOS,但只有 IndexTTS2 在各场景一致降低注册本身的词错误率,例如远场混响 5 分贝从 70.58 降到 44.47,而另两种反而升到 55.86 和 102.54。这说明合成的听感分不能代替可懂度,选型必须同时看识别。论文正文图也显示 IndexTTS2 增强的抽取在可懂度上更稳。
再看增强用法对抽取的影响,比较干净重合成与扩展拼接在最稳的 CIE-mDPTNet 上有无差别。下面导读帮你看词错误率图中各模型折线与柱子的对应,越低越好。
看图路径: 1. 先确认纵轴是 WER 百分比越低越好,与听感图方向相反;2. 再看 CIE-mDPTNet 红色折线是否在各场景保持最低;3. 最后看 SoloSpeech 蓝色折线在混响低信噪比场景是否显著抬升
论文图 2。原论文 Figure 3:“WERs on five scenarios: Original EoW-TSE vs. TTS- augmented (CR).”。
从像素可见纵轴为 WER 百分比,横轴 5 个场景从左到右恶化,CIE-mDPTNet 红色折线始终贴近底部 Raw 虚线附近,而 SoloSpeech 蓝色和 SEF-PNet 绿色、LExt 橙色折线明显更高,尤其在远场低信噪比组柱子显著拉长。该图还显示 IndexTTS2 红色段在多数模型柱子中占主导且相对更矮,支持其更稳的结论,但像素不能精确读出每段数值,具体以原表为准。
下面是 CIE-mDPTNet 上两种用法的数字表,比较问题是加长是否比单纯替换更好。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | -10 | 1.904 | 2.163 | 2.119;2.197;2.170;3.10;4.37;3.24;3.91;3.48 |
| 来源句二 | -10 | 1.371 | 1.511 | 1.481;1.527;1.500;4.54;6.41;5.38;6.81;5.14 |
| 来源句三 | -10 | 1.165 | 1.202 | 1.200;1.214;1.195;3.52;7.15;5.06;7.00;6.08 |
| 来源句四 | -5 | 1.286 | 1.379 | 1.366;1.396;1.371;13.31;16.01;29.55;15.92;25.61 |
| 来源句五 | -5 | 1.173 | 1.216 | 1.223;1.217;1.212;15.95;22.89;31.32;23.12;28.36 |
表后解释是两种用法都比噪声注册提升 DNSMOS,扩展拼接在听感上略优于重合成,但词错误率都没有下降反而升高,例如近场从 3.10 升到 4 左右,远场低信噪比升幅更大。这构成关键反证,单纯加长注册不能补可懂度损失,论文据此提出感知增强与语言保真难以兼得仍是开放问题。未胜出项是 xTTS 扩展拼接在部分场景听感略高但识别更差,不应只看听感选型。
哪些结论有边界?什么还没有测?
论文直接报告的是在约 1 秒唤醒注册下,现有模型听感可提升但识别不如原始混合,合成清洗能缓解污染但平衡仍难。这得到跨五场景和多模型的一致支持。有限解释是生成模型音素失真导致识别差,这与听感高识别低的分化相符,但论文未做音素级对齐或误判率分解,属于可能而待验证。未验证的推测包括更长查询、其他语言唤醒词、实时关键词检测误差传播和多轮对话中的说话人切换,这些都不在本次测试内。
缺失证据不是技术错误,例如延迟、功耗、误唤醒率和人工主观听感都未测量,不能承诺本方案已可低延迟部署。总体趋势也不等于每条都成立,个别场景中 LExt 或 SEF-PNet 的相对顺序会变化,复现时应按场景分别报告而非只看平均。
要复现应先准备什么?关键参数如何保留?
复现先做三件事。第一是准备数据与权重,论文代码当前可用,合成器中 IndexTTS2 链接本次可达,抽取部分判别模型需按 Libri2Mix train-100 双说话人加噪最短时长协议训练 130 轮,SoloSpeech 用原作者 train-360 检查点,采样率统一 16 千赫。第二是保留训练超参,SEF-PNet 和 CIE-mDPTNet 初始学习率 5e-4 加 L2 梯度裁剪,前 100 轮每两轮乘 0.98 之后按 0.9 衰减,LExt 初始学习率 1e-4 加权重衰减 1e-5 并用紧凑 TF-GridNet。第三是固定评估,5 个真实场景按距离、混响和信噪比划分,用 SI-SDR、PESQ、STOI 看保真,用 DNSMOS 看感知,用 Fun-ASR 加 meeteval 算词错误率看可懂度。
常见误解是把 Libri2Mix 上的高分直接当唤醒注册性能,实际上跨到短脏注册会有明显退化,必须用真实唤醒切分重新测。另一个误解是把合成注册听感高当识别一定好,复现时应同时跑识别并对比 IndexTTS2 与其他合成器。
何时值得尝试唤醒注册?下一步补什么验证?
当产品希望免去预注册、允许用户直接唤醒就提问,且能接受先提听感再补识别的迭代时,值得尝试唤醒即注册加合成清洗的路线。具体做法是先用关键词检测切出唤醒词,再用 IndexTTS2 这类在注册识别上更稳的合成器做干净重合成,最后用识别更稳的判别模型做抽取,生成模型可用于离线提听感。还需补的验证包括音素级失真分析、关键词切分误差对抽取的影响、更低信噪比和强混响边界,以及人工听感与自动指标的一致性。
论文的价值在于给出首个系统比较和可复现基线,明确指出 1 秒唤醒参考下的信息稀缺与污染是主要瓶颈,合成能洗净音色但保不住全部语言细节。初学者沿输入到输出走通切分、注册、抽取 3 步,再对照听感与识别两张图,就能复述该方法的取舍。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


