英文题目:SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces
会议身份:
conference:interspeech:2026:conference-paper-id:zhang26y_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据集 #CTC #数据集构建 #静默语音接口
评分:7.7/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Ruidong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiacheng Liu:机构信息未能从会议 PDF 纯文本可靠映射
- François Guimbretière:机构信息未能从会议 PDF 纯文本可靠映射
- Cheng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
可穿戴静默语音接口(silent speech interface, SSI)需从无声面部运动直接恢复连续文本,输入为超声回波时序,输出为开放词表词序列,难点在于非接触信号微弱且发声与静默构音存在域偏移。数据链先以眼镜式主动声学传感采集双频调频连续波回波并同步记录语音与视频,再经带通滤波与距离维差分得到抑制静态反射的回波剖面,接着用残差编码器加联结时序分类(connectionist temporal classification, CTC)学习回波到子词的无对齐映射,最后以贪婪解码输出文本且全程不依赖外部语言模型。与依赖面肌电或舌超声的侵入式方案不同,该工作证明毫米级面部形变回波已蕴含可解码的音位信息。在配对的静默测试集上联合训练基线达到26.3%的词错误率(word error rate, WER),显著优于纯静默训练与跨模式直接迁移。该结论目前仅适用于单说话人安静环境下的朗读式对话英语。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 数据相关资源:https://doi.org/10.7298/xjjr-9m85 → https://ecommons.cornell.edu/entities/publication/6328648d-caa4-4314-9655-449c59e47918 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一个瓶颈?
本文的输入是戴在脸上的非接触传感器信号,目标是在用户不出声、只做口部动作时恢复出自然英语句子。输出是开放词汇的文本转写,用词错误率衡量,数值越低越好。必须保留的关键信息是数据规模、传感形态、语料来源和基线条件,否则无法判断结果是否可比。
可穿戴无声语音接口长期卡在一个两难里。能做开放词汇的系统依赖面部肌电电极或舌部超声探头,需要贴皮肤或固定下巴,日常无法佩戴。而眼镜、耳机、颈环等可接受形态只在几十个固定指令上评估,例如 31 词或 93 词的小集合。这不是单纯的模型问题,而是缺少大规模训练数据,导致社区无法验证连续自然语言在这种形态上是否可行。
SoniSpeech 的定位就是补这块基础设施。它提供 34 小时、18000 条话语的 3 模态同步数据,语料取自当代社交对话而非 19 世纪文学散文,覆盖 5356 个词类型和全部 39 个音素。基线只用回波信号做识别,在无声开放词汇上报告 26.3% 词错误率。理解后文时要抓住一条样本路径。同一句话先被有声说一遍,再被无声做一遍口型,两遍的回波、音频和视频被拍手标记对齐,最终只有无声回波被送入识别器去预测文本。
同类路线做了什么,为什么可穿戴开放词汇仍是空白?
按输入、目标、监督和运行阶段对照,现有路线分成两类。第一类是高精度但笨重的开放词汇路线。面部肌电的代表工作采集约 20 小时单人数据,文本来自古腾堡计划,词错误率从 68% 降到 15% 以下,证明数据充足时开放词汇无声识别在计算上可行。舌部超声的 TaL 语料提供 24 小时、82 人的超声加唇视频加音频,静音部分很少。脑电路线做到单人 175 小时日语数据。
这些工作共享同一种监督。句子级文本加连接时序分类或序列到序列,运行阶段仍需实验室固定装置。
第二类是轻便但封闭词汇路线。声学 EchoSpeech、深度 WatchYourMouth、惯性测量单元唇接口等都采用眼镜或小设备,评估词汇量停留在 31 词、40 词、54 词、93 词量级。它们的问题不是硬件一定不行,而是没有开放词汇训练集,只能用人工编的小指令集演示分类准确率。两类工作的交集是空白。没有公开的、大规模的、非接触可穿戴开放词汇语料。
SoniSpeech 正好落在交集上。它保留可穿戴眼镜形态,同时把词汇打开到数千词,并公开数据。论文用表格对比说明它是首个最小侵入形态的 3 模态开放词汇集。这种对照不能读成同条件胜负,因为肌电和脑电的传感器、说话人、语言都不同,只能说明形态与规模的权衡位置。
要测的具体问题是什么,难在哪里?
具体任务是只看超声回波序列,解码出无声 mouthing 的开放词汇句子。举例说明。假如测试句是对话里的我喜欢看陌生人情节这类当代口语,模型在训练时可能没见过其中某个词,仍需靠子词拼出来,而不是从固定列表里选。这就是开放词汇与封闭指令分类的本质区别。
难点有 3 层。第一是信号间接。回波不直接记录声带振动,而是记录面颊皮肤变形引起的传播路径变化,毫米级位移叠加环境反射,需要差分和距离裁剪才能突出语音相关成分。第二是域偏移。无声说话更慢更刻意,肌肉衔接不同,有声段的爆破擦音能量还会延伸到超声带,给回波带来有声才有的判别特征,静音时消失。
第三是评估诚实性。必须保留未登录词和完整音素覆盖,否则高分可能是记忆训练句式。
论文把问题拆成 3 个可验证的子问题。回波是否包含足够发音信息。用有声回波识别的有声文本性能验证。第二,无声是否可解码。用纯无声训练测试验证。
第三,有声数据能否帮助无声。用联合训练对比验证。这种拆法让每一组词错误率都有明确的对照含义。
数据与基线全景:一个句子经历了什么?
先沿一个样本走完全程。说话人看着图形界面显示的句子,先出声读一遍,眼镜上的两个扬声器同时发射 18 到 28 千赫和 29 到 39 千赫的两路扫频啁啾,两个麦克风以 100 千赫采样接收。笔记本摄像头同步录制 1920 乘 1080、30 帧的正面视频。拍手声提供跨设备时间锚点。接着同一句话再严格无声做一遍口型,不发声不耳语,内容完全相同。录制后切掉纠错和停顿,只保留有效话语段。
全景包括硬件、语料、采集和基线四块。硬件是镜框下沿的 2 扬声器加 2 麦克风,形成 4 条独立声路。语料来自 SODA 社交对话,经过可读性过滤和文本归一化。采集是单人、360 会话、每会话 50 句、有声无声各 180 会话。基线是去掉头部最大池化的 ResNet-34 加子词分词加连接时序分类损失。
下图给出硬件信号、同步结构、语料示例和研究方向的总览,读图时注意 3 模态如何对齐以及两种模式如何平行。
看图路径: 1. 先看左侧眼镜示意中扬声器与麦克风在镜框下沿的位置和 2 乘 2 共 4 条路径标注;2. 再看中间三模态同步列中无声列的可听语音位置如何显示为不可用;3. 对比底部 9000 条有声与 9000 条无声的配对标注理解平行语料含义;4. 最后看右侧当代对话示例与未来方向框确认开放词汇与多任务扩展
论文图 1。原论文 Figure 1:“Overview of SoniSpeech. (a) Hardware and signals.”。
图 1 左侧展示了眼镜结构与发射信号配置,中间明确 3 模态同步采集与有声无声平行对照,右侧点出当代口语语料与多模态扩展方向。关键要看到无声列的可听语音格被标为不可用,而回波与视频依然存在,这正是基线只能依赖回波的原因。图中 4 通道差分回波的可视化呈现为随时间变化的距离能量条纹,为后文 200 赫兹输入序列提供了直观对应。
传感与回波特征:超声如何变成模型输入?
硬件动作很具体。扬声器型号与麦克风型号在原文中给出,安装在镜框下沿。发射的是周期 5 毫秒的调频连续波啁啾,两路分别占据 18 到 28 千赫和 29 到 39 千赫。后端是 Teensy 4.0 加功放与模数转换,以 100 千赫采样。这种高采样是为了扩展带宽,捕捉更细的面部运动。
无声语音接口 × 声学传感眼镜: 无声语音接口负责在不出声只做口部动作时恢复语言内容,声学传感眼镜负责以非接触方式捕捉面部变形,二者搭配的理由是前者需要社交可接受的日常形态,后者用镜框上的扬声器发射人耳听不到的声波并接收回波,把唇颊运动转成可计算的回波序列,从而让开放词汇识别有了可穿戴的输入源。
特征提取分 4 步。第一步带通滤波,只保留两个超声带,去掉可听成分。第二步对 2 扬声器乘 2 麦克风的 4 条路径分别做距离处理,得到时间距离回波图。第三步时域差分,减去静态反射,突出动态变形。第 4 步裁到 80 个距离 bin,对应约 27.2 厘米传播路径,覆盖全脸跨距又抑制环境反射。最终输出是 4 通道、200 赫兹的差分回波序列。
回波轮廓 × 调频连续波: 调频连续波负责发射频率随时间线性扫频的超声啁啾,回波轮廓负责把接收信号按传播距离展开成随时间变化的距离能量图,二者搭配的原因是扫频提供了距离分辨率,时域差分又能去掉静态反射只留面部动态,组合后得到 4 通道、200 赫兹的差分回波序列作为识别模型的直接输入。
这里的组合不是简单堆通道。4 通道对应不同的空间路径,80 距离维对应不同的面部区域,200 赫兹对应发音的时间分辨率。去掉头部最大池化正是为了保留这种时间分辨率,后续用步长卷积做 16 倍降采样,再经频率维全局平均池化压成每步 512 维。这种设计把声学路径差异保留到编码器入口,而不是提前平均掉。
语料为什么选当代对话,做了哪些可复现的清洗?
语料选择有明确的部署理由。旧语料多用 1884 到 1964 年文学文本或 19 世纪散文,缺少我会、别这样、你知道吗、 gonna、智能手机这类缩略、话语标记、口语词和当代词。可穿戴接口面向日常对话,若训练在书面文学上,测试自然口语就会失配。SODA 是百万级社交对话蒸馏集,主题多样、语域随意,更接近真实使用。
清洗动作可以逐条复述。只保留 5 到 25 词、纯 ASCII 的句子,去掉网址、邮箱、非标准符号和角色前缀。用保性别的确定性人名映射把罕见名换成高频美国英语名,以降低字素到音素的未登录率,同时保持专有名词一致。文本归一化展开缩写,把数字和货币 verbalize,例如 20 转成 twenty,20 美元转成 twenty dollars。最终从 SODA 的训练与测试划分中分别抽 8000 句训练句和 1000 句测试句,避免数据泄漏。
结果是平均每句 14.4 词,总词符 258702,词类型 5356,测试集 1684 词类型中有 242 个训练未见词类型,音素 39 比 39 全覆盖。这种构造让未登录词随训练量下降的曲线和数据规模曲线都有意义,而不是靠重复训练句刷分。
基线如何训练:更新什么,用什么监督?
基线编码器是 ResNet-34 改的序列模型。输入是 4 通道、80 距离维的差分回波,去掉标准 stem 的最大池化,用 stem 与第 2、3、4 残差阶段的步长卷积做总计 16 倍时间降采样。2 维特征经频率维全局平均池化变成每步 512 维,再线性映射到子词 logits。全网用 32 组组归一化,以适应小批量稳定收敛。分词器是在转写文本上训练的 SentencePiece Unigram,词表 1000,支持拼出未见词。
有声模式 × 无声模式: 有声模式负责同时提供可听语音、视频和超声回波的完整 3 模态对齐,无声模式负责只提供回波加视频而无可听语音的真正测试条件,二者内容逐句配对的理由是让模型能先从有声数据学到发音结构,再检验到无声时的域偏移,组合意义在于把互补训练信号和跨域落差放在同一语料里可控地度量。
训练细节原文给出完整可复现条件。用连接时序分类损失,Adam 学习率 2 乘 10 的负 4 次方,权重衰减 10 的负 4 次方,指数衰减加线性热身,共 200 轮,批量 16。增强用 SpecAugment 的 2 个频率掩码加 3 个时间掩码,并把最多 3 个话语拼接到 15 秒以建模长上下文。训练数据取前 140 会话的 3 种配置。有声单独、无声单独、有声加无声联合,直接检验互补还是冲突。
残差网络 × 联结时序分类: 残差网络负责把 4 通道回波图沿时间和距离维度逐级编码成每步 512 维的表征,联结时序分类负责在没有帧级对齐标注时把变长表征对齐到子词序列,二者搭配的原因是回波长度随句子变化且边界未知,组合后只需句子级文本监督就能做开放词汇解码,并用贪婪解码给出可复现的下界基线。
需要明确监督来源与冻结情况。监督是句子级文本,无帧级对齐,梯度经连接时序分类回传到编码器与线性层,全参数更新,没有冻结主干或使用外部语言模型、预训练表征。解码用贪婪解码。原文未报告丢弃率调度以外的梯度截断、早停阈值和随机种子方差,这部分是缺项,复现时应固定种子并报告多次均值方差,而不是从模型名推定实现。
数据划分与评估条件:数字在什么口径下可比?
评估要先对齐口径,否则词错误率无法比较。数据集共 360 会话,有声无声各 180 会话,其中训练各 160 会话、测试各 20 会话,每会话 50 条。会话级总时长 34.1 小时,有效话语级 26.7 小时,会话利用率 78.3%,其余是纠错重录与停顿,已在后处理切除。采集自单名流利非母语英语作者,在安静受控环境完成。转写核验发现 9000 对中有 5 对不一致,失配率 0.06%,已修正。
下表整理数据集的关键规模与分布,比较时注意会话级与话语级时长、词类型与词符、平均时长与语速的区别,百分点与相对百分比不可混用。
| 条件 | 指标 | 会话级总量 | 有效话语级 | 语料与划分细节 |
|---|---|---|---|---|
| 有声加无声 | 总时长与条数 | 34.1 h | 26.7 h | 18000 条,180 加 180 会话 |
| 训练加测试 | 词类型与词符 | 5356 种 | 258702 个 | 训练 5114 种,测试 1684 种,测试未登录 242 种 |
| 有声对无声 | 平均时长与语速 | 5.26 s,162 w/min | 5.41 s,157 w/min | 无声慢 2.9%,音素覆盖 39 比 39 |
| 会话利用率 | 有效占比 | 78.3% | 26.7 h 有效 | 其余为修正重录停顿 |
| 语料来源 | 当代对话 | SODA 抽样 | 8000 训练句加 1000 测试句 | 平均 14.4 词每句 |
表后需要说明公平条件与代价。测试句来自 SODA 独立划分,开放词汇属性由 242 个未登录词类型保证。指标是词错误率,越低越好,聚合对象是测试集话语。代价是单人单环境,训练后 20 个无声会话与 11 个有声会话的 1 号麦克风噪声高,基线只用前 140 会话以保证通道等价,这意味着报告的规模曲线是等通道条件下的结果。音频模态的 0 通道仍可用,但基线未用它。
开放词汇 × 音素覆盖: 开放词汇负责允许测试句出现训练未见过的词,音素覆盖负责保证 39 个 ARPABET 音素在语料中都出现过,二者搭配的理由是只测封闭指令集无法证明自然语言能力,而只有音素齐全才能让子词模型有机会拼出未登录词,组合意义在于用 242 个测试集未登录词类型真实检验泛化而非记忆。
主结果:无声开放词汇做到什么程度,代价是什么?
核心比较是 3 种训练配置在有声与无声评估上的交叉结果。评价指标方向明确,词错误率越低越好。所有数字都是可运行的贪婪解码基线,无外部语言模型,因此是干净下界而非上限。
下表给出可直接复述的主结果,比较必须保留 3 个实际可运行策略,不能只报最优一项,事后最优与不可部署的 oracle 需另行标明。
| 训练数据 | 评估指标 | 有声评估词错误率 | 无声评估词错误率 | 适用条件 |
|---|---|---|---|---|
| 仅有声 140 会话 | 开放词汇词错误率 | 16.9% | 78.4% | 跨域测试,显示失配 |
| 仅无声 140 会话 | 开放词汇词错误率 | 55.7% | 33.7% | 同域基线,首次无声开放词汇报告 |
| 有声加无声联合 | 开放词汇词错误率 | 15.8% | 26.3% | 互补训练,最佳可部署 |
| 相对提升 | 无声错误率下降 | 未胜出项保留 | 33.7% 到 26.3% | 联合比纯无声显著改善 |
| 跨域落差 | 有声训无声测 | 大于 50% 落差 | 78.4% 对 33.7% | 域适应的核心证据 |
表后解释收益与反例。主要收益是联合训练把无声词错误率从 33.7% 降到 26.3%,同时有声也从 16.9% 微降到 15.8%,说明有声提供互补信号而非冲突。反例必须保留。仅有声训在无声测上高达 78.4%,仅无声训在有声测上 55.7%,跨域直接迁移失败。16.9% 的有声回波性能证明回波本身含足够发音信息,问题在发音动力学差异而非传感器完全无效。
下图展示音素分布、时长关系、未登录词趋势与规模曲线的像素证据,读图时区分分布与单样本标记,纵轴是原始词错误率而非改善量。
看图路径: 1. 先看图 a 横轴对数刻度下音素频率条形的长尾分布确认覆盖完整性;2. 再看图 b 有声与无声两条时长随词数增长的拟合线斜率差异;3. 对比图 c 训练会话数增加时评估集未登录词数下降的收敛趋势;4. 最后看图 d 红色静音训练曲线与蓝色加入有声训练后虚线段的衔接点
论文图 2。原论文 Figure 2:“Statistics and results. (a) Distribution of ARPAbet phoneme frequency in the SoniSpeech corpus.”。
图 2 的 4 个面板形成闭环。图 a 在对数频率轴上显示 39 个音素都有支撑。图 b 显示时长随词数线性增长,有声每词 0.30 秒、无声每词 0.31 秒,相关系数均为 0.94,无声更慢。图 c 显示训练会话增加时评估集未登录词类型数持续下降。图 d 显示无声训练从 10 到 140 会话词错误率单调下降且未饱和,叠加 140 有声会话后虚线段继续下探到 26.3%,支持大规模数据的价值,但也说明单调趋势不等于每一步等幅改善。
消融与失败条件:哪些因素被证实,哪些没有?
论文用数据规模扫描做消融。只用无声数据时,从 10 会话逐步加到 140 会话,无声评估词错误率(%)稳步下降,140 会话时仍未饱和。控制条件是只用通道等价的前 140 会话,排除后 20 会话单麦克风噪声的干扰。再叠加 140 有声会话,性能继续提升,说明不同模态的数据仍能提供增益。这支持先做单人词汇规模,再扩展多人的路线。
失败条件同样重要。跨模态失配不是简单的实现失误,原文归因三点。无声更慢,平均 5.41 秒对 5.26 秒,语速 157 对 162 词每分钟,口部动作更刻意。浊音能量延伸到 18 到 39 千赫超声带,爆破擦音直接影响回波,有声才有的特征在静音时缺失。肌肉参与与协同发音过渡不同,前人肌电研究也证实过类似现象。因此仅在有声上预训练不足以解决无声识别,未来需显式域适应。
未评测的边界要明确。基线不用语言模型、基础模型预训练或对比学习,留有很大提升空间,但原文没有给出加语言模型后的数字,不能把 26.3% 直接当作加语言模型后的成绩。多说话人、噪声行走、延迟功耗均未在本数据集上测量,不能从 EchoSpeech 的鲁棒性推定本语料同样鲁棒,只能说传感原理有迁移可能,待验证。
边界与误解:单人单环境意味着什么?
设计取舍是刻意为之。单人采集是为了先隔离词汇规模挑战,再处理说话人差异,这与 LJSpeech、肌电单人集、SSR7000 和脑电单人集的催化路径一致。声学眼镜在先前工作已显示多用户鲁棒性,但本数据集本身不包含多说话人证据,不能用来证明跨人泛化。
环境与硬件边界同样具体。采集在单一安静环境完成,没有行走噪声对照。训练划分后段存在单通道高噪声,但基线通过截取前 140 会话规避,复现时若用全量需处理通道缺失,否则口径不一致。视频来自笔记本集成摄像头而非眼镜第一视角,视角固定,分辨率与帧率明确,不能当作头戴视角的证据。
常见误解需要纠正。26.3% 不是加语言模型后的成绩,而是无语言模型贪婪解码的下界。有声 16.9% 不代表可听语音识别,而是纯回波预测有声文本,证明回波的信息量。78.4% 的跨域失败不是传感器无效,而是发音域偏移的科学发现。公开链接本次可达不等于长期可用,引用时应记录访问日期与版本号。
复现先做什么,需要哪些超参数与信息条件?
复现分数据与模型两路。数据路先经标识确认可用性。本次资源状态显示数据集链接可用,状态码 200,可写当前已公开,地址为官方 DOI。下载后按有声无声各 160 训练会话、20 测试会话、每会话 50 条核对条数,用拍手标记核对 3 模态同步,用转写核对 9000 对平行内容。注意文本已归一化,数字货币已 verbalize,人名已映射,直接用原始 SODA 文本对比会失配。
模型路按下表第三张的硬件与训练条件重建。输入是 4 通道差分回波,80 距离维,200 赫兹。编码器去掉最大池化,16 倍时间降采样,频率维全局平均池化到 512 维。分词用在转写上训练的 1000 子词。优化用 Adam 学习率 2 乘 10 的负 4 次方、权重衰减 10 的负 4 次方、指数衰减加线性热身,200 轮批量 16,SpecAugment 加话语拼接。评估用词错误率,贪婪解码,不加语言模型。
下表把硬件采样与训练预算放在同一视图,便于按图索骥准备环境,比较时注意采样率、频率带与轮数的单位不可省略。
| 子系统 | 关键配置 | 数值与单位 | 作用 | 备注 |
|---|---|---|---|---|
| 发射接收 | 扫频与周期 | 18 到 28 kHz,29 到 39 kHz,5 ms 周期 | 提供距离分辨 | 2 扬声器乘 2 麦克风共 4 路 |
| 采样视频 | 音频视频 | 100 kHz 采样,1920 乘 1080,30 fps | 同步 3 模态 | 拍手对齐时间戳 |
| 回波特征 | 通道频率 | 4 通道,200 Hz 序列,80 距离维 | 模型输入 | 差分去静态反射 |
| 增强解码 | 掩码拼接 | 2 频率掩码 3 时间掩码,拼至 15 s | 长上下文 | 贪婪解码无语言模型 |
表后说明代价与缺项。训练 200 轮在小批量下收敛稳定,但原文未报告显卡型号、耗时与推理帧率,训练资源与实际延迟需分开讨论,不能用轮数推定延迟。单通道噪声会话的处理、随机种子、早停都需自行固定并报告。代码开源、权重下载与系统可运行是三件不同的事,本文只保证数据公开与基线可重建,不承诺开箱即用的实时系统。
何时值得尝试,还需补哪项验证?
当你的目标是日常可佩戴的无声输入,且需要超出固定指令的自然表达时,这个数据集值得尝试。它提供了从回波到文本的完整监督,以及有声平行数据做域适应、多任务与对比学习。已有证据显示联合训练有效、规模未饱和,继续加数据或引入视频音频自监督预训练是合理下一步。跨模态对比学习、静音到语音合成、多模态增强分离都在论文展望内。
但采用前要补三项验证。第一是多说话人与真实噪声下的复测,因为当前数字只在单人安静条件下成立。第二是语言模型与预训练带来的增益与延迟代价,因为当前是无语言模型下界,实际部署需权衡。第三是误判率与隐私可用性评估,因为词错误率不等于可用性,静音误触发、口型相似词混淆都未测量。
一句话收束。SoniSpeech 把可穿戴无声接口从封闭指令推到开放词汇的起点,用配对 3 模态与 26.3% 的可复现基线证明任务可行,同时用 78.4% 的跨域落差指明下一步必须解决发音域偏移,而不是简单堆更多有声数据。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

