英文题目:Prédiction automatique de la fréquence fondamentale à partir des mouvements articulatoires pour la communication silencieuse

会议身份:conference:jep:2026:conference-paper-id:ozkan26_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#CNN #发声与构音 #韵律 #静默语音接口

评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Beliz Ozkan:机构信息未能从会议 PDF 纯文本可靠映射
  • Jonas Michael:机构信息未能从会议 PDF 纯文本可靠映射
  • Thomas Hueber:机构信息未能从会议 PDF 纯文本可靠映射
  • Olivier Perrotin:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文任务是从超声舌像T与唇部视频L等发音运动观测预测逐帧中心化标准化基频f0曲线,输入缺少声门直接观测且仅有带声语音可提供Praat估计的监督目标,输出需在源滤波弱耦合假设下从声道形状间接推断声源变化,难点在于韵律显著性与上下文依赖难以从局部帧显式建模。方法链分三步:先按16.7至283.3毫秒可变窗堆叠目标帧周围舌唇图像形成上下文输入,再经卷积双分支编码器分别提取舌唇空域运动特征并拼接融合为联合表征,最后经时序回归头输出中心帧f0并以句级Spearman相关评估,词级再用连续小波变换显著度分级做细化分析。相对已有静默语音接口直接回归做法,关键差异在于系统扫描上下文尺度并引入词级显著度分级,同时以梅尔倒谱子带M0:2与M3:12对照区分强度谱倾斜与声道滤波器贡献,其实质意义是检验发音可观测性能解释多少韵律变化而非盲目扩大模型。在TaL语料句级评测设置下,L+T模型在TaL1上的Spearman相关指标为0.72,高于在TaL80上的Spearman相关指标0.66。词级分析显示高显著词预测质量较高而低显著词预测质量较低,上下文增大对舌唇模型提升有限而对梅尔倒谱模型影响更明显。该结论适用边界受限于英语有声朗读与TaL1参考说话人及Praat参考f0,跨至无声发音与跨语言及感知有效性尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:无声时还能留下什么语音线索?

本文的输入是研究者在无声语音接口中真正能拿到的东西,不是麦克风录到的带声音波形。目标读者可以这样理解任务起点:说话人不出声,只做发音动作,系统用超声探头看舌头、用摄像头看嘴唇,试图把句子说得多高多低的走势猜出来。输出不是文字,而是基频曲线的形状。基频用白话说就是声音的高低走势,英文是 fundamental frequency,缩写为 f0,有声段越高听感越尖,低则越沉,语调和重音都靠它携带。无声语音接口的英文是 silent speech interface,缩写为 SSI,它的目标是把无声的构音过程还原为可懂的语音。

无声语音接口 × 基频: 无声语音接口(SSI)负责把无声时的发音动作还原为可懂语音,基频(f0)负责携带声调、语调和重音等韵律信息;两者搭配的原因是只还原音素序列声音会平直生硬,必须同时给出 f0 曲线才能让合成语音有起伏,该组合的意义在于把本文任务定位为从动作到韵律的映射而非单纯的音素识别。

论文开篇交代的矛盾很具体:按源-滤波器理论,声带振动是源,舌唇运动更多属于滤波器,两端在理想模型里相对独立,那么只看舌唇为什么能猜出声带的振动频率。作者没有回避这个理论张力,而是把它变成可测量的实验问题。学习依赖上,读者需要先接受两点:一是本文只用有声音频来获得 f0 目标,无声段不参与监督;二是评估用的是相关性而非绝对音高误差,因此模型只要走势对就能得高分,整体偏高或偏低经过标准化后影响有限。这决定了后文所有数字的含义:它们回答的是走势还原得像不像,而不是绝对频率差了几赫兹。

前人走到了哪里:分段内容与韵律为何不同步?

在无声语音接口的发展脉络里,分段内容也就是发什么音,已经可以用深度学习做到相对满意,但韵律尤其是 f0 一直是短板。原文引用了 Denby 等人对 SSI 的综述作为任务背景,说明用各种实验装置捕捉无声构音并重建可懂语音是一条长期路线。接着引用了 Grósz 等人和 Csapó 等人的工作,指出已经有人用深度网络从构音手势预测 f0,并且效果与本文量级接近。这意味着本文不是从零证明可行性,而是在已有可行结果上追问更细的条件。

同目标对照要抓住监督和输入的一致性:前人的 f0 预测同样以构音图像为输入、以声学提取的 f0 为目标,运行阶段都是在没有音频时只靠图像推测。因此本文报告的 0,72 量级相关不能直接理解为超越前人,而是复现并确认了该路线在 TaL 语料上的表现。同输入但不同目标的对照是音素或频谱映射任务,那些任务更直接依赖舌唇形状,所以成绩好不代表 f0 也该好。

作者还引用了 Fant 的声学语音产生理论和 Dromey 关于响度、耳语下运动学的研究,提示喉部活动与构音运动之间可能存在可观测的联系,例如用力、强调时舌唇动作幅度与声门行为协同变化。这为词级突显度分析埋下伏笔:若强调词同时伴随更大的构音动作,模型就更容易猜对 f0 的隆起。

本文要回答哪两个具体问题?

本文把大问题拆成两个可操作的子问题。第一个是时间上下文的影响:预测某 1 帧 f0 时,应该看前后多宽的舌唇图像。直觉上韵律变化比音素变化慢,可能需要较长的窗口,但也可能当前帧附近的形状已经足够,拉长窗口只是增加计算量。原文把上下文从 16,7 ms 一直扫到 283,3 ms,覆盖了从约 1 帧到十几帧图像的范围,让读者能看到性能随窗口的变化曲线。

第二个是更细的词级评估:模型能否还原词的韵律突显,也就是重音和焦点。句子级相关高,可能只是整体走势蒙对了,但在需要强调的词上仍可能是平的。作者因此把词分成三档突显度。突显度用白话说就是这个词读得有多重要多突出,英文是 prominence。估计方法用的是连续小波变换,英文是 continuous wavelet transform,缩写为 CWT,它通过多尺度分析给出层级性韵律表示。

韵律突显度 × 连续小波变换: 韵律突显度负责区分词在句子中是弱读、普通还是强调重读,连续小波变换(CWT)负责用多尺度分析从语音信号中估计这种层级性突显;搭配理由是用人工听感分级主观且费力,而 CWT 给出可复现的 P0、P1、P2 三档划分,组合意义是让词级评估不再只看平均相关,而是能检验模型在需要强调的地方是否更准或更差。

从学习依赖看,这两个问题是递进的:先确认在什么输入宽度下预测最划算,再确认预测好的部分是否恰好是语言学上重要的部分。如果高突显词预测更好,说明模型学到的耦合在强调处更强;如果低突显词反而差,则提醒合成语音可能在弱读词上丢失自然度。原文没有把突显度当作额外输入,而是只当作分组评估依据,这一点对复述很关键:模型训练时看不到 P0、P1、P2 标签,它们只在测试分析时用来分组算相关。

方法全景:一个样本如何从图像走到 f0?

沿一个样本走一遍流程最容易建立整体感。假设要预测第 t 帧的 f0,系统先取出以 t 为中心的一段舌超声图像序列和唇视频序列,帧率都是 60 幅每秒,再把它们送入卷积编码器。编码器的作用是把每幅图像的空间形状压缩为向量,并融合时间维度的变化。接着融合后的表示经过全连接层输出一个数值,即该帧的标准化 f0 预测值。标准化在这里指中心化-归一化,也就是减均值除标准差,因此模型不需要预测绝对赫兹数,只预测相对高低。目标 f0 用 Praat 工具从同步的有声音频中提取,只用 vocalisée 即有声发音的数据,保证目标可靠。

输入有 3 种配置:只用舌图像记为 T,只用唇图像记为 L,两者都用记为 L+T。L 和 T 各自有一个编码器,L+T 则有两个编码器再拼接。这种设计让消融很干净:比较 T 与 L+T 就能看出唇部信息的增量。MFCC 对照分支不走图像编码器,而是把梅尔倒谱系数送入 4 层前馈网络。MFCC 是 mel-frequency cepstral coefficients 的缩写,白话说就是描述短时频谱形状的一组系数。

原文把它切成低阶和高阶两部分,低阶包含能量和频谱倾斜,高阶更接近声道滤波器形状,用来回答哪部分频谱信息与 f0 更相关。训练时监督来源始终是 Praat 提取的标准化 f0,评估时用 Spearman 相关衡量预测曲线与真实曲线的单调一致性,并在句子级别平均。

编码器与预测头如何分工?

组件分工可以概括为编码器管看懂动作,预测头管输出走势。图像分支的编码器由 2 维卷积、批量归一化、激活函数和池化组成,负责从超声和唇部像素中提取舌体轮廓、开口度等空间特征,并通过堆叠在时间上累积上下文。L+T 模型有两个这样的编码器,输出拼接后再经 1 维卷积或全连接压缩,避免某一模态主导。MFCC 分支的编码器被替换为 4 层前馈网络,神经元数依次为 256、128、64、32,这说明对于已经高度压缩的倒谱特征,不再需要空间卷积,只需非线性映射即可。

舌超声图像 × 唇视频: 舌超声图像(T)负责记录舌体轮廓的内部运动,唇视频(L)负责记录唇形开合的前端运动;搭配理由是两者分别覆盖声道中后部与前部,且都是无声接口中可实际采集的模态,组合成 L+T 的意义是检验唇部信息是否在舌信息之外带来互补增益,原文结论是互补很小。

源-滤波器理论 × 构音运动: 源-滤波器理论把语音分为声门声源的振动与声道滤波器的成形,构音运动主要描述舌、唇等滤波器端的形状变化;两者搭配起来看就会产生疑问,即只看滤波器端能否反推声源端的 f0,组合意义在于为全文的质疑和验证提供理论起点:如果源与滤波器完全独立则不应可预测,若可预测则说明二者存在可学习的耦合。

梅尔倒谱系数 × 声门信息: 梅尔倒谱系数(MFCC)负责紧凑描述短时频谱包络,声门信息更多藏在能量与频谱倾斜等低阶维度中;搭配理由是本文把 MFCC 切分为 M0:2、M3:12 和 M0:12 3 组对照,分别对应强度与谱倾斜、声道滤波器形状与两者合并,组合意义是用语音内部对照来反衬构音图像预测的难度,并验证强度维度对 f0 预测的关键作用。

从计算目标看,所有分支的最后一层都是回归一个标量,即当前帧的标准化 f0。原文没有给出损失函数的显式公式,也没有报告是否对静音帧做特殊掩码,因此复述时只能说模型被训练去拟合 Praat 提供的标准化 f0 曲线,不能脑补用了均方误差还是相关损失。同样,梯度路径、参数冻结细节未报告,不能从模型名称推定。教学例子:可以把 T 想象成从侧面看舌头隆起,L 想象成从正面看嘴张大,两者拼接就像同时看内部和外部动作,但如果强调主要靠舌根和整体用力,嘴唇多看几帧也提供不了新信息,这就对应了后文唇部增益很小的结果。该例子只是帮助理解,不代表原文测量了用力程度。

模型在什么数据上训练与适配?

训练安排分 2 个阶段。第一阶段用参考说话人 TaL1 的约 21,45 分钟数据训练基础模型,覆盖多种上下文宽度。第二阶段把模型适配到 TaL80 子集中的 8 个说话人,每人约 4,35 分钟数据。这是一种先在数据较多者上学好通用映射,再在小数据说话人上微调的常见做法,但原文没有明示冻结哪些层、学习率如何调整、适配时是否重置优化器状态,因此不能复述为固定编码器只调预测头。监督始终来自同步有声音频的 f0,无声数据不用于本文的 f0 训练。

数据划分上,评估基于每位说话人 20% 的测试数据,指标在句子级别计算 Spearman 相关后再平均。原文没有给出验证集比例、早停策略、批量大小和训练轮数,复现时这些属于缺项,需要自行补做超参数搜索并记录。MFCC 对照实验只在 TaL1 上进行,同样扫描不同上下文宽度,目的是在同一说话人、同一目标下比较图像输入与频谱输入对上下文的敏感度差异。需要强调的是,MFCC 实验不是为了部署无声接口,因为实际无声时拿不到音频 MFCC,它只是诊断性对照,用来判断 f0 信息在频谱的哪部分以及需要多宽的时间窗。

语料、划分与指标如何保证可比?

语料用的是 TaL,一个同步多说话人的英语语料,包含舌超声、音频和唇视频。舌和唇的采样都是 60 幅每秒,这决定了上下文换算:16,7 ms 约为 1 帧间隔,283,3 ms 约为 17 帧左右。语言为英语,因此结论是否适用于声调语言需要额外验证,原文未涉及。说话人方面,TaL1 是数据量较大的参考说话人,TaL80 是 8 人小组,每人数据量小一个量级,这解释了为什么 TaL80 的相关普遍低于 TaL1:数据少且要跨说话人适配。

指标选择 Spearman 相关是有教学意义的。它衡量两条曲线的排序一致性,对单调变换不敏感,适合评估标准化后的 f0 走势。方向是越大越好,范围在负 1 到 1 之间。但它不反映绝对音高偏差,也不直接反映可懂度或自然度,相关高不等于合成语音一定好听。聚合对象是句子级别先算相关再平均,中位数被报告为主要数字,这比平均值更抗异常句影响。

词级分析则按 CWT 突显度把词分组为弱 P0、中 P1、强 P2,再在每组内评估 L+T 模型的预测相关。硬件预算、训练时长和推理延迟在原文证据中没有报告,因此不能承诺该方法的实时性或计算成本优势。

主结果:舌唇能把音高走势还原到什么程度?

先看最核心的句子级相关。L+T 模型在 TaL1 上的中位相关为 0,72,在 TaL80 组上为 0,66,原文明确说这与现有技术水平一致。这意味着只看舌唇动作确实能猜出 f0 的大体起伏,但也留有约三分之一的方差无法解释。唇部信息的增量很小,无论在 TaL1 还是 TaL80 上,L+T 相比单用舌图像 T 提升有限。这对系统设计的启示很直接:如果采集成本有限,优先保证舌超声质量,唇视频可作为辅助而非必需。

下表把主结果组织为可核对的对照,指标方向均为越大越好,公平条件是同一说话人划分与同一 Spearman 句子级评估。表中数值均来自原文连续句,不是自行计算的差值或百分比,百分点与相对百分比在此不适用。

输入条件语料与说话人评估指标中位相关原文值原文对照结论
L+T 双模态TaL1 参考说话人句子级 Spearman 相关0,72与现有水平一致
L+T 双模态TaL80 共 8 人组句子级 Spearman 相关0,66低于 TaL1
T 单舌模态TaL1 与 TaL80句子级 Spearman 相关接近 L+T唇部互补小
L 单唇模态TaL1 与 TaL80句子级 Spearman 相关低于 T舌信息更关键
MFCC 全量对照TaL1句子级 Spearman 相关高于图像分支频谱含更直接线索

表后需要回到机制解释。主要收益是证实了舌运动与 f0 之间存在可学习的统计耦合,尤其在数据较多的 TaL1 上走势还原最好。具体代价是跨说话人时性能下降,从 0,72 降到 0,66,且唇部双编码器增加了模型复杂度却没有带来相应回报。未胜出项也很清晰:单用唇图像 L 的效果最弱,说明只看嘴形猜音高是不足的。原文没有报告显著性检验的 p 值或置信区间,因此不能断言 0,72 与 0,66 的差距在统计上显著,只能说在中位数上观察到下降。

以下导读针对结果总图,它把上下文、模态与突显度 3 组分析放在同一张图中,读图时应先分清 3 个面板的横轴与分组含义,再比较曲线斜率与柱形顺序,不要把不同面板的纵轴混为同一量级比较。

看图路径: 1. 先看面板 a 中 TaL1 与 TaL80 两组曲线随上下文增大是否走平,比较 T、L、L+T 三条线的相对位置;2. 再看面板 b 中 MFCC 三组子集随上下文的变化斜率是否比面板 a 更陡;3. 最后看面板 c 中 P0、P1、P2 三档的柱形高度顺序,确认突显度越高相关是否越高

原论文 Figure 2:(a) Corrélation entre fo originale et fo prédite à partir d’images de la langue T, des lèvres L,…

论文图 2。原论文 Figure 2:“(a) Corrélation entre fo originale et fo prédite à partir d’images de la langue T, des lèvres L, et d’une combinaison des 2 (L+T), pour différentes tailles de contexte, pour le…”。

该图的可执行观察是:面板 a 展示了 T、L、L+T 在 TaL1 与 TaL80 上随上下文从 16,7 ms 到 283,3 ms 的变化,图像分支的曲线总体平缓,L+T 略高于 T 而 L 最低;面板 b 展示了 MFCC 不同子集在 TaL1 上的曲线,其随上下文增大上升更明显,且包含低阶系数的组合更高;面板 c 展示了 L+T 在词级按 P0、P1、P2 分组的相关,呈现随突显度增强而升高的阶梯。像素不能精确辨别的中间点数值不要硬读,关键结论以原文报告的中位数为准。

上下文与频谱子集:增益来自哪里?

上下文消融是本文最有教学价值的部分。对于 T 与 L 图像模型,增大上下文只带来边际改善,曲线很快走平。这说明当前帧附近的舌唇形状已经包含了大部分可利用信息,更早或更晚的动作对 f0 的额外解释力有限。相反,基于 MFCC 的模型随上下文增大提升更明显,表明频谱中的 f0 相关线索需要更宽的时间窗才能充分累积,例如能量包络和语调走势本身就是慢变量。

下表聚焦上下文敏感度的差异,比较对象是同一 TaL1 上的图像分支与 MFCC 分支,条件一致性在于同一 f0 目标与同一相关指标,差异仅在输入表示与窗口宽度。

输入表示上下文范围评估指标随窗口变化趋势原文机制判断
M0:2 强度倾斜TaL1 宽上下文句子级 Spearman 相关高于纯滤波器组强度作用大

表后解释要区分直接报告与有限解释。直接报告的是图像分支对窗口不敏感而 MFCC 分支敏感,以及强度与频谱倾斜对预测作用大,这与预期一致,因为能量与倾斜本身就与发声努力和声门状态相关。有限解释是作者据此讨论源-滤波器交互:若只看滤波器形状的 M3:12 仍有一定预测力,则说明滤波器运动与声源并非完全独立。反例是 M3:12 单独使用时不如包含 M0:2 的组合,这提醒不能把声道形状当作 f0 的充分统计量。未评测边界包括超过 283,3 ms 的更长韵律窗,以及声调语言中的长时调型,这些都不能从当前曲线外推。

词级突显度结果进一步细化了判断。在 TaL1 上 L+T 的相关为 P2 的 0,75、P1 的 0,58、P0 的 0,46,呈现随突显度增强而升高的阶梯。支持的判断是模型在强调词上的 f0 隆起还原得更好,可能因为强调时构音动作幅度更大、源与滤波器耦合更强。但这只是相关性证据,不是因果证明,不能说动作大导致 f0 高,也可能是两者被共同的强调意图同时驱动。负结果是 P0 弱读词的相关仅 0,46,意味着在最不需要强调但仍影响自然度的地方,模型反而最不可靠,这对合成语音的自然度是具体风险。

哪些结论还不能下?

首先是观测不完备。原文明确指出构音观测是部分的,例如没有软腭信息。软腭的英文是 velum,它控制鼻音分支,对频谱和气流分配有影响。缺少它以及缺少喉部直接观测,意味着模型只能利用间接耦合,一旦耦合在某些音段或说话人上变弱,预测就会失效。MFCC 对照部分缓解了诊断问题,但不能替代缺失的生理通道。

其次是评估口径的局限。Spearman 相关只衡量走势单调性,不衡量绝对音高、清浊判断错误和听感。句子级平均可能掩盖词级错误,而词级分析虽然补上了突显度分组,但仍未报告误判率、延迟和计算成本。训练资源、推理开销、输出帧率与实际延迟需要分别讨论,原文均未给出,因此不能承诺该方法更省算力或更实时。总体趋势不等于每组每步都成立,例如上下文增大平均边际改善,不代表每个句子都如此。

最后是泛化边界。语料为英语多说话人但规模有限,TaL1 约 21,45 分钟,TaL80 每人约 4,35 分钟,测试为每人 20% 数据。这种小数据适配下的 0,66 相关不能直接推广到大词汇量自发语音、噪声环境或声调语言。相关性也不是因果,P2 预测更好不能证明强调导致了可预测性。缺失证据不是技术错误,但复述时必须用可能、待验证来表达推测,用报告、显示来表达直接数字。

要复现这篇工作先做什么?

复现的第一步是拿到 TaL 语料的同步三元组并复刻划分。需要舌超声 60 幅每秒、唇视频 60 幅每秒和同步音频,只用有声音频经 Praat 提取 f0 再做中心化-归一化。说话人划分要保留 TaL1 单独训练与 TaL80 每人约 4,35 分钟适配、每人 20% 测试的设置,否则 0,72 与 0,66 的数字不可比。上下文窗口要从 16,7 ms 扫到 283,3 ms,以 f0 帧为中心取前后图像,不能只做单帧输入。

下表把复现所需的关键条件整理为检查清单,数值写法保留原文精度与单位,裸值不擅自添加单位,条件列帮助核对实验阶段是否一致。

复现环节语料与配置指标与聚合原文关键值可运行检查项
参考训练TaL1 约 21,45 minPraat 标准化 f0 为目标21,45 min确认只用有声段
跨人适配TaL80 共 8 人每人约 4,35 min每人 20% 测试句子级平均4,35 min 每人保留说话人内划分
图像分支T 与 L 与 L+T 3 种输入中位相关句子级0,72 与 0,66先跑 T 再加 L
词级分组CWT 得 P0 P1 P2组内相关越大越好0,75 与 0,58 与 0,46标签只用于评估

表后说明复现的顺序与代价。先跑通 T 单分支与 L+T 双分支在 TaL1 上的上下文曲线,确认唇部增益小且窗口效应平缓,再做 MFCC 3 组对照确认强度维度的关键作用,最后才做词级 P0 到 P2 分组。代价在于双编码器与多窗口扫描会成倍增加训练次数,但每个模型本身只是卷积加全连接,理解门槛不高。关于可用性,本次收到的证据中没有绑定且完成验证的代码、模型或数据资源,因此不能写代码或数据已公开,复现前必须自行确认语料申请与 Praat 版本、CWT 实现细节。常见误解是把 MFCC 对照当作可部署的无声方案,实际上无声时没有音频 MFCC,它只是诊断工具。

何时值得尝试这种做法?

当你的无声接口已经能把音素内容做得可用,但合成语音听起来平直、重音不对时,这篇工作的思路值得尝试。它告诉你不用先解决喉部直接传感,可以先用已有的舌超声和唇视频训练一个 f0 走势预测器,至少在强调词上能还原出 0,75 量级的相关,足以让语调起伏出现。但若你的场景高度依赖弱读词的自然度,或者需要在绝对音高上精确控制声调,那么仅靠舌唇的 0,46 到 0,58 的弱、中突显相关是不够的,还需补喉部信号或显式的韵律建模。

从成本看,优先保证舌图像质量与时间对齐精度,比一味加宽上下文或叠加唇编码器更划算,因为原文显示窗口增益边际而唇增益小。还需补的验证包括清浊检测错误对相关的影响、听感测试而非仅相关、以及跨语言尤其是声调语言的表现。复述方法时记住三句话:输入是同步的舌唇图像序列加 Praat 标准化 f0 目标,模型是双编码器卷积加回归头,评估是句子级 Spearman 中位数加 CWT 突显度分组。这样既保留了原文的可核对数字,也没有把相关性夸大为因果或可部署承诺。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总