英文题目:Noise Scaling Factor for the One-Dimensional Voice Production Model

会议身份:conference:interspeech:2026:conference-paper-id:yoshinaga26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#信号处理 #模型比较 #发声与构音 #语音 #语音合成

评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Tsukasa Yoshinaga:机构信息未能从会议 PDF 纯文本可靠映射
  • Takeshi Ikuma:机构信息未能从会议 PDF 纯文本可靠映射
  • Brad H. Story:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究针对嗓音产生中气流噪声建模,输入为声门流量与声道截面形状,输出为口端辐射声压,难点在于一维模型无法分辨声门湍流射流与壁面收缩诱发的附加声源。方法链第一步采用三维可压缩Navier-Stokes方程结合体积罚方法与双质量块声带模型同步求解流固耦合振动与声传播,获得含湍流脉动的基准声场与声门流量U3D。第二步将该U3D作为入口体积速度馈入由44段波导构成的一维Tube Talker模型,计算共振、黏性损耗与活塞辐射以复现无空间湍流分辨的声压谱。第三步按Fant公式叠加经雷诺数调制的带通随机噪声流量,并扫参缩放因子α使三维与一维口端压力谱的平均频谱差异最小,从而反推与流态匹配的校准值。与沿用固定经验常数的已有做法不同,该校准将噪声强度与声门闭合状态及声道收缩位置关联,揭示了收缩诱发额外声源时需增大缩放因子的实际意义。在元音/u/自持振荡比较设置下,Ag0=0 mm2条件的基频指标为160 Hz,低于Ag0=1.0 mm2条件的基频指标162 Hz。结论限于 /a/ 与 /u/、常数肺压与双质量块声带,尚未验证其他元音、病理嗓音或连续语流的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,先保留哪些关键信息?

本文的输入是肺部驱动气流、声带振动状态与元音声道形状,目标是让计算量很小的 1 维嗓音模型也能给出可信的湍流噪声幅度。读者需要先保留 3 条关键信息。第一,嗓音包含两部分,周期性的声门脉动决定谐波结构,非周期的湍流决定气息感与高频噪声基座。第二,1 维模型本身没有空间维度去算湍流,只能外加一条按雷诺数换算的噪声流量。第三,评价标准不是听感投票,而是把同一声门流量喂给 1 维模型,看其口部压力频谱与直接算声的 3 维流动仿真差多少。

声门气流脉动 × 谐波结构: 声门气流脉动指肺部气流被声带周期开闭调制成时变流量,是声音的初级声源;谐波结构指该周期脉动在频谱上形成基频及其整数倍分量。两者搭配的原因是脉动波形的时间形态直接决定谐波幅度包络,组合意义在于先把可预测的周期部分讲清,才能把剩余的非周期湍流噪声分离出来单独建模。

沿一个样本走一遍有助于建立依赖关系。以元音/a/、初始声门开口 1.0 平方毫米为例,肺压恒定推动声带自激振动,声门面积周期开闭,流量随之脉动,该脉动经声道共振后从口部辐射。周期部分形成基频约 146 赫兹及其谐波,湍流部分抬高谐波之间的谷底。若只看谐波峰会误以为 1 维已经足够,真正的考验在谷底噪声是否与 3 维一致。后续所有关于缩放因子的讨论,都是在固定这一输入到输出链条后,追问附加噪声该加多大。

这个例子同时说明学习依赖。必须先理解流量脉动如何产生谐波,才能理解为何谐波峰对齐不代表建模成功。初学者容易把频谱包络整体形状当成唯一目标,而本文把包络分解为可由 1 维传播解释的共振峰和谐波,以及必须额外注入的湍流基座。只有保留这种分解,后文扫描缩放因子寻找频谱差最小值的操作才有意义,否则会把共振频率偏移也误归为噪声幅度问题。

已有路线如何处理声带振动与摩擦噪声?

理解本文位置需要区分 3 条已有路线。最简单的是直接规定声门流量波形,用开放商或波形斜率控制音质,优点是可控,缺点是假设源滤波完全分离,且流量与声带动力学没有显式联系。第二条是由声带运动和时变声门面积算出流量,若声道不反馈回振动称为 Level 1,若声道形状反过来影响振动则称为 Level 2,后者在强耦合条件下更重要。第 3 条是摩擦音噪声建模,Fant 基于雷诺数与一个任意缩放值提出公式,后来被广泛用于摩擦音并被借用到气息声合成。

Level 1 相互作用 × Level 2 相互作用: Level 1 相互作用指由声带运动和跨声门压算出流量但不把声道反馈回声带振动;Level 2 相互作用指声道形状进一步影响声带振动。搭配理由是前者计算简单、后者在源滤波强耦合如歌唱时不可省,组合意义是明确本文 3 维模型采用 Level 2 因而能包含声道对振动和噪声传播的双向影响。

本文继承 Fant 路线但指出两个未验证点。其一,气息声的流动是脉动的,与摩擦音的准稳态不同,直接套用摩擦音常数缺乏依据。其二,前人把该任意参数用于 1 维气息声合成,却没有充分检验其取值是否合理。近期计算能力允许直接求解描述惯性与粘性的流动方程来预测摩擦音,但针对发声尤其是气息声的噪声产生研究很少。因此本文选择用 3 维显式算声的结果去反校 1 维中的任意参数,而不是再做 1 次听感试验。

这种选择决定了证据等级。听感试验回答人是否觉得像气息声,3 维校准回答物理声压差了多少分贝。两者互补但不可互换,本文只做后者。初学者应注意,常规值 4 乘 10 的负 6 次方来自前人听感试验,本文用频谱差重新检验它,检验通过不代表听感最优,检验不通过则说明物理层面已经不一致。

要回答的具体问题是什么?

具体问题可以写成可操作的形式。在给定 3 维仿真得到的声门流量条件下,1 维模型应取多大的噪声缩放因子,才能使其口部压力频谱最接近同一条件下的 3 维口部压力频谱。这个问题限定在元音/a/与/u/、正常闭合振动与气息声不完全闭合振动两类状态。判断好坏的量是每个频率上 3 维与 1 维压力谱幅度差的平均值,平均对象是频率,随机性来自多次不同的带通噪声实现,离散程度用 8 次实现的标准差表示。

需要强调的是,该问题不比较哪种元音更好听,只比较建模误差随缩放因子与流动构型的变化。若最优值随元音或闭合状态漂移,就说明单一常规值不够,建模需要按构型调整或增加空间分布声源。这个问题把声源位置、传播近似和随机实现三者分开,传播近似通过固定几何离散来控制,随机实现通过多次平均来控制,剩余的系统性漂移才能归因于缩放因子与构型的失配。

从复现角度看,问题定义还隐含了输入冻结的要求。1 维的周期驱动必须原样取自 3 维,不能重新生成,否则谐波差异会污染噪声评价。原文正是这样做的,这也是后文所有表格可比的前提。

三维基准与一维待校模型如何分工?

方法全景是 2 阶段串联。第一阶段跑 3 维可压缩流动仿真,包含声带流固耦合振动与声道传播,直接得到声门流量与口部压力。第二阶段把 3 维的声门流量原样喂给 1 维波导模型,再按不同缩放因子加入人工噪声流量,算出 1 维的口部压力。两者的口部压力都做离散傅里叶变换得到频谱,比较频谱差并找出使差最小的缩放因子。这种安排的理由在原文写得很明确,1 维合成速度快但缺湍流维度,3 维可信但计算量大,用 3 维校准 1 维可以在保留效率的同时修正噪声幅度。

3 维流动仿真 × 1 维波导模型: 3 维流动仿真指直接求解含惯性和粘性的可压缩流动方程并显式算出湍流声产生;1 维波导模型指把声道切成若干截面管段只算前后行波传播。3 维负责提供可信的基准口部压力,1 维负责低成本合成,搭配理由是用 3 维校准 1 维中无法从几何推出的噪声幅度,使简化模型在保留速度的同时逼近基准频谱。

声道几何是理解分工差异的关键。/a/从会厌到咽部是约 0.3 平方厘米的窄段,再向口腔扩大到约 5 平方厘米;/u/先在咽部扩大到约 6 平方厘米,再在舌腭之间收缩到约 0.2 平方厘米,然后再向唇部扩大。前者噪声主要来自声门下游射流,后者还可能在口腔收缩处形成第二处射流。下面这张面积函数图把这种几何差异画了出来,是后文解释/u/需要更大缩放因子的结构依据。

这段导读帮助读者带着几何预期去看面积曲线,横轴是距声门距离,纵轴是截面积,重点是两条曲线的峰谷位置是否错开。

看图路径: 1. 先看横轴为距声门距离、纵轴为面积,确认蓝色为/a/、红色为/u/;2. 再对比/a/在咽部低而口腔侧高的走向与/u/中段隆起后收缩的走向;3. 最后定位/u/在 10 至 15 厘米附近的深谷与/a/在同段的峰,理解后文附加声源假设

原论文 Figure 2:Vocal tract area for vowel /a/ and /u/.

论文图 1。原论文 Figure 2:“Vocal tract area for vowel /a/ and /u/.”。

从像素可见,蓝色/a/在距声门较远侧形成高而宽的峰,近声门侧保持低面积;红色/u/在中段先隆起约 5 至 6 平方厘米,随后跌入接近零的深谷,再在唇端附近回升并出现约 4 平方厘米的次峰。这种一宽一窄的反向布局意味着气流在/u/中会先减速再加速,具备形成口腔射流的条件。复述方法时应记住,1 维模型把该连续面积离散为 44 段、每段约 4 毫米,几何相同但声源处理不同,这正是校准要弥补的差距。

三维侧与一维侧各自算什么,如何注入噪声?

3 维侧由三块组件构成。流动求解器求解 3 维可压缩流动方程,计入惯性与粘性,因而能由流动起伏直接预测声音。壁面处理采用体积罚方法,这是一种浸入边界方法,通过在计算网格上施加外力实现声反射,即使声带壁面运动,也只需更新施力位置即可实现流固耦合。声带振动采用双质量模型简化计算,每个质量块有质量、阻尼、弹簧与耦合弹簧,分别模拟下部与上部质量并再现黏膜波,几何上用两个圆柱加光滑连接面构成声带,声门长度设为 17 毫米。

雷诺数 × 缩放因子: 雷诺数表示惯性力与粘性力之比,用来判断流动是否容易转捩并产生较强湍流起伏;缩放因子是将无量纲流动强度换算成 1 维模型中附加噪声流量幅度的任意常数。两者搭配是因为雷诺数只给相对强弱不给绝对声压,必须乘以缩放因子才能落地为可传播的流量,组合后形成阈值加正比的噪声注入规则。

计算域从代表肺的压力腔经气管、声门、声道到代表面部的障板出口,入口施加 1200 帕恒压,气管形状与声道面积函数取自已有测量。网格总数约 1.8 的 10 次方量级,声带附近最小间距 0.025 毫米,时间步长与迭代步数按声传播精度设定。初始声门开口面积是控制振动状态的把手,/a/从 1.0 变到 8.2 平方毫米,/u/从 0 变到 1.0 平方毫米,超过 1.0 后/u/自激振动难以维持。这种参数扫描使研究覆盖完全闭合到不完全闭合的过渡,而不是只看一个工作点。

1 维侧采用波导模型的具体实现,入口给定体积速度,计算前向与后向行波,计入壁面黏性损失,出口按无限障板活塞施加辐射阻抗。关键是它没有空间维度去产生湍流,因此按 Fant 公式外加噪声流量。当雷诺数大于阈值时噪声流量正比于缩放因子与超过阈值的部分,否则为零。雷诺数由声门流量、声门长度与空气运动黏度算出,阈值取 1200,噪声基底由均匀分布随机数经 300 至 3000 赫兹 4 阶巴特沃斯带通滤波得到。每个时间样本把该噪声流量叠加到 3 维声门流量上,再算传播得到口部压力。

比较时原文明确指出,3 维流量本身已包含部分可分辨湍流扰动,把它再喂给 1 维可能带来双重计入,这是解释结果的重要限制。频谱比较用离散傅里叶变换,指标是各频率谱幅度差的均值,缩放因子扫描后取最小值对应的点为最优。随机噪声每次实现不同,因此对 8 次实现取均值与标准差,避免把某 1 次偶然的好贴合当成结论。

本研究训练了什么,没有训练什么?

本研究没有训练任何神经网络,也没有更新声学模型权重,不存在梯度路径、优化器、冻结层或早停等概念。真实的计算过程是仿真加搜索。仿真部分用有限差分求解双质量振动方程,用流动求解器推进流场与声场,得到确定性几何与边界条件下的流量与压力时间序列。搜索部分是在 1 维侧对缩放因子做网格扫描,对每个候选值生成多次带通噪声实现,计算其与 3 维基准的平均频谱差并选最小者。

这是一种事后最优选择,用于诊断建模误差,不能直接当成可部署的在线估计器。若要在新说话人或新元音上使用,仍需重复扫描或另建按构型预测缩放因子的规则,原文没有给出该通用规则,这是明确缺项而不是实现细节遗漏。初学者不应把最优值理解为学习到的参数,它没有训练集、验证集划分,也没有泛化误差报告,只是当前几何与驱动下的最佳拟合点。

同时要区分确定性与随机性。给定几何、肺压和振动参数后,3 维流场求解是确定性仿真,但 1 维噪声注入依赖随机数种子,因此评价必须多次平均。原文用 8 次实现给出误差棒,正是为了把随机波动与构型差异分开。若只跑 1 次就下结论,会把种子偶然性误读为物理规律。

实验条件如何保证三维与一维可比?

可比性的核心是同一流量驱动与同一几何。两种元音的面积函数来自同一套测量,离散段数与段长一致,肺压恒定 1200 帕,声带双质量参数固定,变化的只有初始声门开口与元音几何。评价时 1 维的输入流量直接取自对应 3 维算例的声门流量,因此周期成分的差异被排除,剩余差异主要来自噪声建模与传播近似。下表把仿真配置整理在一起,便于核对后文最优值漂移是否与状态变化同步。

比较的问题是几何与闭合状态是否改变了所需噪声强度,公平条件是流量输入相同、声道离散相同、比较指标相同,指标方向是平均频谱差越小越好。

模块取值条件关键数值作用可比性备注
肺压入口恒定驱动1200 Pa激发声带自激振动全算例相同
波导分段面积离散44 段约 4 mm1 维传播几何基于面积图
噪声滤波带通基底300 至 3000 Hz 4 阶生成随机噪声均匀分布输入
噪声阈值雷诺数门限Rec 1200低于则不加噪沿用前人取值
实现统计多次平均8 次实现估计均值标准差误差棒来源

该模块表说明复现必须同时固定驱动、离散、滤波、阈值与实现次数,任一改变都会使平均频谱差的绝对值失去可比性,因此后文最优值只在该配置下成立。表中净收益是把可变因素压缩到开口与元音几何,代价是结论不能直接推广到其他肺压或滤波设置。失败项是 3 维流量已含扰动又被 2 次放大,这一项在表中看不到,必须结合正文限制理解。该表也不能支持听感或计算成本结论,因为它只记录仿真配置。

另一组条件是振动工作点。/a/扫描 1.0 至 8.2 平方毫米,/u/扫描 0 至 1.0 平方毫米,基频分别在 146 至 131 赫兹与 160 至 162 赫兹范围。/a/在 8.2 平方毫米时闭合丢失、基频下降;/u/开口稍大即停振,说明其自激维持区间更窄。这些边界决定了结论只在可维持振动的区间成立,不能外推到大开口或高肺压。

/a/正常闭合与气息声的最优点为何分开?

先看/a/的 3 维现象。初始开口 1.0 至 7.0 平方毫米时声带实现完全闭合,开口 8.2 时不能维持完全闭合。波形上声门开启快于关闭,闭合相长度随开口变化,最大流量因肺压恒定而大致相同。流场显示声门出口最高速度约 50 米每秒,咽部还有第二处高速区,扰动在咽部之后衰减再向口部传播。这为 1 维校准提供了明确物理图像,噪声主要来自声门射流撞击咽壁。

下面这张平均频谱差随缩放因子变化的图是/a/的核心证据,横轴为缩放因子,纵轴为分贝差,曲线越低越好,误差棒为 8 次实现的标准差。

看图路径: 1. 先确认纵轴为平均频谱差值分贝数、横轴为缩放因子,数值越低表示一维越接近三维;2. 再比较蓝色 Ag0 为 1.0 平方毫米曲线与其他曲线的最低点横坐标差异;3. 最后观察绿色 Ag0 为 8.2 平方毫米曲线随缩放因子增大而上升的单调趋势

原论文 Figure 6:Mean spectral difference of mouth pressure between 3D and 1D voice production models for /a/.

论文图 2。原论文 Figure 6:“Mean spectral difference of mouth pressure between 3D and 1D voice production models for /a/.”。

从像素可见,蓝色 1.0 平方毫米曲线从左侧约 7.3 分贝下降到中间约 6.0 分贝再回升,最低点在 6 附近;黑色 5.0 与红色 7.0 曲线最低点在 4 附近;绿色 8.2 曲线起点最低约 5 分贝,随横轴增大单调上升。原文报告 1.0 时最小在 6 乘 10 的负 6 次方,5.0 与 7.0 时最小在 4 乘 10 的负 6 次方,8.2 不完全闭合时最小在 0。这支持常规值 4 乘 10 的负 6 次方在完全闭合时合理,而在不完全闭合时沿用该值会高估噪声。

完全闭合振动 × 不完全闭合振动: 完全闭合振动指每个周期声门面积回到零并出现闭合相;不完全闭合振动指声门始终留有开口呈气息声状态。区分的原因是闭合与否改变了流量波形谐波滚降和平均流量,从而改变下游射流强度,组合意义是解释为何同一缩放因子在一个状态合适、在另一个状态会高估噪声。

频谱形态进一步佐证。1.0 完全闭合时谐波延伸到高频,1 维无噪时低估了 2000 至 5000 赫兹噪声带,加入缩放因子后谷底被抬高并与 3 维形状吻合。8.2 时谐波只到约 2000 赫兹,以上主要由气动噪声主导,即使 1 维不加噪也与 3 维量级相近。也就是说,不完全闭合的 3 维流量本身已带较强扰动,再按常规值加噪属于重复放大。

这张/u/频谱图展示了加噪的实际效果,导读时先按图例区分 3 条曲线,再从低频向高频比较谐波峰与谷底基座。

看图路径: 1. 先按图例区分红色三维、蓝色加噪一维与黑色无噪一维三条频谱;2. 再从低频向高频扫视谐波峰与谷底噪声基座的贴合程度;3. 最后聚焦高频段黑色虚线明显偏低而蓝色更贴近红色的区间

原论文 Figure 11:Spectra of mouth pressure in 3D and 1D voice production models of /u/ with Ag0 = 1.0 mm2.

论文图 4。原论文 Figure 11:“Spectra of mouth pressure in 3D and 1D voice production models of /u/ with Ag0 = 1.0 mm2.”。

从像素可见,红色 3 维谐波峰清晰,黑色无噪 1 维在谷底明显偏低,蓝色加噪 1 维把谷底抬起后整体更贴近红色。第一共振峰在约 300 赫兹处两者一致,第二共振峰 3 维在 1600 赫兹而 1 维在 1300 赫兹,后者接近无流传递特性的 1290 赫兹,提示射流改变了共振而 1 维未捕捉。该图虽为/u/算例,但同样说明只看谐波峰会高估一致性,必须同时看谷底噪声基座。

比较的问题仍是同一流量下多大缩放因子能弥合频谱差,公平条件与前述相同,指标越小越好,下表汇总最优点。

元音与状态最优缩放因子3 维特征速度闭合情况含义与边界
/a/ Ag0 1.0 mm26 × 10−6约 50 m/s 声门出口完全闭合接近常规值
/a/ Ag0 5.0 与 7.0 mm24 × 10−6同上量级完全闭合常规值最优
/a/ Ag0 8.2 mm20同上但无闭合不完全闭合加噪反而变差
/u/ Ag0 0 与 1.0 mm214 × 10−6口腔约 30 m/s完全闭合需更强噪声
摩擦音参考约 40 m/s口腔射流不适用/u/低于摩擦音但不可忽略

上表的主要收益是给出可复述的最优点,主要代价是/u/最优值约为/a/常规值的 3 倍以上,说明单一常数无法跨元音通用。未胜出项同样重要,/a/气息声的 0 意味着任何正的常规加噪都不如不加,这是一个负结果而非拟合失败。另一边界是/u/开口超过 1.0 即停振,因此结论只在可维持自激的小开口区间成立,不能推广到大开口。原文据此提出未来应在口腔收缩处增加局部分布声源,而不是继续调大全局缩放因子。

改变缩放因子或去掉噪声项会发生什么?

把缩放因子当成消融把手可以看清单调性。在/a/完全闭合分支,差值随缩放因子先降后升,存在内点最优;在/a/不完全闭合分支,差值随缩放因子单调上升,去掉噪声项即取 0 反而最好。在/u/分支,差值从 0 开始随缩放因子增大而持续下降,直到 14 附近才触底,说明无噪基线明显低估了噪声。下面这张/u/的平均差曲线把这种下降过程画了出来,横轴延伸到 20 附近,纵轴仍为分贝差。

看图路径: 1. 先确认两条曲线分别为 Ag0 为 0 与 1.0 平方毫米,纵轴仍为平均频谱差值;2. 再看横轴延伸到 20 附近时最低点出现在远大于/a/常规值的位置;3. 最后对比误差棒长度,判断该最优点在多次随机噪声实现下是否稳定

原论文 Figure 10:Mean spectral difference of mouth pressure between 3D and 1D voice production models for /u/.

论文图 3。原论文 Figure 10:“Mean spectral difference of mouth pressure between 3D and 1D voice production models for /u/.”。

从像素可见,蓝色 0 开口曲线从约 12 分贝一路降到约 9.5 分贝,红色 1.0 曲线从约 10.7 分贝降到约 9.2 分贝,两者在横轴 14 至 16 附近达到谷底,之后略有回升。误差棒在中间段较长,表明不同随机实现对谷底位置有扰动,但整体下降趋势在两种开口下一致。这支持/u/需要更强噪声的判断,同时提醒最优值不是尖锐单点,而是一个受随机性展宽的区间。若只跑 1 次噪声实现就选最优,容易把偶然波动当成构型差异,原文用 8 次实现正是为了避免这种误读。

这个消融还揭示了基线的作用。/u/在缩放因子为 0 时的差值高达约 11 至 12 分贝,远高于/a/的约 5 至 7 分贝,说明仅用声门流量驱动的 1 维模型在/u/几何下缺失更多。即使调到最优,/u/残余差仍约 9 分贝,高于/a/最优的约 6 分贝,表明调大全局值只能部分补偿。第二共振峰约 300 赫兹的偏移也无法靠调大幅度消除,这指向声源位置与流动对共振的修正,而不只是幅度问题。

哪些限制使结论不能直接当成通用常数?

第一个限制是输入耦合。3 维流量已包含部分可分辨湍流扰动,把它喂给 1 维后再加噪,扰动可能在声道内被 2 次放大。原文明确提示了这一点,因此/a/气息声在 0 处最优可能部分源于这种双重计入,而不是真实物理噪声为零。第二个限制是声源位置单一。当前 1 维只在声门处按全局缩放因子加噪,没有在/u/口腔收缩处设局部声源,靠调大全局值去拟合第二处射流属于权宜之计。

第三个限制是共振失配。/u/第二共振峰的 3 维与 1 维差约 300 赫兹,说明射流对声学共振的修正未被 1 维捕捉,只调噪声幅度补不上频率偏移。第四个限制是覆盖范围窄。仅有两个元音、少数开口值、单一肺压与固定声带参数,未测量听感、延迟与计算成本,也未验证跨说话人泛化。

用报告、支持、待验证区分,常规值在/a/完全闭合下可用是报告,最优值随构型漂移是数据支持,口腔局部声源能消除对缩放因子的调整需求只是待验证的未来工作。初学者应把最优点理解为诊断性拟合值,而不是可直接写入合成器的通用常数。任何跨元音、跨肺压或跨说话人的使用都需要重新校准,并补充听感与稳定性验证。

要复现校准需要准备什么,按什么顺序跑?

复现先做 3 维基准。按原文搭建从压力腔到障板出口的计算域,入口恒压 1200 帕,声门长度 17 毫米,双质量参数固定,声道面积取对应元音函数,初始开口按元音扫描。跑出声门流量与口部压力时间序列后,用离散傅里叶变换得到基准频谱。再做 1 维对比。把声道分为 44 段、每段约 4 毫米,计入壁面黏性损失与无限障板辐射阻抗,输入流量取 3 维同一算例的结果。

噪声基底每次用负 0.5 至 0.5 均匀随机数经 300 至 3000 赫兹带通滤波生成,阈值取 1200,缩放因子按/a/扫到 10、/u/扫到 20 附近。对每个候选值跑 8 次不同随机种子,计算与 3 维谱的平均幅度差并记录均值与标准差,最小值即为该构型的事后最优。代码方面,原文给出的 1 维实现链接本次可用,状态为可访问,但这只代表 1 维侧可运行,不代表 3 维求解器与全部参数脚本已公开。

复现时应固定随机种子列表、滤波器实现与频谱窗长,否则差值的绝对分贝数不可比。还需补的验证是更换面积离散密度与滤波器阶数,检查最优点是否稳定,若最优点随这些数值设置大幅漂移,则常规值的适用性需要重新评估。另一个必做检查是对比无噪基线,若无噪已接近 3 维,就不应强行加噪,这正是/a/气息声算例的教训。

何时值得尝试一维加噪,何时应停手并补验证?

当任务是快速合成/a/类正常闭合元音且只需要合理气息感时,沿用 4 乘 10 的负 6 次方量级的全局缩放因子是值得尝试的起点,因为 3 维基准显示其频谱差最小。当任务涉及气息声不完全闭合或/u/类声道内收缩时,不应直接套用该值。前者可能高估噪声甚至以 0 为最优,后者可能低估噪声而需要大数倍的值或在收缩处增加局部声源。

教学上易错的是把平均频谱差下降等同于听感变好,把事后最优等同于可部署增益,把单次噪声实现的最优点当成物理常数。正确的复述是,在固定流量输入、固定几何离散、8 次实现平均的条件下,最优值随流动构型变化,因此 1 维湍流建模需要按元音或空间位置调整。下 1 次验证应优先补口腔局部声源与共振修正,而不是在全局常数上继续微调。

收束时记住方法链条。3 维负责可信基准,1 维负责快速合成,缩放因子是两者之间的幅度转接头。转接头的合适档位取决于射流在哪里形成、声门是否闭合、声道是否有收缩。脱离这些流动条件谈论最优值是没有意义的,这也是本文对初学者最重要的提醒。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总