英文题目:Improved modeling of vocal fold contacting and de-contacting in a geometric vocal fold model
会议身份:
conference:interspeech:2026:conference-paper-id:zhang26j_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#信号处理 #主观评测 #发声与构音 #语音合成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Tianyi Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zihao Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Peter Birkholz:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文解决构音语音合成中声源自然度不足问题,输入为基频轮廓、跨声门压与发声前静息位形参数,输出为下、上声门时变面积\(A_1(t)\)和\(A_2(t)\)以驱动声道分支管声传播与气流分离仿真,难点在于部分接触期的碰撞减速与黏附渐开无法用中矢面硬削波余弦表达。方法链第一步由静态位移设定楔形预开口,其输出的剩余缝宽决定接触阈值与归一化接触量,第二步由动态驻波位移提供准周期振动并经相位延迟与截断积分求面积。第三步在接触起始相位\(\gamma_1\)与解接触结束相位\(\gamma_2\)附近用与余弦相切的自然指数函数\(f_1(\alpha)\)、\(f_2(\alpha)\)取代瞬时削波,实现软接触与软解接触,第四步以形状参数\(s\)非对称延长接触段来控制声门面积波形左右偏斜。与旧模型直接削波加对称偏斜 warp 的机制差异在于,新机制保留了大开口时趋近纯余弦的连续过渡,因而更符合生物力学渐进开闭并改善模态到清音过渡的实际意义。在27名听音人、9句德语拷贝合成句、81种发声前参数组合上的配对评测中,新模型(NEW)A/B偏好率为58.1%,平均意见分(mean opinion score,MOS)为3.02,优于旧模型(OLD)的41.9%和2.68。该结论仅适用于VocalTractLab 2.4男声JD2与模态发声网格,未验证女声、病理嗓音、自发语音与外部声码器外推性。原文未披露训练与推理成本,本质为无训练的解析物理模块。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一段不自然?
本文的输入是发音合成器中的声带几何状态与控制参数,输出是随时间变化的声门面积,进而驱动气流与声道滤波得到语音。目标读者是刚进入语音与音频的研究生,需要先建立一条可复述的链条:声带如何动,面积如何算,声音如何来。必须保留的关键信息是,本文只改声带振动的接触与分离建模,不改声道形状与韵律轮廓;比较对象是同一个合成器中的 2019 年旧几何模型。
本文的中心矛盾是,旧模型把声带边缘看成自由振动的弦,到中线就硬截断为零,忽略了碰撞时组织变形减速与分离时克服粘附缓慢起步的过程。作者认为这段很短但重要的部分接触阶段决定了面积波形的圆钝程度与偏斜,直接影响听感自然度。教学上可以把声门想象成两扇对开的软门,旧做法是门撞到中线立刻停住,新做法是门在接近中线时已有挤压减速,推开时先粘后松。
本文后续所有公式与实验都围绕这段过渡展开,初学者复述时应先说清任务边界,再说新旧差异,避免把整体合成质量的提升误读为声道模型的功劳。
同类几何声带模型此前做了什么,还缺哪一块?
发音合成路线与神经合成路线输入不同,前者要求每个发音与声学参数可单独控制,适合低资源语言与基础语音研究,但自然度长期落后。声源是其中关键一环。原文梳理的几何路线起点是蒂策的模型,只建模右侧声带,左侧镜像对称,上下缘按基频模态正弦振动,前后两端固定,冠状面用直线连接上下缘构成梯形声门。后续扩展包括引入后部裂隙模拟声门漏气,把内侧面从平面改为圆钝面,以及允许生成偏斜的声门面积脉冲。
2019 年模型用扭曲余弦实现偏斜,通过形状参数改变上升沿与下降沿时长。这些工作解决了面积可算与波形可偏的问题,但共同简化是边缘振动为正弦且在中矢状面被裁剪,没有显式处理接触时的恢复力与分离时的粘附力。神经声码器与高层情感控制不在本文比较范围内,本文的同条件对照只限于几何声源内部的新旧振荡函数。
因此学习时应把相关工作按同输入、同目标、同运行阶段对照:都是给定基频、静息开度与相位,输出上下缘面积,运行于同一管模型合成器。缺失的一块正是接触与分离的力学动机过渡,这也是新模型要补的机制。
为什么硬裁剪的正弦振动听起来不够自然?
问题可以沿一个振动周期具体化。当左右声带向中线靠近时,真实组织在接触前已受挤压,内移应提前减速;当它们从闭合中分开时,接触面粘附使外移初速度偏小,随后才加快。若直接用余弦并把负位移置零,闭合与打开的转折过于尖锐,面积波形在零附近停留与离开的方式失真。旧模型虽然能通过扭曲余弦让波形左偏或右偏,但作者报告非正式听辨发现某些不对称波形听感仍不自然,说明仅靠整体扭曲相位不足以模拟局部接触力学。
更麻烦的是,静息开度变化时,例如从元音过渡到清辅音,模型应能平滑回到近似纯余弦,而硬裁剪加全局扭曲难以同时兼顾。因此本文把问题定义为:如何在保持几何模型简单可控的前提下,用生物力学动机的局部过渡替代硬裁剪,并用可调的过渡时长实现偏斜。例子是帮助理解的教学比喻,不是原文数值:如同用软垫包裹门框,关门最后一段被垫子缓冲,开门最初一段被胶条粘住,波形底部因此变圆且可左右拉长。
新模型沿一个样本走完从参数到声音的全景
以合成一句德语中的一个元音帧为例,流程分为 4 步。第一步给定预发声设置,包括上下缘静息位移、上下缘相位差、脉冲形状参数、基频轮廓与跨声门压。第二步计算左右镜像的声带位移,静态部分由静息位移决定,动态部分由振幅乘以振荡函数决定,振荡函数是新旧模型唯一不同的核心。第三步由位移求面积,对长度积分并把负值按零处理,再加上后部裂隙常数,得到下缘面积与上缘面积两个时间函数。第 4 步把这两个面积作为相邻两段声门管的截面积,送入基于管截面的气流与声传播计算,得到语音波形。
声门面积 × 声道管模型: 声门面积分工是把左右声带位移沿长度积分并只保留正值部分,再加上后部裂隙面积,得到下缘与上缘两个时变面积;声道管模型分工是把声道表示为串联的短圆柱管段,其中声门用两段长度各为声带厚度一半的管段表示。搭配理由是发音合成器需要时变面积作为气流计算入口,组合意义是声带几何振动被转换为可直接驱动湍流与声传播仿真的声学边界条件。
新模型的全景特点是控制量与物理量的分工清晰:静息位移管开度,相位差管上下行波,形状参数管过渡时长,振幅管响度相关的跨声门压。复述时应强调旧模型与新模型共享声道、时长、基频与说话人参考尺寸,差异只在振荡函数的底部形状,这为后文公平比较奠定基础。
位移如何分解为静态开度与动态振动?
新模型沿用蒂策几何框架。声带长度与厚度随基频变化,长度正比于基频与共振频率之比的幂,厚度与长度成反比,保持体积近似关系。右侧声带下缘与上缘的侧向位移各自由静态项与动态项相加,左侧为镜像。静态项是沿长度的线性函数,在声带突处等于可调的静息位移,在前端联合处为零,这对应发声前的外展程度。动态项是振幅乘以沿长度的正弦包络再乘以振荡函数,正弦包络保证前后端固定、中间最大,符合基频模态假设。
振幅正比于参考长度与跨声门压的平方根,再乘以可调的相对幅度因子,元音取 1,某些辅音取更小值。原文为保证可比,对新旧模型使用同一振幅公式,并用经验常数标定到跨声门压 800 帕、参考长度 1.6 厘米时振幅为 0.63 毫米。面积计算把每一侧位移沿长度积分,负值取零后乘以 2 计入双侧,再加后部裂隙面积。初学者应先记住静态管位置、动态管振动、负值截零管接触,之后再看振荡函数的局部改造。
静态位移 × 动态位移: 静态位移负责发声前的预设开度,它沿声带长度从声带突处的静息位移线性减小到前端闭合点;动态位移负责发声时的振动,它以前后固定的正弦包络乘以振荡函数随时间变化。二者相加得到每一时刻的侧向位置,搭配理由是把可控的发声姿态与周期振动解耦,组合意义是同一振荡函数可以在不同开度下生成闭合、部分接触或完全开放的声门面积。
下面先看旧模型的振荡函数形态,理解它如何用全局扭曲实现偏斜,以衬托新模型的局部分段思路。旧模型对两个周期的归一化位移曲线显示,对称设置下接近余弦,负向形状参数让开相更快而闭相相对拖尾,正向则相反。图前导读已经说明横轴为时间、纵轴为归一化位移、3 条曲线对应不同偏斜设置,读者应带着上升沿与下降沿谁更陡的问题去看图。
看图路径: 1. 先看横轴时间与纵轴归一化位移,确认显示的是两个周期的连续振动;2. 再对比红色 s′等于负值与绿色 s′等于正值曲线的上升沿与下降沿陡缓;3. 最后看黑色对称曲线作为基准,理解旧模型靠扭曲余弦实现偏斜
论文图 1。原论文 Figure 2:“Oscillation functions fosc(·) for two periods of the 2019 vocal fold model for three different settings of the pulse shape parameter s′.”。
该图实际可见红黑绿 3 条曲线峰位左右错开,红色在上升段更陡而下降段更缓,绿色相反,黑色居中对称。这说明旧模型的偏斜是整形扭曲的结果,谷底仍是余弦的尖锐转折,没有为接触与分离预留缓冲段。这正是新模型要用指数过渡替换谷底附近的原因,下一节将讲清两段指数如何拼接。
软接触与软分离的两段指数如何拼接并控制偏斜?
新振荡函数的核心是在瞬时相位的一个区间内用两段指数替代余弦,其余相位仍为余弦。具体做法是对包裹后的上下缘相位统一处理,在软接触起始相位到软分离结束相位之间取余弦与两条指数中的最大值。第一条指数负责软接触,从起始点的余弦值出发,以时间常数衰减到最小值;第二条指数负责软分离,从结束点的余弦值反向衰减到同一最小值。
起始与结束相位由接触阈值与形状参数共同决定,接触阈值由静息位移与振幅之比导出,静息越大则阈值越负,意味着更晚进入接触。形状参数在负值时延长起始侧,使脉冲左偏,在正值时延长结束侧,使脉冲右偏,为零时对称。两个衰减时间常数按指数与余弦在拼接点相切的条件求解,保证速度连续,避免折角。重要性质是当静息位移增大时,接触阈值下移,指数段占比缩小,函数自动退化为近似纯余弦,有利于实现到清音的过渡。
图 3 原文用 4 种静息与形状组合展示红黑绿 3 段的拼接,初学者复述时应强调最大值选择实现平滑包络,相切条件保证 1 阶连续,形状参数只拉长过渡而不整体扭曲波形。
软接触 × 软分离: 软接触分工是声带内收将要相撞时让内移速度提前减速,模拟组织受压产生的恢复力;软分离分工是声门刚要打开且边缘仍部分粘连时让外移从小速度逐渐加速,模拟需要克服粘附力。搭配理由是闭合与打开不是对称的硬开关,组合意义是在振荡函数的谷底附近用两段指数曲线替代余弦的尖锐转折,从而延长部分接触时间并改变面积波形的倾斜。
脉冲形状参数 × 相位延迟: 脉冲形状参数分工是把软接触段和软分离段拉长或缩短,从而让声门面积脉冲左偏或右偏;相位延迟分工是让声带下缘与上缘的瞬时相位错开,模拟黏膜波自下而上传播。搭配理由是前后方向的行波与上下方向的开闭不对称共同决定波形,组合意义是可以通过两个可调量分别控制倾斜程度与上下缘张开顺序。
还需记住上下缘各有自己的阈值与最小值,因为上下静息位移可以不同;相位延迟使上下缘的拼接区间在时间上错开,从而形成上下张开顺序差。这种把局部力学过渡与全局偏斜统一为过渡时长的做法,是新旧模型的本质区别。
本研究有无神经网络训练,真实计算与标定是什么?
本研究没有训练神经网络,也没有学习权重更新与梯度路径,因此不存在优化器、损失函数、训练集划分与早停。真实计算是基于规则的几何仿真加声学仿真:给定基频轨迹积分得到瞬时相位,给定静息、相位差与形状参数构造振荡函数,给定跨声门压计算振幅,再积分求面积,最后送入管模型求解气流与声压。需要标定的只有经验常数与过渡偏移量,例如振幅常数按参考工况标定,最小值相对接触阈值下移 0.2,相位偏移系数取 0.2π,这些在原文中明确为经验确定。
双脉冲参数在旧模型中固定为零以保证可比,抖动设置为 25% 并对新旧模型相同。未报告的内容应明确指出:原文未给出指数时间常数的闭式数值,只给出相切求解原则;未说明跨声门压的逐帧估计细节;未涉及任何可学习参数的冻结与更新。复现时不应臆测训练超参数,而应按仿真流程实现相位积分、拼接函数与面积积分,并保持新旧模型除振荡函数外的所有设置一致。
听辨测什么,与谁比,条件是否一致?
实验要回答的问题是,在多种预发声设置下,新振荡函数是否比旧振荡函数更自然。比较对象是实际可运行的两种策略:新模型与 2019 年旧模型,均实现于同一发音合成器版本与同一男性说话人模型,保留原始音素时长与基频轮廓,采用拷贝合成生成 9 个句子。公平条件包括相同的振幅公式、相同的说话人参考尺寸、相同的后部裂隙、相同的辅音外展处理、相同的抖动比例,以及旧模型双脉冲置零。
参数网格覆盖下缘静息、上缘静息、相位延迟与脉冲形状 4 个维度,每个维度 3 档,共 81 种组合,每句每模型各 81 条,九句 2 模型共 1458 条。形状参数范围不同但对应偏斜方向,旧模型取负 0.5 到 0.5,新模型取负 1 到 1。听者共 27 人,多数为德语母语,其余德语熟练,听力正常。为防疲劳,729 条按参数组合分成 9 个子集,每人只听一个子集的新旧对应部分共 162 条,每人完成配对偏好与单条平均意见分两项任务。
偏好任务对同句同参数的新旧成对随机排序后二选一,自然度任务对单条按 1 到 5 打分并要求独立评价。统计上用描述统计加线性混合效应模型分析评分,固定效应含模型与参数交互,随机截距含听者与句子,偏好用二项检验。
| 条件 | 指标 | 旧模型 | 新模型 | 比较对象 |
|---|---|---|---|---|
| 全部参数网格平均 | 平均意见分 | 2.68 | 3.02 | 新模型对旧模型 |
| 九句乘 81 组合乘 2 个模型 | 合成条数 | 729 条 | 729 条 | 总计 1458 条 |
表前比较问题是自然度提升是否在固定句子与参数下成立,公平条件是同一合成器与同一韵律,指标方向是分数越高越自然、偏好比例高于 50% 为胜。表后解释是新模型在平均分上高出约 0.34 分,在配对中以 58.1% 胜出,但这只是总体平均,不能说明每一参数组合都胜出。
未胜出的组合与参数依赖需结合分组均值与混合模型进一步看。代价是形状参数量程不可直接等同,旧模型的 0.5 对应新模型的 1,跨模型比较偏斜时需按原文线性换算理解。
主结果支持什么判断,限制在哪里?
总体上报告显示新模型占优。平均意见分分布与按被试排序的均值曲线均表明新模型整体右移,大多数被试对新模型的平均分高于旧模型。混合模型在基线配置下估计新模型优势显著,基于模型预测新模型在 81 种参数组合中的 75.3% 上得分更高,二项检验显示偏好比例显著高于随机水平。
平均意见分 × 偏好选择: 平均意见分分工是让听者对单个刺激按 1 到 5 打自然度,反映绝对质量分布;偏好选择分工是让听者对同句同参数的新旧模型成对二选一,反映相对胜负。搭配理由是绝对评分易受个人尺度影响而配对比较能固定句子与参数,组合意义是两者互相印证才能判断新模型是整体更自然还是只在部分参数下占优。
为理解分布与个体差异,需要先看六面板结果图,其中子图 a 为评分分布,子图 b 为被试均值,子图 c 到 f 为各参数分档均值,白色与黑色分别代表旧模型与新模型。读者应先确认纵轴是计数或均值,再判断高低好坏,避免把计数柱的升降误读为性能曲线。
看图路径: 1. 先看子图 a 中 1 到 5 分上新旧模型的计数柱高,判断低分与高分如何转移;2. 再看子图 b 中按被试排序的平均分曲线,确认新模型是否对多数听者占优;3. 最后看子图 c 到 f 中随静息位移、相位与形状参数变化的分组均值
论文图 2。原论文 Figure 4:“(a) MOS score distribution for both glottis models. (b) Participant-wise mean MOS score. (c–f) Mean MOS across parameter”。
该图实际可见子图 a 中新模型在 1 分柱明显更矮而在 4 分柱明显更高,说明低分样本减少而较高分样本增多;子图 b 中黑色圆点多数位于白色圆点之上,但个体基线差异大,证实需用随机截距建模;子图 c 到 f 中多数分档黑色高于白色,但在形状为零附近旧模型一度反超,表明优势并非在所有偏斜设置下成立。原文表格给出基线截距与新模型主效应及多项交互,其中与较小静息开度的交互为负,提示在极小开度下优势收窄。限制是评分仍集中在 2 到 4 分,未达非常自然。
听者以德语为主,句子与说话人单一;偏好虽显著但仅 58.1%,离压倒性还有距离。因此支持的判断是新过渡机制在所测网格内总体提升自然度,但不能推广为所有语言、所有说话人与所有发声类型的因果结论。
| 实验条件 | 统计量 | 数值 | 方向 | 含义 |
|---|---|---|---|---|
| 听者规模 | 人数与年龄 | 27 人,18 到 47 岁 | 样本量 | 含 8 女 19 男 |
| 振幅标定点 | 振幅与压力 | 0.63 毫米,800 帕 | 标定 | 经验常数 |
| 后部裂隙 | 面积 | 0.02 平方厘米 | 固定 | 模拟漏气 |
| 抖动设置 | 比例 | 25% | 固定 | 2 模型相同 |
表前问题是复现需要哪些固定配置才能对齐听感,公平条件是这些量在新旧模型中完全相同,指标方向不涉及好坏,只关乎可比性。
表后解释是这些细节保证了差异只来自振荡函数,代价是结论依赖该说话人与该抖动水平,换说话人或关闭抖动后优势是否保持属于未评测边界,需补实验才能回答。
哪些参数档改变了胜负,失败条件是什么?
原文没有做摘除某一指数段的消融,而是用参数网格充当条件分析,这应明确为参数敏感性而非模块消融。分组均值显示静息位移的影响最大:当下缘或上缘静息为 0.1 毫米时旧模型均值偏低而新模型提升明显,当静息增至 0.4 或 0.7 毫米时两者差距缩小,这与新函数在大开度退化为余弦的预期一致。相位延迟三档中 40 度附近新模型优势较明显,100 度与 70 度下仍占优但幅度变化,混合模型中 100 度交互显著为负,说明行波 timing 会调节听感。
形状参数上旧模型的负偏与正偏分档得分较低而新模型在对应偏斜下保持较高,仅在零附近出现旧模型持平或略高的反例,这是全文最重要的负结果,表明全局扭曲在完全对称时未必更差。初学者应把该反例记牢:总体趋势不等于每组都成立,报告中 75.3% 组合占优即意味着约 1/4 组合未占优。若要进一步验证,应补做只保留软接触或只保留软分离的对照,以及固定其他参数只扫形状的细网格,但这些在原文中未报告,不能脑补结果。
还有哪些未测量与未验证,不能承诺什么?
缺失证据不是技术错误,但必须划清可说与不可说的边界。原文未测量误判率、字错误率、可懂度、实时延迟、计算开销与内存占用,因此不能承诺新模型改善了这些量,也不能从听感提升推定推理更快。训练资源与推理帧率不适用,因为无神经训练且合成离线生成;实际延迟取决于管模型求解而非振荡函数,指数计算增加的开销未被量化。评价局限包括单一男性说话人、九句德语句子、拷贝合成保留原始韵律,自由文本合成与跨语言泛化待验证。
听者群体较小且以德语母语为主,文化与语言偏好可能影响自然度判断。统计上混合模型报告了部分固定效应估计,但未完整披露所有主效应与方差成分,复现统计时需按原文公式重建并检查收敛。此外补充材料链接在本次写作时未能确认可达,代码与刺激是否长期公开应以资源状态为准,不得声称已公开。
教学上应强调相关性不是因果:偏斜可调与自然度提升同时出现,不等于偏斜本身就是自然度的唯一原因,接触过渡的圆钝化同样起作用,需设计解耦实验才能分离贡献。
复现先做什么,需要保留哪些超参数与信息条件?
复现的第一步是实现同一合成器管线或等价面积到声音的映射,否则无法隔离振荡函数的效果。建议按学习依赖顺序操作:先用参考尺寸与基频公式生成长度与厚度,再实现静态线性开度与正弦包络,接着实现新旧两种振荡函数,最后实现面积积分加后部裂隙。关键超参数必须保留:下缘与上缘静息各三档 0.1、0.4、0.7 毫米,相位延迟 40、70、100 度,旧形状负 0.5、0、0.5 对应新形状负 1、0、1,振幅标定点 0.63 毫米对应 800 帕与 1.6 厘米,后部裂隙 0.02 平方厘米,抖动 25%,旧模型双脉冲置零。
信息条件是拷贝合成需使用原始音素时长与基频轮廓,辅音外展按需调整但 2 模型保持相同。验证时先复现图 2 的旧模型曲线形状,再复现图 3 的新模型 4 组合拼接,确认相切连续与偏斜方向正确,然后小规模生成对称与偏斜样本做主观试听,最后再跑全网格与混合模型。还需补的验证包括女性与儿童声道尺寸、其他语言句子、自由韵律下的稳定性,以及计算开销测量。若资源不可达,应先用自实现管模型做相对比较,并明确标注与原文合成器版本的差异。
何时值得尝试这种软接触建模,如何一句话记住它?
当你的发音合成或声码器底座使用几何声带且听感在闭合附近发硬时,值得尝试把硬截零替换为接触与分离两段相切指数,并用过渡时长控制偏斜。一句话记住:让声带在撞上中线前先减速,在分开时先粘后松,波形底部变圆且可左右拉长。复述方法时应先讲任务边界,再讲静动分解,接着讲两段指数拼接与偏斜控制,最后讲同条件听辨的总体增益与零偏斜处的反例。适用条件是需要精细控制发声姿态与波形的研究场景。
若目标只是高资源语言的高自然度端到端合成,该方法的收益可能不如直接换神经声码器。未来值得补的验证是分离软接触与软分离各自的贡献,测量不同开度下的闭商与偏斜的客观声学量,并与高速成像或逆滤波得到的真实面积波形对比。只有在这些客观量与主观量同时对齐时,才能把听感提升更可靠地归因于接触力学的建模。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

