英文题目:Programmable Speech Synthesis without Computers

会议身份:conference:interspeech:2026:conference-paper-id:arai26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#信号处理 #发声与构音 #语音 #语音合成

评分:4.1/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.3/1.5 | 清晰度 0.6/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:后50% | 文档类型:系统技术报告

👥 作者与机构

  • Takayuki Arai:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文任务是在不用计算机与电机的条件下驱动滑动块式机械声道模型产生连续短语,输入为6通道发音块位移随归一化时间的目标轨迹,输出为模型辐射的语音波形,难点在于同时协调从唇端到声门端6个滑块的高度以实现元音与辅音的动态过渡。方法链为离线设计轨迹、凸轮轮廓物理编码、机械传动调制共振腔形:先给定凸轮位移曲线,再用可插拔板件在直线基板或旋转基轴上拼出对应轮廓,最后由基板直线滑动或基轴旋转顶升VTM-UT30-D6/D9模型底部的6个发音滑块。相对每句短语加工一整套固定凸轮的旧做法,可编程基板加标准板件允许拆装重构轮廓,同一硬件可切换短语。实验只合成英语短语I love you,对比直线凸轮与旋转凸轮,宽带频谱图显示共振峰走向大致相似,原文未报告任何可核对的定量指标、听测分数、声源与气流条件和重复性统计。原文未提供可核对的关键定量结果。结论仅对缓慢演示性短语成立,未验证长句、辅音丛、鼻腔支路、语速鲁棒性与跨短语泛化,原文未披露成本与延迟。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么不用电脑反而更难?

这篇论文的输入是一个目标短语的发音动作随时间变化的计划,输出是用真实物理声道模型发出的连续语音声波。初学者可以这样理解学习任务:研究者手里有一个按人声道放大的机械腔体,腔体下方插着 6 个可以上下滑动的方块,方块顶起多高就决定了该处声道留多大缝隙;如果能让 6 个方块按正确的时间配合上下运动,气流通过时就会发出接近目标短语的声音。

难点在于不用电脑和电机时,没有程序可以每毫秒分别指挥 6 个执行器,6 路运动必须来自同一个机械时间基准。论文把这个基准做成凸轮:直线凸轮是随底板一起平移的长条高低形状,旋转凸轮是随转轴一起转动的圆盘边缘形状,滑块骑在凸轮上,凸轮走到哪里,滑块就被顶到哪里。因此研究问题不是识别语音,也不是训练神经网络,而是如何把一句语音的 6 路高度时间函数,转换为可以手工拼装、更换后又能说另一句的机械廓形。

必须保留的关键信息是模型名称 VTM-UT30-D6 与 VTM-UT30-D9 的区别、六滑块从底部插入、凸轮廓形决定滑块高度、固定一套凸轮只对应一个特定短语。后续各节将按先路线、再结构、再拼装、再实验的顺序展开,每一步都只讲原文实际给出的做法。

从固定手调声道到电脑控制,本文接在哪一步?

上田与寺西的早期机械模型已经做出了带鼻腔侧支的主声道,做法是从侧面插入一组滑块来调节声道形状,主要用于产生稳定的元音。因为当时很难同时用手操纵多个滑块来复现语音的动态变化,连续短语做不出来。后来有人在同类机械模型上加了电脑控制的执行器,用程序驱动插入块的位置,动作速度足以产生元音和辅音,因此可以合成词和短语。

2024 年到 2025 年,作者团队又发展出 VTM-UT45-D6、VTM-UT30-D6 和 VTM-UT30-D9 等新版本,结构与原模型基本一致,区别是 VTM-UT30 尺寸更小,D9 带有鼻腔,D6 不带鼻腔,6 个块改为从声道底部插入,称为发音滑块。本文接在电脑控制之后,反其道而行:VTM-UT30-D6 与 D9 的 6 个滑块不用电脑和执行器驱动,改用凸轮机构驱动。直线凸轮在滑块下方直线滑动,旋转凸轮在滑块下方旋转,都是靠廓形高低让滑块升降。两种凸轮的共同限制是固定一套只对应一个特定短语,换短语就要换一套。

作者此前已报道过用直线凸轮的初步尝试,本文的增量是把直线凸轮的做法讲清楚,再把同样思路扩展到旋转凸轮,并引入可编程的拼装方式,使得多句话可以用同一套基板或基轴加不同板片来实现。

要解决的具体矛盾是什么?

具体矛盾是动态性与可更换性之间的冲突。一方面,要发出短语而不是单个稳定元音,6 个滑块必须在同一时间轴上连续协调运动,轨迹里既有保持不动的平稳段,也有从一个高度过渡到另一个高度的斜坡段,还有为形成窄缝或闭合而需要的高位段。另一方面,如果把整条轨迹加工成一条固定的凸轮,换一句话就得全部重做,实验成本很高。

论文把任务形式化为:给定目标短语的 6 路位移时间函数,构造一组机械廓形,使底板平移或圆盘旋转时,6 个滑块的实际高度复现这些函数。

教学上可以用一个样本走完全程:以英语短语 I love you 为例,先给出 6 路归一化时间为横轴、位移为纵轴的目标曲线,其中凸轮 1 到凸轮 6 对应从唇端到声门端的发音器,然后把每路曲线切成保持段、升降段和过渡段,再为每段挑选对应高度和形状的板片,插入基板或基轴形成完整凸轮,最后推动底板或转动圆盘,让声道模型发出声音并用语图检查共振峰轨迹。这个例子只是说明流程,不代表论文给出了自动设计算法,原文明确把更系统的声道变量轨迹设计列为未来工作。

两类可编程凸轮的全景与动作顺序是什么?

方法全景可以分为 4 步。第一步是选模型:使用 VTM-UT30-D6 或 D9 的主声道,必要时带鼻腔支路,6 个发音滑块从底部插入。第二步是定目标:为目标短语准备 6 路凸轮位移轨迹,时间轴归一化使总时长为 1.0,纵轴为每路位移。第三步是做凸轮:直线情形把板片插入基板,形成沿长度方向的直线廓形;旋转情形把板片插入基轴,形成沿圆周方向的旋转廓形,每路廓形对应一个发音滑块。

第 4 步是发声:直线情形让装好板片的基板在滑块下方直线滑动,旋转情形让装好板片的凸轮在滑块下方旋转,滑块高度随廓形起伏,气流通过声道即产生声音。关键的可编程思想是凸轮不是整体加工的,而是由底座加多块可互换形状件拼成的,板片可以装上和拆下,因此更换短语时不必重做底座,只需更换板片组合。原文强调无论直线还是旋转,板片都可分为 3 组:负责升降的斜坡类、负责保持的等高类,以及负责特定过渡的异形类。

这种分组让设计者可以按轨迹的斜率和高度挑选零件,而不是每次都从零切削。

主声道、滑块与高度上限如何配合?

主声道是发声的腔体本体,D6 只有主声道,D9 在主声道之外多了一条鼻腔侧支。6 个发音滑块从主声道底部插入,每个滑块的顶部高度决定了该位置的声道开度,顶到顶壁就是闭合或强窄缝,落下去就是开大。原文给出每个滑块的发音目标最大值为 20 毫米,这个值由 VTM-UT30-D6 与 D9 主声道的高度决定。用 20 毫米的斜坡三角形可以让对应滑块到达腭顶或咽壁,也就是顶到天花板。实际设计中常用 18 毫米实现声道高度 constriction,10 毫米实现中等高度的发音姿态。

所有板片下方都有高 5 毫米的矩形底座,用于插入基板,这部分会额外增加总高度,设计时必须计入。初学者容易忽略的是凸轮高度与滑块高度不是随意对应的,凸轮每高 1 毫米,滑块就被多顶起相应距离,因此目标轨迹的纵轴必须按毫米换算成板片高度来选件。

主声道 × 鼻腔支路: 主声道负责从声门到唇端的整体共鸣形状,是 6 个发音滑块直接改变的对象;鼻腔支路是挂在主声道旁边的侧支,只在 D9 模型中出现,用于引入鼻音耦合。两者搭配的原因是原文模型系列要区分不带鼻腔的 D6 和带鼻腔的 D9,以便在同一套凸轮驱动下比较口腔形状变化与鼻支路存在与否的影响,组合意义是发音滑块只动主声道,而鼻支路作为固定或可选的声学旁路参与发声。

沿 I love you 走一遍就是:先看 6 路目标曲线在某时刻的高度,例如唇端滑块需要闭合就选 20 毫米等高块,需要强窄缝就选 18 毫米,需要中等开度就选 10 毫米,再把这些块按时间顺序排在基板上,推动时滑块就会依次经历这些高度。

直线凸轮的三组板片各管什么?

直线凸轮的板片插在基板上,沿基板长度方向形成每路滑块的廓形。第一组是直角三角形,用于升高或降低滑块,高度可在 0 到 20 毫米之间变化,20 毫米的斜坡三角形可让滑块到达顶壁,常用 18 毫米做高度 constriction,10 毫米做中等高度。第二组是矩形,用于让滑块保持在同一水平,高度同样可在 0 到 20 毫米之间变化,20 毫米用于实现完全闭合,18 毫米用于高度 constriction,10 毫米用于中等 constriction,同样带有 5 毫米高的底部插入部分。

第 3 组是各种异形,例如当滑块需要从 10 毫米运动到 18 毫米或反向运动时使用梯形,具体形状取决于目标短语。操作上可以把目标轨迹先分段:平顶段用矩形,斜坡段用直角三角形,两个高度之间需要特定斜率或圆滑过渡时用梯形等异形。挑选时不仅要看目标高度,还要看持续时间,因为直线凸轮的长度对应时间,同样高度变化若发生在更短时间内,就需要更陡的斜坡件。

发音滑块 × 直线凸轮: 发音滑块是从声道底部插入的 6 个可上下移动的阻塞体,直接决定局部声道高度;直线凸轮是放在滑块下方、随底板直线滑动的长条廓形,用高低起伏顶起或放下滑块。搭配理由是不用电机和电脑时,只有靠机械廓形随时间扫过滑块才能实现多滑块同步运动,组合后直线凸轮的长度方向成为时间轴,高度方向成为发音目标值。

下面整理直线凸轮板片的功能与高度选择,比较问题是不同发音需求应选哪种形状与高度,公平条件是同一 VTM-UT30 主声道高度与同一 5 毫米底座,指标方向是高度越高则声道越窄直至闭合。

组别形状功能目标高度底座与备注
第一组直角三角形升高或降低滑块20 毫米到顶,18 毫米强窄,10 毫米中等底座 5 毫米,需计入总高
第二组矩形保持同一水平20 毫米闭合,18 毫米强窄,10 毫米中等底座 5 毫米,额外增加 5 毫米总高
第 3 组梯形等异形特定高度间过渡10 毫米到 18 毫米等按短语而定形状随目标短语变化

表后解释如下。直线凸轮的主要收益是分工清晰:保持用矩形,升降用三角形,特殊过渡用异形,设计者可以按轨迹斜率直接拼装。代价是每句话的异形段都可能不同,梯形等零件需要按短语准备,不能只靠三角形和矩形覆盖所有过渡。未胜出的边界是原文没有给出自动把任意轨迹切分为这 3 组的最优规则,挑选仍依赖人工对照轨迹与零件,复杂辅音丛或快速过渡可能需要更多异形件,这是复现时要预留的工作量。

旋转凸轮如何复用直线凸轮的分组?

旋转凸轮的板片插在基轴上,沿圆周方向形成每路滑块的廓形。分组与直线凸轮一一对应:第一组是斜坡形状,对应直线凸轮的直角三角形;第二组是环形扇块,对应直线凸轮的矩形;第 3 组是各种异形,与直线凸轮情形相同。区别只是时间载体从直线长度变为圆周角度,基轴转过一定角度就相当于直线基板平移一段距离。

因此设计时可以先按直线思路想清楚每段需要保持还是升降,再把对应零件换成圆周版本:需要保持就用对应高度的环形扇块,需要升降就用斜坡块,需要特殊过渡就用异形块。这种对应关系降低了学习成本,学会直线凸轮的选件逻辑后,旋转凸轮只需替换零件形态。

直线凸轮 × 旋转凸轮: 直线凸轮靠底板直线平移把长度位置转换为滑块高度,旋转凸轮靠圆盘转动把圆周角度位置转换为滑块高度。两者分工相同但时间载体不同,前者用直线行程表示时长,后者用旋转一周表示时长。搭配比较的原因是原文要用同一句话验证两种机械时间展开方式是否给出相近的声音,组合意义是证明可编程板片思路既可做成直线拼条,也可做成圆周拼块。

基板 × 可互换板片: 基板是承载整条凸轮廓形的底座,直线情形是长板,旋转情形是中心轴;可互换板片是插入基板或基轴的多块小形状件,每块只负责一段时间的高度或斜率。搭配理由是固定加工的一整条凸轮只能说一句话,改句话就要重做,而把廓形拆成可插拔小块后,只需更换小块组合即可改变整句轨迹,组合后基板提供时间基准和机械定位,板片提供可编程的高度函数。

从可编程角度看,旋转凸轮的基轴相当于圆形的基板,板片沿圆周插入,拆装同样可逆。原文没有报告圆周分辨率或最小角度步长等机械公差,这是复现时需要自行测量和记录的缺项,不能从零件名称推定精度。

本研究有没有训练模型?真实计算过程是什么?

本研究没有训练任何神经网络,也没有优化器、梯度、损失函数或参数冻结与更新的概念。真实计算过程是机械构造与播放,而非数值训练。构造阶段是根据目标短语的 6 路位移轨迹,挑选高度为 0 到 20 毫米的三角形、矩形或异形板片,连同 5 毫米底座一起插入基板或基轴,形成 6 路凸轮廓形。推理阶段是推动直线基板或转动旋转凸轮,让廓形依次顶起 6 个发音滑块,声道形状随时间变化并发出声音。

不存在监督来源、验证集或重置时机,评价靠语图中共振峰轨迹的相似性作定性对照。初学者不要把无训练理解为系统输出完全确定,实际输出还受手工拼装间隙、推动速度均匀性、气流稳定性等物理因素影响。原文未报告推动速度、气流压力、录音设备与环境等定量条件,这些是复现时必须补记的缺项,但不能因为缺项就否定机械合成的可行性,只能说可重复性尚未被完整刻画。

用什么句子、什么条件比较两种凸轮?

实验只用一个英语短语 I love you 作为目标,分别用直线凸轮和旋转凸轮两种方式合成。目标轨迹以图 2 给出,横轴为归一化时间使总时长为 1.0,纵轴为每路凸轮位移,其中凸轮 1 到凸轮 6 对应从唇端到声门端的发音器。声音结果以图 3 的语图给出,左侧为直线凸轮,右侧为旋转凸轮。原文没有给出采样率、窗长、动态范围、说话速度、重复次数或统计检验,数据划分与聚合口径也不适用,因为这不是数据集评测,而是同一句话在两种机械驱动下的对照。

公平条件是目标短语相同、声道模型同属 VTM-UT30 系列、6 路轨迹设计意图相同,差异仅在于时间载体是直线平移还是圆周旋转。需要提醒的是归一化时间为 1.0 意味着两者的绝对时长已被对齐,比较的是形状相似性而非语速,复现时应记录实际推动一周或全程的时间,并保证 2 次录音的气流与环境一致,否则语图差异可能来自操作而非凸轮原理。由于本次没有收到原图像素,只能依据图注与正文归因引用,不能描述曲线的颜色、线型或共振峰的具体频率数值。

两种凸轮的声音有多相似?

原文报告的主要结果是两种方法产生的共振峰轨迹大体相似。这是一个定性判断,不是数值指标的胜负。支持该判断的证据是同一目标短语下,直线与旋转两种驱动的语图在整体走向上一致,说明把同一套高度时间函数分别展开为直线廓形和圆周廓形后,声道模型的声学输出没有发生系统性偏离。教学上应把该结果理解为可行性验证:可编程板片思路在两种机械形式下都能走通,而不是某一种在指标上显著更好。

比较问题是直线与旋转在相同目标下是否给出相近的声学模式,公平条件是同为 I love you、同为 6 路轨迹、同属 VTM-UT30 系列,指标方向是共振峰轨迹越接近则两种载体等价性越强。

驱动方式目标短语轨迹基准声学呈现原文判断
直线凸轮I love you凸轮 1 到 6 从唇到声门,归一化时长 1.0左侧语图与旋转大体相似
旋转凸轮I love you凸轮 1 到 6 从唇到声门,归一化时长 1.0右侧语图与直线大体相似
共同限制单一短语固定一套只对应该短语需重拼才换句未验证任意短语

表后解释如下。主要收益是两种载体得到大体相似的输出,支持用同一套分组逻辑兼顾直线与旋转设计。代价与反例是证据仅限于一句话,没有给出可部署的多句准确率、听感测试或频率误差数字,也没有未胜出项的量化差距。未评测边界包括不同语速、不同音素组合、鼻腔支路开闭对比,以及长期重复播放的机械磨损,这些都不能从一句相似推出普遍成立。复现时应把相似停留在报告层面,记为显示而非证明等价。

若缺少某类板片或换高度会发生什么?

原文没有做消融实验,但可以根据 3 组分工讲清各自的必要性,这属于有限解释而非实测反证。矩形与环形扇块负责保持,若缺少这类等高件,平稳元音段将无法维持稳定高度,声音会不必要地滑动。直角三角形与斜坡块负责升降,若缺少这类斜率件,高度切换只能靠台阶跳变,容易产生不自然的突变或机械卡滞。异形负责特定过渡,例如 10 毫米到 18 毫米的梯形,若用普通三角形近似,斜率与时长可能对不上,导致过渡过快或过慢。

高度选择上,20 毫米对应到达顶壁或完全闭合,18 毫米对应高度 constriction,10 毫米对应中等 constriction,选错高度会直接改变开度与 constriction 程度。原文没有报告拿掉某组后的声音变化,也没有比较不同高度组合的系统性影响,因此不能写拿掉后必然怎样。复现者若想补做,应固定其他 5 路不变,只改变一路的某段零件类型或高度,并用相同气流与推动速度录音对照,才能把零件贡献与操作波动分开。

哪些结论尚未验证,哪些条件缺失?

已验证的是用可插拔板片拼出直线与旋转凸轮,并发出同一短语且共振峰轨迹大体相似。尚未验证的是任意短语合成,原文只做了一句 I love you,虽然提出只要有发音音系学中的声道变量轨迹并通过任务动态实现,就能合成任意短语,但这属于可能与待验证的推测,没有给出多句证据。缺失的实验条件包括气流源与压力、推动或转动的实际速度与均匀性、录音链路、语图参数、重复次数与一致性统计,以及机械公差与底座 5 毫米高度的实测换算。

相关性不等于因果,语图相似不能直接推出听感自然度相同,因为原文没有听感评价与误判率测量。成本方面,训练资源不适用,推理开销体现为手工拼装时间与推动人力,输出时长受基板长度或圆周周长限制,实际延迟与帧率概念不适用。总体趋势不等于每组都成立,直线与旋转在大体相似之下,某些音素过渡仍可能存在细微差异,但原文未量化,复现时不应把末段或某段的相似推广为全程逐帧一致。

复现时先做什么,需要记录什么?

复现应先准备 VTM-UT30 系列声道模型并确认是 D6 还是 D9,因为 D9 多一条鼻腔侧支,会影响声音,选错模型就对不上原文条件。然后准备基板或基轴与 3 组板片,核对每块的标称高度与 5 毫米底座,实测叠加后的总高度,避免把底座漏算。接着为 I love you 准备 6 路目标轨迹,时间归一化到总时长 1.0,并明确凸轮 1 到凸轮 6 从唇端到声门端的对应关系,再按保持用矩形或扇块、升降用三角形或斜坡、特殊过渡用梯形等异形的规则拼装。

播放时记录直线推动的全程时间或旋转一周的时间、推动均匀性、气流条件与录音设置,直线与旋转 2 次保持一致。评价时先对比 6 路实际高度是否复现目标曲线,再对比语图的共振峰走向是否大体相似,不要自行添加频率数值或听感分数。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,复现只能依据论文文字与图注手工搭建。

若要扩展到新短语,需先补上声道变量轨迹的系统设计方法,并为新出现的过渡准备异形件,这是原文明确留给未来工作的部分。

何时值得尝试这种无电脑方案?

当教学目标是让学生亲手感受到声道形状与声音的关系时,这种方案值得尝试,因为每块板片的高度与形状都直接对应一段时间的开度与变化,学生可以摸到时间函数。当前可用性限于论文描述的方法本身,不代表有现成套件可下载,复现本质上是手工制作与调试。当目标是快速合成大量任意句子或追求自然度指标时,不值得用该方案替代电脑控制,因为每句都要重新设计和拼装廓形,效率明显更低。

声道变量轨迹 × 任务动态: 声道变量轨迹指发音姿态随时间变化的目标曲线,如原文图 2 中 6 路凸轮位移随归一化时间的变化;任务动态是把这类姿态目标作为发音手势动力学来实现的框架。搭配原因是机械凸轮需要先有随时间变化的目标高度才能切割板片,而声道变量轨迹正好提供这种与时间对齐的目标,组合意义是若能按该框架给出任意句子的变量轨迹,就能将其转写为对应的直线或旋转板片组合。

对刚入门的研究生,建议把本文读成机械版的发音合成流水线:目标轨迹是输入,板片是可编程的参数,基板运动是时钟,声道模型是合成器。记住 3 个关键数:最大 20 毫米、常用 18 毫米与 10 毫米、底座 5 毫米,以及 6 路从唇到声门的顺序。还需补的验证是多短语、听感评价与操作一致性,只有补齐这些,才能判断可编程凸轮在教学与展示之外的研究价值。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总