发声时也在场的外激扫频:唇端阻抗分离如何同时拿下共振频率与带宽
针对发声谐波污染唇端扫频响应的问题,该研究用闭口校准加高阶小啁啾变换分离嗓音与扫频重建声道响应,在 90 赫兹到 1100 赫兹基频的/a/静态仿体上识别前四个共振并给出频率与带宽,代价是在共振一致与低基频处误差与分离难度明显增大。
针对发声谐波污染唇端扫频响应的问题,该研究用闭口校准加高阶小啁啾变换分离嗓音与扫频重建声道响应,在 90 赫兹到 1100 赫兹基频的/a/静态仿体上识别前四个共振并给出频率与带宽,代价是在共振一致与低基频处误差与分离难度明显增大。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该研究以扩展版 MOCHA TIMIT 的声学与发音同步记录为依据,用带通滤波加包络差与成对相位一致性比较下颌、整体上部发音器官与喉头活动对声学振幅慢调制的跟随程度,报告喉头信号的音节级协调最强且音节层普遍强于超音节层,但未给出可复用的数值阈值与因果证明。
该研究以 20 期西班牙公共台新闻中 417 个句末耳语为对象,检验说话人、重音位置与话语因素的制约,最强证据是耳语起点集中在重音及重音后音节而非话语转换,代价是样本仅两人两地口音且无声学参数建模。
该研究用卷积模型从舌超声和唇视频预测标准化基频曲线,在 TaL1 上 L+T 中位 Spearman 相关达 0,72、在 TaL80 上达 0,66,而词重音越高预测越准、单纯扩大 articulatory 上下文增益有限。
该研究用电磁发音仪比较波斯语宽焦点、窄焦点和纠正焦点的元音发音动作,发现纠正焦点位移更大、速度更快、时长更长,窄焦点居中,并用发音音系学的手势目标与激活时长等参数解释差异。
该研究用受控朗读与声门图接触商检验喉发音体模型关于低后元音应更收缩的预测,发现共振峰不能预测收缩,[ɑ] 仅比[æ] 高约 0.009 且都在常态嗓音范围内。
该研究以四名母语者的朗读句末双、三、四音节词为对象,测量清化与嘎吱段时长,发现清化时长随词长增加而变长且被前置嘎吱压缩,而嘎吱时长无此规律,代价是样本小、仅朗读体且一人模式明显不同。
该研究用电磁发音仪追踪 12 名波斯语母语者在背景、宽域、窄域、纠正四种焦点下目标词附近的三维头动,报告随突显度增加位移增大、速度整体抬升且速度曲线呈双峰节拍形态,但个体差异大、多数两两比较仅为趋势而非强证据。
针对几何直拖难以产生平滑非线性双元音轨迹的问题,论文用二维弹簧-质量-阻尼器把键盘输入映射为作用力再耦合 Pink Trombone 合成, pilot 显示曲线轨迹的弯曲能量由 1191.1 降到 211.6 而直线定位精度基本相当,代价是样本仅为作者且未做统计检验。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
论文把 sygyt 双声复制写成从录音反推声道形状的可微优化问题,用带舌下第二声源和 B 样条声道的 Kelly-Lochbaum 波导在 20 段录音上把对数谱距离相对基线降低 30-38%,代价是每段仍需约 30 分钟离线优化且绝对误差仍在 9 分贝量级。
Ephemerides 把跨性别声音训练中的共鸣操控变成乐器演奏法,用喉头贴片换能器把振荡器组送进声道再用话筒拾取反馈选音,实践表明它能绕开声带发声并重塑听觉意象,代价是需要长期练习且目前只能做等距微分音阶。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文把声道发音合成的评价转为发音特征上的音素识别问题,用同一识别器比较真实轮廓与三种合成轮廓的音素错误率,最强证据是加浊音编码后无模型合成达到 20.59 的错误率,代价是单说话人法语实时磁共振数据与缺声源信息的固有限制。