英文题目:Une étude acoustique de la « voyelle fricative » du dialecte hirara du Miyako ryukyuan
会议身份:
conference:jep:2026:conference-paper-id:shao26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Bowei Shao:机构信息未能从会议 PDF 纯文本可靠映射
- Shigeko Shinohara:机构信息未能从会议 PDF 纯文本可靠映射
- Masako Fujimoto:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为平良宫古语摩擦元音I与对照元音及擦音的田野录音,输出为其音类归属判断,难点在于该段兼具清晰共振峰与高频摩擦噪声且与邻段边界模糊难切分。方法先按嗓音起始与共振峰突变人工切分并取中段均值以获得稳定估计,其输出直接进入下一步的元音空间定位。接着用Praat按性别设上限提取第一与第二共振峰以确定其居于i与u之间的高央位置,该空间结果再进入摩擦动态比较。然后逐帧计算振幅距离并以广义加性混合模型比较摩擦元音与s与z的时间轨迹差异从而判定其独特性。与将其静态归为高央元音或音节性浊擦音的做法不同,本文以起首峰后接平台而非倒V形的时间动态作为分类关键机制,具有维持音节核 voicing 的解释意义。原文未提供可核对的关键定量结果。该结论适用边界限于老年日语双语人自然变体的声学描写,尚未验证构音成像与跨方言外推且在特定浊擦音语境下存在切分失败条件而受限。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://praat.org — 链接可访问(HTTP 200)
- 第三方资源:https://stefanocoretta.github.io/tidygam/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
研究对象是什么,为何值得做声学测量
本文输入是宫古语平良方言的短元音系统,目标是判定其中记为/I/与长音/Iː/的摩擦元音在声学上更接近元音还是擦音。读者需要先建立的背景是,平良方言分布于日本冲绳县宫古岛平良市区,被视为宫古语较有代表性的方言,本身属于濒危语言。原文交代的元音格局是 4 个短元音/a, i, I, u/,长元音中有/eː/与/oː/因边缘用法被排除,辅音声母包括/p, b, t, d, k, ɡ, ts, f, v, s, z, m, n, r, j/等,/w/与/h/边缘化,并存在清辅音之间元音清化现象。
输出是 3 组可核对的声学判断:目视语图是否存在摩擦噪声,共振峰点云是否落在高央位置,振幅距离时间曲线是否与擦音一致。必须保留的信息是全部结论都限定在这次录音的发音人、词表与切分标准之下,不扩展为所有宫古方言的结论。学习时不要把摩擦元音直接理解为汉语普通话的舌尖元音或英语的央元音,本文后续用共振峰加摩擦动态两套证据重新定位它。
前人争的是发音部位还是音类归属
相关路线不是一般的元音描写,而是围绕原始宫古语/ɿ/在不同方言中演变出的高元音究竟如何归类。原文回顾的谱系包括大神与狩俣方言、多良间方言、池间方言的声学或发音研究,以及汉语、日语以外语言中摩擦元音的讨论。争议焦点有两个层面。第一是发音部位,有研究称其为舌尖元音或舌端元音,有研究按听感称为中舌元音或央元音,上村的研究则强调听感像央元音但实际是舌叶与[s] 相同的齿龈动作,且与/z/不同的是从不实现为塞擦音。
第二是音类归属,即它究竟是高央元音还是带音节功能的擦音,文献中出现过央元音、中性元音、舌尖元音、特殊元音等多种命名。本文的推进方式不是重复听辨,而是把同一批材料中的摩擦元音同时与/i, a, u/比较共振峰位置,同时与[s, z] 比较摩擦的时间动态。初学者容易误以为有共振峰就一定是元音,原文在讨论部分明确提醒浊辅音与近音也可以有共振峰结构,因此共振峰只是必要证据之一。
要回答的具体问题与比较逻辑是什么
本文要解决的问题可以拆成 3 个可检验的子问题。第一,摩擦元音在语图与波形上是否稳定出现摩擦噪声,特别是在普通元音之后是否更明显。第二,它的 F1 与 F2 均值是否系统地落在/i/与/u/之间,构成高央格局。第三,它的摩擦强度随时间的变化是否与齿龈擦音[s] 与[z] 相同。比较逻辑是双向对照:向元音方向对照/i, a, u/,向辅音方向对照/s, z/。
教学上可以把一个样本走通,例如/muI/中的/I/,输入是前接[u] 的摩擦元音音段,声学表示是上层波形加下层语图,判断目标是该段是否同时保留 voisement 周期与高频非周期能量,输出是该语境下它在听感与声学上接近浊擦音但仍被切分为元音段。只有先理解这种双重比较,后续的切分标准、共振峰取中间段、振幅距离建模才有意义。原文的最终判断是它既不能简单归为高央元音,也不能简单归为音节擦音,这一否定式结论依赖两套证据都不缺。
从录音到两类声学指标的全景流程是什么
方法全景分为 4 步。第一步是田野录音与词表设计,覆盖摩擦元音的各类语音环境并纳入最小对立或近最小对立,例如/kiː/与/kIː/、/aza/与/azI/,同时纳入含/s/与/z/的词以便比较。第二步是人工切分,重点解决擦音声母或普通元音与摩擦元音之间没有明显边界的问题,为此制定 5 条可操作的边界规则。第三步是两类声学参数提取,一类是共振峰结构,另一类是振幅距离随时间的变化。第 4 步是统计建模与可视化,用混合广义加性模型估计振幅距离曲线并检验逐点差异。
工具链按原文交代为手动切分使用 Praat,建模使用 mgcv 与 tidygam 等 R 包,相关链接在本次核对中显示当前可用。初学者应注意,本研究没有训练神经网络,也没有做自动语音识别解码,全部计算是声学测量加统计回归,因此复现重点是切分一致性与参数设置,而不是调参。
切分规则与两类指标各自测量什么
本节承担的教学任务是讲清切分与测量组件,避免把结果差异误读为切分随意造成的。切分组件针对 5 种相邻环境分别规定边界。清声母加摩擦元音取第一个 voisement 脉冲为界,浊塞音加摩擦元音取可见 F2 起点为界,元音加摩擦元音取 F2 变化叠加波形幅度可见下降为界,/z/加摩擦元音分两种实现处理,摩擦元音结尾以载体句中/d/或说话人改换后的塞音为界。
特别重要的是,当/z/实现为部分清化的浊擦音且前半清化时,声母浊部与摩擦元音连为单一声学事件无法切分,该语境的摩擦元音不纳入声学分析,这是一处明确的排除规则。测量组件分为共振峰与振幅距离。共振峰测量把每个元音段等分三份并取中间段均值,最高分析频率女性设为 5500 赫兹男性设为 5000 赫兹。
振幅距离的白话解释是低频谱谷与主要谱峰之间的幅度差,英文为 amplitude distance,缩写为 AmpD,它只在被测段具有擦音或类擦音噪声时才有解释力,原文依据摩擦噪声观察与摩擦元音类似浊擦音的文献才启用该指标。
摩擦元音 × 高央元音: 摩擦元音指在元音性 voisement 周期结构上叠加明显高频摩擦噪声的音段,本研究记为[I] 与长音[Iː];高央元音指仅用第一第二共振峰位置定义的元音类别,位于[i] 与[u] 之间。二者搭配的原因是仅看共振峰会把[I] 判为高央元音,但不解释 6 至 8 千赫能量集中,组合的意义是必须同时检验共振峰结构与摩擦噪声时间形态才能判定其类别。
本段承接上个概念桥,说明为何切分必须先行。若把声母摩擦与元音摩擦混在一起,后续振幅距离曲线的起点就会偏移,峰值靠前加平台的形态也可能被人为抹平。因此理解切分规则是理解时间归一化比较的前提。
振幅距离 × 共振峰结构: 振幅距离指低频谱谷与主要谱峰之间的幅度差,用于度量擦音类强前腔共振与低频反共振的分离程度;共振峰结构指 F1 与 F2 在元音中间段的均值分布,用于定位元音开口度与前后位置。前者分工是刻画摩擦随时间的强弱动态,后者分工是刻画声道形状的元音性目标,二者搭配才能把摩擦元音同时与元音和擦音比较。
综合来看,共振峰回答位置问题,振幅距离回答摩擦时间形态问题,二者缺一不可,这也是原文同时保留两套图形的原因。
本研究有无训练阶段,实际计算过程是什么
本研究没有训练阶段,没有需要更新的神经网络权重,没有优化器、梯度路径、训练轮数或早停设置,也不能把统计回归说成确定性求解。实际计算过程是 3 类既有工具的调用与估计。第一类是 Praat 脚本计算共振峰,属于信号处理调用,参数按性别固定,不在数据上学习。第二类是振幅距离逐帧计算,属于频谱度量调用,输出是每个音段随时间变化的数值序列。
第 3 类是混合广义加性模型拟合,属于统计估计,模型中对发音人与辅音语境做因子平滑,因振幅距离呈左偏长尾而采用标度 t 分布,拟合结果用 tidyverse 与 tidygam 可视化。原文未报告的内容应明确指出缺项:未报告 Praat 共振峰阶数与窗长等更细的脚本参数,未报告混合模型的具体平滑基函数数量与随机效应结构全文,未报告运行硬件与耗时。
由于没有训练集与验证集划分,本文不存在用训练损失选择模型的环节,所谓模型比较是指不同音段曲线的逐点差异检验,而不是分类器准确率比较。
谁在何处以何种条件被录音,词表如何覆盖语境
实验条件按问题组织为录音设备、发音人、词表与载体句四部分。录音在宫古平良市完成,使用 Audio-Technica AT9900 话筒与 Olympus Voice-Trec DS-700 录音机,量化与采样按原文为 16 比特与 44.1 千赫。发音人为 6 人,其中女性 4 人平均年龄 74.3 岁,男性 2 人平均年龄 79.9 岁,均在宫古岛长大并兼说日语。词表初选 25 个含/a, i, u, I/的词,覆盖/maI, miI, muI, baI, biI, buI, kiː, kIː, akIː/等摩擦元音前后语境,并纳入/asa, aza/等含/s, z/的比较词与最小对立。载体句原定为 Urja:__do,实际因语义搭配与说话人熟悉度常被修改,研究接受不同载体句与自发形式如/pIgI, sIsI/等,最终可用片段总数为 760。
公平条件方面,所有发音人使用同一套切分规则与同一套共振峰分析频率上限,振幅距离比较使用同一归一化时间轴。下表把录音与样本量的关键条件集中呈现,便于复现时逐项核对。
| 项目 | 内容 | 数值 | 单位与说明 | 适用条件 |
|---|---|---|---|---|
| 发音人构成 | 女性与男性人数 | 4 与 2 | 人,共 6 人 | 均在宫古岛长大 |
| 词表规模 | 初选词数与可用片段 | 25 与 760 | 词与片段数 | 含自发补充形式 |
| 比较对象 | 元音与擦音 | 4 与 2 | 个元音段与 s z 擦音 | 同一批切分流程 |
表前已提出比较问题是样本是否足以支撑按性别与语境的分析,公平条件是同一设备与同一人工切分标准,指标方向不涉及好坏而是样本覆盖度。下表之后需要解释主要收益与代价。收益是纳入不同载体句与自发形式后可用片段达到 760,覆盖了/kI/这类跨语言罕见语境。代价是载体句不一致会引入语速与重音差异,且/z/与摩擦元音连读语境被排除,意味着该语境的结论存在明确边界。未胜出或未评测的边界是年轻发音人与朗读统一样本缺失,因此年龄与语体效应无法评估。
目视语图显示了什么样的摩擦噪声与罕见协同
结果的第一部分是目视检查,回答摩擦噪声是否存在以及在何处最明显。原文报告摩擦噪声广泛存在于摩擦元音中,当前接普通元音时更明显。以/muI/为例,当前接后元音[u] 时,摩擦元音段在语图 6 千赫至 8 千赫出现强能量集中,波形同时显示 voisement 周期上叠加非周期成分,整体形态接近浊擦音。以/akI/为例,出现值得注意的非典型实现,即摩擦元音直接接在软腭音[k] 之后,原文称这是其他语言中未见报道的罕见语音搭配。
在该例中,[k] 的释放段出现类似齿龈擦音[s] 的高频能量集中,原文将其标记为[k_h] 并归因于协同发音,即舌尖在软腭释放前已在齿龈区形成收缩,使齿龈摩擦噪声主导了原本来自声门的送气噪声。下图为原文 2 例的波形与语图并置,左侧 3 段标签为 m、u、I,右侧 4 段标签为 a、k、k_h、I,上为波形下为语图。
看图路径: 1. 先看左右两块面板底部的切分标签,确认左为 m-u-I 序列、右为 a-k-k_h-I 序列;2. 再对比上层波形中周期成分与非周期成分的叠加位置;3. 最后看下层语图在 6 千赫至 8 千赫附近的能量集中出现在哪个音段
论文图 1。原论文 Figure 1:“Formes d’onde et spectrogrammes des mots /muI/ et /akI/. Le premier illustre la présence de bruit de friction dans la voyelle fricative /I/, le second montre une concentration”。
对上图的解释应分两步执行。左图重点看从 u 到 I 的过渡,高频区由浅变深且波形振幅包络出现摩擦叠加,说明噪声不是录音底噪而是音段自身属性。右图重点看 k 到 k_h 的过渡,中间出现近似静音的闭塞段后突然出现高频强噪声,再进入 I 的周期与噪声混合段,说明[k] 释放已被后续元音的齿龈动作染色。初学者不应把右图的 k_h 直接读成音位/s/,原文只是说声学形态类似[s],音系上仍是/k/的释放变体。这一发现的限制是仅靠声学不能确定软腭与齿龈两个收缩的时间先后,需要发音与气流数据验证。
共振峰点云是否支持高央元音的定位
结果的第二部分是共振峰结构,回答摩擦元音在元音空间中的位置。原文把每个元音段中间三分之一的 F1 与 F2 均值做散点并加 95% 置信椭圆,分女性与男性两面板呈现。报告的结论是摩擦元音占据[i] 与[u] 之间的声学空间,可分析为高央元音,这一格局与琉球语其他方言及世界其他语言摩擦元音的报道一致。下图即该散点结构,横轴为 F2 纵轴为 F1,颜色与符号区分 a、i、I、u,红色 a 点云在纵轴下方代表开口度大,蓝色 i 偏右代表靠前,深绿 u 偏左代表靠后,黄色 I 居中。
看图路径: 1. 先确认左右面板分别为女性与男性,横轴为 F2 纵轴为 F1 且 F1 向下增大;2. 再比较黄色 I 的点云是否落在蓝色 i 与深绿 u 之间;3. 最后观察红色 a 点云在纵轴下方的位置,确认开口度差异
论文图 2。原论文 Figure 2:“Nuages de points représentant les valeurs de formants en Hz de [a, i, I, u] du hirara. Les”。
对上图的解释需要先确认坐标方向再判断好坏。纵轴 F1 向下增大表示开口度增大,因此下方红色 a 为低元音,上方 3 组为高元音。横轴 F2 向左减小表示靠后,因此黄色 I 左右居中即央化证据。可见内容显示女性面板中蓝色 i 与黄色 I 部分重叠但中心分离,男性面板中黄色 I 更集中且与深绿 u 部分相邻,说明性别间绝对频率不同但相对位置一致。
原文讨论部分的重要限定是,F1 与 F2 反映声道形状且受舌最高点影响大,若摩擦元音涉及舌尖或舌叶抬高,口腔形状已实质改变,此时 F1 与 F2 不能直接等同于舌体前后高低的发音动作。没有声学与发音建模就不能从点云位置反推精确的舌形,这是初学者最易犯的过度解读。
协同发音 × 软腭塞音释放段: 协同发音指相邻音段发音动作在时间上重叠;软腭塞音释放段指[k] 在除阻后的一段噪声,本研究在/akI/中标记为[k_h]。前者解释为何[k] 的释放会出现类似[s] 的高频能量,后者提供观察位置,组合意义是说明在/kI/语境下齿龈收缩可能在软腭释放前已经形成,使释放噪声被齿龈摩擦噪声主导。
本段把协同发音的观察与共振峰定位衔接起来。即使共振峰显示高央位置,/kI/语境中的齿龈收缩仍可能改变共振特性,因此位置标签只是声学描述而非发音证明。
振幅距离时间曲线能否把摩擦元音等同于擦音
本节承担的教学任务相当于消融或反证检验:如果去掉元音性假设,摩擦元音能否被擦音模型替代。检验工具是振幅距离随归一化时间的变化。原文报告两类不同形态。擦音[s] 与[z] 呈倒 V 形,[s] 峰值出现在中点之前,[z] 峰值紧靠终点之前。摩擦元音[I] 与长音[Iː] 则无明显倒 V 形,峰值紧随起点之后随后进入平台段。
混合模型逐点差异检验显示[z] 与[I, Iː] 显著不同,仅在轨迹交叉的中段窄区间无显著差异。因此原文判断摩擦元音不能简单归为常规浊擦音[z]。下表把两类指标的设置与报告结论集中呈现,便于核对测量口径而非重复摘要。
| 比较维度 | 测量口径 | 摩擦元音报告 | 擦音报告 | 原文判断 |
|---|---|---|---|---|
| 高频能量 | 语图目视 6 至 8 | 千赫集中,有摩擦噪声 | 千赫亦为擦音能量区 | 形态类似但不等同 |
| 时间动态 | 振幅距离,归一化 0 至 1 | 起点后峰值加平台 | 倒 V 形,峰值偏中后 | 时间形态不同 |
| 统计检验 | 混合模型逐点 95 置信区间 | 与 z 仅中段窄区间重叠 | s 与 z 各自成形 | 不支持等同为 z |
| 样本基础 | 人工切分后可用段 | 760 个片段总量 | 含 asa aza 比较词 | 特定语境被排除 |
表前提出的比较问题是测量条件是否一致,公平条件是同一归一化时间轴与同一发音人语境平滑,指标方向是曲线形状差异而非数值高低。表后解释主要收益与代价。收益是时间形态提供了共振峰之外的第二维度,使音节擦音的简单归类被证伪。代价与反例是振幅距离只在类擦音假设下有意义,若某语境摩擦很弱则该指标解释力下降,且/z/连读语境已被排除,未评测边界包括清化元音与长短音的完整时长效应。
以下进入振幅距离建模图形的导读。该图左上为 4 条曲线加置信带,其余面板为两两差异估计,银杏叶状阴影表示差异显著的时间区间,横轴均为归一化时间 0 至 1。
看图路径: 1. 先看左上四条曲线的整体走向,区分 s 与 z 的峰位和 I 与 I 长音的平台;2. 再看横轴归一化时间 0 至 1 的含义,不要把曲线末端下降直接读成录音结束;3. 最后看其余面板中银杏叶状阴影标记的显著差异区间
论文图 3。原论文 Figure 3:“Différence d’amplitude (AmpD) modélisée en GAMMs pour [I, Iː, s, z], en fonction du”。
对上图的解释应聚焦形状而非绝对高度。左上可见黄色 s 虚线整体较高且呈拱形,深绿 z 点划线由低爬升至 0.75 附近再下降,红色 I 与蓝色 I 长音则在 0.2 附近小峰后走平,末端共同下降。其余差异面板中大面积银杏叶阴影表示显著差异,仅中段窄带无阴影对应轨迹交叉。像素不能精确读出具体分贝数值时不要硬写,原文也没有给出逐点数值表,因此结论应表述为形态与显著区间支持而非某一点数值获胜。
混合广义加性模型 × 归一化时间: 混合广义加性模型指带发音人与辅音语境因子平滑的非线性回归,本研究用它估计振幅距离随时间的曲线;归一化时间指把每个音段声学起点记为 0 终点记为 1 的时间轴。前者分工是分离个体与语境差异后比较曲线形状,后者分工是让长短不同的[I]、[Iː]、[s]、[z] 可以逐点比较,组合后才能判断倒 V 形与平台形的差异是否显著。
本段承接混合模型与归一化时间的组合意义。正因为时间已归一且个体语境已被平滑,倒 V 形缺失才能被解释为音段属性而非语速或发音人差异。
哪些推测尚未被测量,哪些语境不能推广
本节明确区分直接报告、有限解释与未验证推测。直接报告的是 6 至 8 千赫能量集中、高央共振峰位置、起点峰加平台的振幅距离形态。有限解释的是/k/释放类似[s] 源于齿龈收缩提前形成,这一解释有语图形态支持但缺乏发音数据。未验证推测的是收缩截面积未小到使前后腔完全解耦,因而后腔共振未被有效衰减,同时较大截面积有利于降低口内压以维持 voisement,以及舌体下降帮助声带振动等机制。
原文用可能与待验证的语气提出这些空气动力学解释,并明确要求后续发音与气流研究。不能推广的边界包括部分清化[z] 后接摩擦元音的连读语境已被排除,年轻发音人、不同语速与重音条件、元音清化语境下的摩擦形态均未系统评估。相关性不等于因果,振幅距离形态差异不能直接证明收缩面积数值,总体趋势也不等于每一段都呈平台。未测量误判率、延迟与成本,因此不承诺任何识别或合成性能改善。
音节擦音 × 音节核心: 音节擦音指在音系上充当音节核心但声学实现接近擦音辅音的解释;音节核心指承载音节 voisement 与响度主体的位置。摩擦元音若被判为音节擦音,则应出现与[z] 相似的倒 V 形振幅距离轨迹,但本研究观察到峰值靠前加平台,组合的意义是声学形态不支持简单等同,同时作者从保持 voisement 的空气动力学角度推测较大收缩面积可能有利于做音节核心。
本段重申音节擦音与音节核心的张力。声学上更像擦音不等于音系上就是辅音,维持 voisement 的功能需求可能正是其时间形态不同于擦音的原因,这一功能解释仍待气流数据检验。
复现应先做什么,需要保留哪些信息条件
复现的第一优先级是重建相同的切分与测量口径,而不是更换模型。应先按原文 5 条规则重做人工切分,特别注意浊塞音后取 F2 起点、元音后取 F2 变化加幅度下降、清化[z] 连读语境排除。接着用 Praat 脚本取中间段共振峰均值,女性上限 5500 赫兹男性上限 5000 赫兹,绘制分性别 F1 与 F2 散点并检查 I 是否居中。然后计算振幅距离并按归一化时间拟合混合广义加性模型,对发音人与辅音语境做因子平滑并采用标度 t 分布,检验[I] 与[z] 的逐点差异区间。
关键超参数与信息条件包括 16 比特与 44.1 千赫录音、25 词初选加自发补充至 760 片段、载体句允许改换、最小对立覆盖。代码层面 Praat 与 tidygam 链接在本次核对中显示当前可用,但原文未提供完整脚本与数据下载,因此复现者需自写脚本并记录窗长等未报告参数。建议先用/muI/与/akI/2 例做端到端走通,再扩展到全部词表,避免一开始就 pooled 所有语境掩盖/kI/的特殊协同。
何时值得参考本研究,还需补哪项验证
当研究对象同时具有元音共振峰与擦音噪声,或当田野材料中出现难以切分的元音与擦音连读时,本研究的双轨比较值得参考。它提示不要仅凭 F1 与 F2 位置命名高央元音,也不要仅凭高频噪声判定为擦音,而应补充摩擦强度的时间曲线。复现与应用时应保留性别分组、中间段取值、归一化时间与显著区间的报告方式,区分百分点与相对变化,避免把自动声学指标当作听辨或音系判断。
还需补的验证是超声或电磁发音仪对舌尖与舌体动作的同步记录,以及口内压与气流测量,以检验收缩面积与 voisement 维持的推测,并澄清/kI/中软腭与齿龈收缩的时序关系。对于初学者而言,本研究的核心方法是可迁移的:先用可操作的切分规则固定比较起点,再用位置指标与动态指标分别回答不同问题,最后用逐点统计而不是单点均值做出否定式分类判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

![原论文 Figure 2:Nuages de points représentant les valeurs de formants en Hz de \\[a, i, I, u\\] du hirara. Les](https://raw.githubusercontent.com/nanless/audio-paper-digest-images/main/jep-2026/1dd8ba32cc21/figure-2.png)
![原论文 Figure 3:Différence d’amplitude (AmpD) modélisée en GAMMs pour \\[I, Iː, s, z\\], en fonction du](https://raw.githubusercontent.com/nanless/audio-paper-digest-images/main/jep-2026/1dd8ba32cc21/figure-3.png)