英文题目:To glide or not to glide: Acoustic realization of the diphthong-hiatus contrast in Italian and Romanian

会议身份:conference:interspeech:2026:conference-paper-id:cronenberg26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #语音学与音系 #多语言 #语音 #语音属性识别

评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Johanna Cronenberg:机构信息未能从会议 PDF 纯文本可靠映射
  • Lori Lamel:机构信息未能从会议 PDF 纯文本可靠映射
  • Ioana Chitoran:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究输入为意大利语和罗马尼亚语广播新闻与访谈中经强制对齐切分的/ia/序列,输出其语速归一化对数时长与时归一化共振峰动态,难点在于双元音与裂口在连续语流中呈渐变重叠并受重音与词内位置调制。方法链分四步:先基于LIMSI识别器与对齐器筛选目标词并标注第二元音重读与词首词中属性,输出带条件标签的token集进入声学估计。接着用wrassp提取F1与F2并经Bark变换与去均值归一化及B样条时归一化与平滑,输出可比轨迹进入统计建模。然后以线性混合效应回归分析对数归一化时长并以函数型主成分分析分解共振峰轨迹,再用条件均值重构平均F1与F2轨迹。与实验室小样本工作相比,关键差异在于大语料自然变体下分离时长与谱动态并检验语言与重音与位置交互,具有跨语言推广意义。在意大利语广播语料条件下,词中位置重读与非重读间对数归一化时长指标差值为0.56个单位,高于词首位置重读与非重读间对数归一化时长指标差值0.37个单位。该结论适用边界在于仅覆盖/ia/组合且尚未验证感知区分与语素边界等因素,外推至其他元音与语体受限。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么/ia/的归类不只是查词典就能解决?

这篇论文的输入是广播新闻与访谈连续语流中出现的元音序列/ia/,目标是判断它在声学上更接近单音节的双元音/ja/还是跨音节的裂音/i.a/。对于刚进入语音领域的读者,白话解释是:双元音(diphthong)指两个元音挤在一个音节里,第一个高元音/i/常常变弱成一带而过的滑音/j/;裂音(hiatus)指两个元音分属两个音节,各自保持相对完整的元音目标。论文只研究实际发音任务,不做语音合成或识别建模,教学例子是钢琴一词可切分为/pi.a.no/或/pja.no/,例子仅用于说明音节划分差异。

必须保留的信息是:意大利语总体把这类上升响度序列归为双元音,罗马尼亚语总体偏好归为裂音,但两类在两种语言中都存在,且连续语流中存在向双元音偏移的普遍发音偏好。输出是两组可复述的测量:语速归一化后的对数时长,以及第一第二共振峰随时间变化的动态形状。本文默认从原文独立写作,事实仅来自带编号的原文证据与本次收到的官方原图像素。

资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。

双元音 × 裂音: 双元音指/i+a/并入一个音节核并倾向实现为滑音加元音的/j+a/,分工是缩短时长并让两个成分的手势高度重叠;裂音指/i.a/分属两个音节,分工是保留两个相对独立的元音目标并允许更长的过渡;二者搭配的原因是同一拼写序列在罗曼语中存在音节划分竞争,组合意义在于用时长与共振峰陡峭程度把音系分类转化为可测量的连续声学维度。

接下来的学习依赖是:先理解音系归类与发音实现的区别,再看作者如何用大规模自然语料把重音与位置的影响分离出来,最后再进入具体的共振峰计算与统计建模。

前人如何描述意大利语和罗马尼亚语的滑音条件?

意大利语一侧的已有描述是:/ia/类序列通常构成音节核,只有极少数例外,如/i/本身带重音、处在流音之后或跨越语素边界。裂音在意大利语中本来就少,还倾向于在快速连贯语流、年轻说话人和功能词中进一步合并为双元音。离重音越远的序列越可能用腭滑音实现。声学上已有孤立词证据:重读位置的/ia/约 150 ms,非重读仅 72 ms;同一位专业说话人的平台一词/pja.na.le/为 96 ms,而滑雪者一词/Si.a.to.re/为 148 ms。

原文明确指出此前没有研究系统考察过意大利语这类序列的共振峰动态。罗马尼亚语一侧则相反:上升响度序列优先归为裂音,尤其在重读、词首和跨语素边界时阻断滑音形成;只有源自晚期拉丁语重读中元音裂化或/l/腭化的才稳定为双元音。已有构音声学研究给出裂音约 200 ms 且第二共振峰起点约 2220 Hz,双元音约 150 ms 且起点约 2100 Hz,双元音两成分重叠更多、裂音变异更大。

另一项罗马尼亚语研究发现第二成分重读时整个序列约 200 ms,重读前与重读前第二音节位置则不足 175 ms,词首约 210 ms、词中平均约 190 ms。重要的是反向过程未见报道:裂音可在特定条件下塌缩为类双元音实现,但双元音不会反向变为裂音。

滑音形成 × 音节划分: 滑音形成分工是描述高元音/i/在发音上弱化为腭滑音/j/的连续协同过程,音节划分分工是给出/pja.no/与/pi.a.no/这类离散的音系归类;二者搭配的原因是罗曼语普遍存在向双元音偏移的发音偏好但音系偏好不同,组合意义在于解释为何意大利语总体更像双元音而罗马尼亚语总体更像裂音,却在连续语流中都呈现大量中间实现。

这些对照说明本研究的增量不是重复音系分类,而是检验重音与位置在两种相反音系偏好下是否以同样方式促进或阻断滑音。

论文要回答的两个具体问题是什么?

第一个问题是语言总体差异:在声学上,意大利说话人是否产生更短、过渡更浅的轨迹,而罗马尼亚说话人是否产生更长、过渡更陡的类裂音共振峰。原文预期是意大利语轨迹尤其在前半段更具过渡性、两成分之间更浅,罗马尼亚语轨迹更长更陡。第二个问题是语言内部的条件差异:在每种语言内部,重音与词内位置如何改变/ia/的时长与共振峰动态,从而在特定条件下阻断或促进滑音形成。

预期是两语言的非重读序列都更短且可能更平,但词首效应仅在罗马尼亚语中可预期,意大利语尚无先验证据。需要强调的是,论文把第一成分重读与重读后位置的 token 已剔除,剩余 token 要么第二成分/a/重读,要么整个序列处在重读前。因此重读条件实际比较的是/a/重读与全序列非重读,而不是/i/重读。论文同时承认两类在两语言中都存在,所以结论天然允许渐变与重叠,而不是非此即彼的分类。

从广播录音到可比较数字的全景流程是什么?

拿一个包含/ia/的词为例,走完 1 次完整处理有助于建立全景。输入是意大利语 168 小时、罗马尼亚语 300 小时的电台电视录音混合体,包括播报与访谈,既有朗读也有自发语。系统先用已有的自动语音识别与强制对齐得到词与典型音素切分,作者从中抽出/i/或/j/后接/a/或宽口/a/的所有序列,典型转写中的/i/与/j/之分不代表实际发音。接着对词类型自动标注词重音并人工核对,剔除第一成分重读与重读后 token,再按/ia/前至多两个辅音为词首、否则为词中自动标注位置。

然后在切分给出的起止点之间估计第一第二共振峰,做清洗、听觉 Bark 变换、去均值与时间归一化平滑,最后分别建模时长与共振峰形状。时长做语速归一化与对数变换,共振峰做函数主成分分析后再用混合模型检验条件效应。

词重音 × 词内位置: 词重音分工是决定序列是否获得额外时长和更外围的元音目标,词内位置分工是区分词首与词中是否受到起始强化或协同压缩;二者搭配的原因是前人分别报告重音延长效应和词首延长效应,组合意义在于用重音乘以位置的四格设计分离出意大利语以重音为主、罗马尼亚语仅非重读词中倾向滑音的语言特异模式。

全景的关键取舍是:作者不做音位听辨实验,只做产生端的声学实现,并明确把感知分类留给后续研究。

共振峰轨迹如何从原始赫兹变成可比较的形状?

共振峰(formant)白话说就是声道共鸣在频谱上能量集中的峰,第一共振峰与开口度相关,第二共振峰与舌前后位置相关,/i/到/a/的过渡典型表现为第一共振峰上升、第二共振峰下降。作者用 R 的 wrassp 软件包默认设置在每个/ia/区间内估计前两个共振峰。由于数据量大无法人工逐条检查,作者做了两步清洗:先剔除超过 25% 的帧测不到的 token,这一步去掉 530 个意大利语 token 与 2047 个罗马尼亚语 token。

再把超出四分位距 1.5 倍范围的点替换为前后相邻值,这一步影响 31% 的意大利语 token 与 53% 的罗马尼亚语 token,作者抽查数十条确认减少了测量误差且未引入系统偏差。随后按已有西班牙语研究的做法把赫兹转为 Bark 听觉尺度,再减去每条轨迹的均值以去除性别相关的整体高低,最后做线性时间归一化并用样条平滑,为函数分析做准备。

函数主成分分析白话说就是把大量曲线分解为平均曲线加几个典型变形模式,每个 token 在每个模式上得一个分数。 前 4 个主成分分别解释 27.0%、24.6%、13.5% 与 11.8%,共 76.9%。作者只解读与双元音裂音区分有关的第一与第三主成分。第一主成分捕捉两共振峰的陡峭度与弯曲度,高分对应起点终点更外围、中间过渡更陡。

第三主成分主要捕捉第一共振峰峰值时刻与第二共振峰尾段是否存在稳态,高分对应峰值更晚更低、第二共振峰下降更晚且尾段缺少稳态。

时长 × 共振峰动态: 时长分工是用 1 维的对数归一化值回答序列总体拉长了多少,共振峰动态分工是用第一第二共振峰随归一化时间的变化形状回答两个元音目标有多分离、过渡有多陡;二者搭配的原因是西班牙语研究已证明二者需分开建模,组合意义在于避免把更长但更平的轨迹误判为裂音,把更短但更陡的轨迹误判为双元音。

下面这张图直接展示了这两个变形模式的含义,需要先读懂它再看条件差异。

看图路径: 1. 先看四宫格布局:上行为第二共振峰下行为第一共振峰,左列为第一主成分右列为第三主成分;2. 再看黑色粗线为平均轨迹,蓝色与红色渐变线为得分在正负一个标准差范围内的调制结果;3. 比较左列蓝色线是否在起点更高、终点更低且过渡更陡,以确认第一主成分的陡峭度含义;4. 比较右列蓝色与红色线的峰值时刻与尾段平台,确认第三主成分的时间对齐含义

原论文 Figure 1:Patterns of variation in F1 (bottom row) and F2 (top row) captured by PC1 and PC3.

论文图 1。原论文 Figure 1:“Patterns of variation in F1 (bottom row) and F2 (top row) captured by PC1 and PC3.”。

这张图的 4 个面板共享横轴归一化时间与纵轴归一化共振峰 Bark 值。上排为第二共振峰,下排为第一共振峰,左列为第一主成分,右列为第三主成分,黑色粗线为平均轨迹。左侧面板中蓝色高分线在起点明显更高、终点明显更低,中间段斜率更大,这支持把它读为陡峭对平坦维度。右侧面板中蓝色与红色线的差异更体现在峰值左右平移与尾段是否拉平,而非整体高低,这支持把它读为时间对齐与稳态维度。像素可辨的细节是右上第二共振峰尾段蓝色线持续下降而红色线趋平,这是后文判断罗马尼亚语非重读词中缺乏稳态的重要依据。

没有神经网络训练时,什么在承担拟合与推断?

本研究没有训练神经网络模型,因此本节明确说明无训练阶段,实际计算由三部分承担。第一部分是函数主成分分析的拟合:输入为 41576 对时间归一化后的第一第二共振峰曲线,输出为均值函数与主成分函数,拟合在 R 的函数数据分析软件包中完成,不涉及梯度下降、参数冻结或早停,原文未报告训练轮数与优化器,因为不适用。

第二部分是 3 个线性混合效应回归:一个以对数归一化时长为因变量,另两个分别以第一与第三主成分得分为因变量,自变量均为语言、重音、位置及其全部二重与三重交互,随机效应为词类型随机截距与录音段编号随机截距。语料未提供可用的说话人编号,作者用较短的录音段编号近似吸收说话人、录音时间与场景变异。模型经逐步筛选后保留全部固定项,事后比较用估计边际均值完成。

第三部分是重建:把各语言乘以重音乘以位置组合的估计平均主成分得分代回分解式,得到估计的平均时间归一化轨迹用于可视化。缺失的证据是:原文未报告随机效应的方差分量、残差诊断与具体样条节点数,复现时需按默认设置补记并检查稳健性。

函数主成分分析 × 线性混合效应回归: 函数主成分分析分工是把四万多条时间归一化共振峰曲线分解为均值曲线加若干主成分形状并给每条 token 打分,线性混合效应回归分工是检验语言、重音、位置及其交互能否解释时长或主成分得分;二者搭配的原因是前者降维保留曲线形态、后者控制词类型与录音段随机截距,组合意义在于从形态差异重建出各条件的估计平均轨迹并做可比的统计推断。

理解这一点可避免误解:显著性来自大样本混合模型,而非分类器准确率。

数据规模、分组与时长归一化条件是什么?

比较是否公平取决于数据来源、分组定义与归一化是否一致。数据为已用于训练识别系统与对齐器的广播语料,意大利语 57k 词形、罗马尼亚语 48k 词形,均为播报加访谈的混合语体,无说话人元信息。初始抽取意大利语 24371 个、罗马尼亚语 19972 个/ia/ token,剔除第一成分重读与重读后各 160 个与 30 个,再经共振峰可测性筛选后进入分析。分组为 2 乘 2 乘二:语言乘以第二成分是否重读乘以词首与词中。词首操作定义为/ia/前至多两个辅音。

时长归一化操作是:用包含目标词前后各一词的窗口计算每秒音素数作为语速,排除静音、犹豫与目标序列自身时长,再用原始毫秒时长除以语速并取对数以消除右偏。共振峰归一化操作已在组件节说明,包括 Bark 变换、去均值、时间归一化与平滑。统计聚合对象是 token 级,置信区间因样本极大而非常窄。 下面这张表提出的核心比较问题是:各条件是否都有足够样本支撑语言与条件交互的估计,指标方向是样本量越大估计越稳。

表前公平条件是两语言均来自同类广播混合语料并经过同一对齐与清洗流水线。

条件指标意大利语罗马尼亚语比较对象
重读词首token 数44434469意大利语对罗马尼亚语
重读词中token 数1536312267意大利语对罗马尼亚语
非重读词首token 数1390522意大利语对罗马尼亚语
非重读词中token 数2485637意大利语对罗马尼亚语
全部合计token 数2368117895意大利语对罗马尼亚语

该表显示重读词中样本最多,非重读尤其是罗马尼亚语非重读样本较少,但每格仍有数百量级。

主要代价与反例是罗马尼亚语非重读词首仅 522 个、非重读词中仅 637 个,远少于意大利语对应格,任何关于罗马尼亚语非重读的结论都需考虑样本不平衡与语料来源偏差。原文同时报告初始抽取量与清洗剔除量,说明最终分析量小于初始抽取量,未报告说话人性别年龄分布是明确缺项。

时长与共振峰的主结果支持什么判断?

时长要测的是序列总体拉长多少,指标越大表示越像裂音。图前导读如下:下面这张箱线图同时呈现经验分布与模型估计均值,是判断重音效应与语言差异是否被分布重叠淹没的关键证据,请重点比较意大利语内部高低箱体的分离度与罗马尼亚语内部箱体的重叠度。

看图路径: 1. 先确认横轴分为意大利语与罗马尼亚语两组,每组内有四色箱线对应重读与非重读乘以词首与词中;2. 再看纵轴为对数归一化时长,比较意大利语绿色非重读词中箱体是否明显低于黄色重读词中箱体;3. 观察黑色三角估计均值与极窄置信区间,注意罗马尼亚语重读词首的估计是否存在高估提示;4. 对比两语言非重读箱体的中位高度,判断罗马尼亚语非重读序列是否整体更长

原论文 Figure 2:Distribution of empirical log normalized duration val- ues of /ia/ sequences in Italian and…

论文图 2。原论文 Figure 2:“Distribution of empirical log normalized duration val- ues of /ia/ sequences in Italian and Romanian, color-coded by stress and initiality conditions.”。

这张图像素显示意大利语左侧四箱中黄色与蓝色重读箱明显高于红色与绿色非重读箱,而罗马尼亚语右侧四箱高度相近且箱体大面积重叠。黑色三角估计均值在意大利语中随重音上下跳动,在罗马尼亚语中几乎处在同一高度带。原文报告意大利语重读与非重读在词首差 0.37 对数单位,在词中差 0.56 对数单位,均高度显著;罗马尼亚语仅词中重读与非重读差 0.21 单位,词首因重读词首均值被高估而不做解释。

词首对词中的差异仅在非重读显著,意大利语差 0.16,罗马尼亚语差 0.11 且刚达显著边界。跨语言比较显示罗马尼亚语非重读在词首平均长 0.31 单位、在词中长 0.36 单位,支持罗马尼亚语总体更长的判断。 共振峰动态要测的是形状陡峭与外围程度,越陡越外围越像裂音。重建轨迹显示意大利语重读序列比非重读更陡、起点终点更外围;罗马尼亚语非重读词中序列明显最平,尤其第二共振峰过渡平缓。

所有罗马尼亚语序列都比意大利语对应序列更陡,其中非重读词首差异最大,在意大利语中它与非重读词中同属平坦组,在罗马尼亚语中它与重读组同属陡峭组。综合起来报告显示:意大利语以重音为主导,罗马尼亚语仅非重读词中偏向滑音,整体上罗马尼亚语更长更陡但两语言高度重叠,支持渐变而非 2 分。 下面这张表把关键的成对差异放在同一量纲下比较,指标方向均为差值越大分离越明显,公平条件是均为语速归一化对数时长上的估计边际均值差。

条件指标意大利语差值罗马尼亚语差值跨语言差值
重读减非重读词首对数归一化时长差0.37高估不解释罗马尼亚语非重读长 0.31
重读减非重读词中对数归一化时长差0.560.21罗马尼亚语非重读长 0.36
词首减词中非重读对数归一化时长差0.160.11未报告显著跨语言差
词首减词中重读对数归一化时长差未报告显著未报告显著未报告显著
样本与检验t 与 p 值t2069 等于 11.8 p 小于 0.001t1969 等于 5.8 p 小于 0.001t2004 等于 6.3 p 小于 0.001

该表的主要收益是量化了意大利语重音效应的强度约为罗马尼亚语的 2 倍以上,代价是罗马尼亚语重读词首估计存在高估,相关词首重音比较不可用。

未胜出项是词首效应在重读条件下两语言均不显著,说明位置不是普遍主导因素。

去掉陡峭度只看时间对齐会漏掉什么?

把分析拆开有助于理解为何必须同时保留第一与第三主成分。如果只看时长,会把罗马尼亚语所有条件都判为裂音,漏掉非重读词中在形状上明显更平的滑音倾向。如果只看第一主成分的陡峭度,会把意大利语非重读词首与词中都判为平坦双元音,漏掉它们在峰值时刻与尾段稳态上的细微差异,而这正是第三主成分的贡献。原文未做去掉某一清洗步骤或去掉随机效应的消融,但提供了等价的反证:第二与第四主成分虽解释不少方差,却与双元音裂音区分无关而被舍去,说明方差大不等于语言学相关。下面这张重建轨迹图是形状证据的核心,需要结合两个主成分一起读。

看图路径: 1. 先确认四宫格为语言乘以共振峰,上行为第二共振峰下行为第一共振峰,横轴为归一化时间;2. 再按颜色追踪四种重音位置条件,比较意大利语非重读两条线是否起点更低且过渡更平;3. 在罗马尼亚语面板中单独追踪绿色非重读词中线,看其中段是否明显更平且尾段缺乏平台;4. 跨语言比较同色线的起点高度与斜率,判断罗马尼亚语轨迹是否整体更陡峭

原论文 Figure 3:Estimated mean F1(t) and F2(t) for the two languages and four stress × initiality conditions,…

论文图 3。原论文 Figure 3:“Estimated mean F1(t) and F2(t) for the two languages and four stress × initiality conditions, reconstructed using PC1 and PC3.”。

像素可见的 3 个模式是:意大利语左侧上下两排中黄蓝两条重读线起点更高、爬升更陡、峰形更尖,而红绿两条非重读线起点更低、中段更平;罗马尼亚语右侧面板中绿色非重读词中线在第二共振峰中段明显平坦且尾段持续下滑缺乏平台,而其余 3 条线起点更高、下降更陡且尾段趋平;跨语言比较同色线,罗马尼亚语线的起点与斜率普遍高于意大利语对应线。这种部分分离加大量重叠的形态支持渐变解释,也为后续感知实验指明必须按重音与位置分层呈现刺激。

哪些边界会限制结论的外推?

第一是说话人与场景混杂。语料无说话人编号,只能用录音段随机截距近似,无法分离说话人、年龄、语体与录音环境的独立贡献。意大利语裂音塌缩已知与语速、年轻说话人与功能词有关,本文未按这些变量分层,总体趋势不等于每组都成立。第二是测量与清洗不对称。罗马尼亚语有 53% 的 token 经历异常点替换,意大利语仅 31%,自动清洗虽经抽查但未做人工全检,可能在两语言间引入不同的平滑偏置。

第三是估计偏差已自报。罗马尼亚语重读词首的边际均值被高估,相关词首重音比较被作者主动搁置,复现时不应把该格当作显著发现引用。第四是生态效度边界。结论来自广播连续语流的大样本平均,不能直接推广到实验室孤立词、儿童语或歌唱语,也未测量听者实际分类准确率与反应时,因此不能承诺感知上同样渐变。第五是音段语境缺失。

语音环境、语素边界与前后辅音未进入本轮模型,作者明确留给后续研究,任何把重音当作唯一阻断因素的表述都超出证据。

复现这套分析先做什么、需要补哪项验证?

先做可重放的数据准备:获取同类广播语料或自有连续语流,用强制对齐得到词与音素边界,按原文规则抽取/i/或/j/后接/a/的序列,独立标注词重音并剔除第一成分重读与重读后 token,再按/ia/前至多两个辅音为词首否则为词中分组,记录每格的 token 数是否接近原文的 4443、15363、1390、2485 与 4469、12267、522、637 的分布形态。若使用不同对齐器,需报告边界系统偏差对短序列的影响。

再做声学测量:用默认设置的共振峰跟踪在起止点间估计第一第二共振峰,复刻超过 25% 缺测剔除与四分位距替换两步清洗,分别记录剔除的 530 与 2047 量级是否可比,抽查数十条原始与清洗后轨迹确认无系统拉平。接着做归一化:转 Bark、减均值、线性时间归一化加样条平滑,时长用含前后一词窗口的音素率归一化并取对数。最后拟合 3 个混合模型并重建平均轨迹,核对 0.37、0.56、0.21、0.16、0.11、0.31、0.36 这组差值是否在方向与量级上重现。

还需补的验证是:报告说话人信息可得时的随机效应结构、清洗比例不对称的敏感性分析、罗马尼亚语重读词首高估的诊断,以及按语速、语体与语素边界分层的稳健性检验。资源方面,原文未声明代码数据公开,复现应视为方法可复述而非开箱可运行。

何时值得借用这套时长加形状的思路?

当研究对象是同一音段序列在两种音系偏好下的连续实现,且怀疑单一时长指标会把拉长但协同更多的 token 误判时,这套先分离时长再用函数主成分刻画形状的思路值得尝试。它的适用条件是:有可靠的起止边界、有足够 token 支撑函数分解、有明确的重音与位置标注,并且能接受大样本下微小差异也显著的现实,转而关注效应量与分布重叠。本研究的直接报告是意大利语重音主导、罗马尼亚语仅非重读词中偏滑音且整体更长更陡。

有限解释是更短更平意味着手势重叠更多因而更像双元音;待验证的推测是听者在感知中同样渐变且依赖相同声学线索。在未测量误判率、延迟与成本时,不应承诺该方法改善识别或诊断性能。对于教学复述,记住三句话即可:意大利语看重音,罗马尼亚语看非重读词中,两语言内部与之间都有很大重叠,因此滑还是不滑是一个程度问题而非开关问题。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总