英文题目:Phonetic evidence for contrastive voicing in Nakanamanga coronal plosives

会议身份:conference:interspeech:2026:conference-paper-id:li26ha_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #语音学与音系 #语音 #语音属性识别

评分:5.3/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Shubo Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

纳卡纳曼加语Tongoa变体是否存在清齿塞音/t̪/与浊前鼻化龈后塞音/ⁿd/的对立长期悬置,本文输入为词中第二音节声母位置的目标冠音录音,输出为清浊与前鼻化属性的声学判决,难点在于鼻闭塞与口闭塞边界模糊及na-前缀与动词交替限制词首最小对立获取并受元音长短与音节数干扰。方法链先基于词典预研构建12个双音节CV.CV词表并用图片加比斯拉马语提示在固定载体句中诱发五次重复以获得可控语料,其输出进入Praat多层人工切分与测量步骤提取嗓音起始时间与闭塞时长并对/ⁿd/以强度下降中点划分鼻闭塞与口闭塞。切分测量结果再进入线性混合效应模型步骤,以音位音节数元音长短为固定效应说话人与词汇为随机截距分离音位效应。与既往纯听辨描写不同,该链条把前鼻化比例与预浊量直接对应到音位主张,使历史重构假设可被声学量证伪。在词中第二音节声母位置443个词中token测试条件指标下,/t̪/的VOT指标为29 ms,高于/ⁿd/的VOT指标-98 ms。结论目前仅适用于词中位置 Tongoa 变体,Nguna 变体与调音部位不对称机制尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

为什么舌冠塞音的个数会成为历史比较的绊脚石?

这篇论文的输入是瓦努阿图纳卡纳曼加语汤戈阿变体的实地录音,目标是回答该变体究竟有一个还是两个舌冠塞音。必须保留的信息是候选的两个单位分别记作清齿塞音与浊前鼻化 postalveolar 塞音,以及检验它们所用的两个声学量。输出是 1 篇可核对的方法复述,而不是对南岛语分类的重新裁决。

对于刚进入语音领域的读者,白话解释是,舌冠指用舌尖或舌叶去触碰上齿到硬腭前部形成的阻塞,塞音指先完全堵住气流再突然松开的声音。纳卡纳曼加语长期存在争议,是因为正字法一般不区分这两类舌冠音,词典里用字母 d 写的词很少但确实存在,早期语法书只列一个舌冠音却承认这是未解决问题。如果把两个音合并为一个音素,后续的历史拟构就会把邻近语言的对应形式对错位置,理解语言接触和迁移链也会走偏。

本研究的学习依赖是先建立音系假设,再用声学分布检验假设。作者沿用的最近音系分析认为汤戈阿变体存在最小对立对,例如表示未成熟与表示流血的两个词只有词中辅音不同,另有词首的鸡与一种鸟名的对立也被报告为证据。声学部分要做的就是看这两组词的辅音在嗓音起始时间和闭塞时长上是否各自聚成一团、团与团之间是否分开。因此后文先讲相关语言格局,再讲录音与标注如何保证可比,最后讲数字如何支持对立判断。

邻近语言和跨语言类型提供了什么参照系?

同输入同目标的对照首先来自中部瓦努阿图。论文报告,纳马库拉语在 4 个部位都有清音与浊前鼻化音的区分,莱莱帕语和纳夫桑语则只有一套清塞音。纳卡纳曼加语在地理和谱系上夹在中间,汤戈阿变体在唇音、软腭音和唇软腭音处只有清音,却在舌冠位置出现清齿音与浊前鼻化音的对立,这种不对称格局与埃罗马加语的局部相似,都是已报告的例外情形。

同监督不同运行阶段的参照是跨语言的嗓音起始时间类型。白话说,嗓音起始时间就是从松开阻塞到声带开始规则振动的时间差,英文为 voice onset time,缩写为 VOT。正值表示松开后才起振,负值表示在松开前已经起振,即预浊音。文献一般把大于 30 ms 的正值称为长延迟,把较小的正值称为短延迟。送气型语言的 2 个类别都是正值,一类短延迟、一类长延迟,真嗓音型语言则是一类正值、一类负值。

同目标的另一参照是前鼻化塞音的时长结构。白话说,前鼻化就是在一个塞音的闭塞段前半出现鼻音色彩,鼻气流先走、口腔仍闭合,随后转为纯口腔闭塞。多数语言的前鼻化塞音在鼻段和口段都带浊音,总时长以鼻段为主,鼻段占总闭塞的比例在既有气流研究中从约 75% 到约 95% 不等。本研究用声学强度而非鼻口气流切分,因此后文讨论部分明确提醒比例数字不能直接对比,这是需要记住的口径差异。

论文把争议收敛为哪两个可测量的问题?

论文把长期描述分歧收敛为两个研究问题。第一,声学测量是否支持把清齿塞音与浊前鼻化塞音当作两个不同音素。第二,浊的那个音在语音实现上是否确实带有前鼻化。两个问题都有明确的测量落点,而不是停留在母语者直觉或拼写统计。

教学上可以把问题转写为操作定义。第一个问题要求同一个说话人、同一类词重音和音节位置下,两类音的嗓音起始时间分布不重叠或只有极小重叠,且闭塞时长差异在控制说话人和词项后仍然显著。第二个问题要求浊音的闭塞内部能稳定切出鼻段和口段,鼻段平均明显长于口段,且所有浊音 token 都实现为带鼻的前鼻化浊塞音,而不是偶发的鼻化变体。

这里要区分论文直接报告与有限解释。论文报告最小对立对和声学均值分布,支持两个音素的判断。论文对中部瓦努阿图接触导致中间格局的讨论属于可能解释,待用恩古纳变体和气流数据验证。复述时把前者写成显示,把后者写成可能,避免把类型相似直接写成因果。

从一张波形到一组数字需要经过哪几站?

方法全景可以沿一个样本走完。输入是在载体句中读出的目标词,目标词第二音节的声母是待测舌冠塞音。表示是经过降采样后的录音加多层人工标注,组件是 Praat 中的词、音节、音素和音位层切分,目标是得到每个 token 的嗓音起始时间和闭塞时长,输出是进入统计模型的 token 级表格。

具体动作是,标注者先找到目标塞音的闭塞起点和松开点,嗓音起始时间量为从松开爆破到周期性起振的间隔,闭塞时长量为从闭塞起点到松开的间隔。对于前鼻化音,闭塞起点从鼻闭塞开始算起,到口松开结束,鼻段与口段的边界取强度下降的中点。若清音出现多次松开爆破,统一从第一次松开起算嗓音起始时间,避免人为拉长正值。

下面这张标注示例图展示了上述分段如何在真实信号上落地,读图时注意左右 2 例分别对应清音的闭塞加嗓音起始时间与浊音的鼻段加口段。

看图路径: 1. 先看左右两列的上中下三栏分别对应波形、语图和分层标注;2. 再看左例词中闭塞加嗓音起始时间两段与右例鼻段加口段两段的红色虚线切分;3. 最后核对右例蓝色基频线在鼻段连续而在口段松开处跌落的形态

原论文 Figure 1:Example annotation of word-medial /t”, nd/.

论文图 1。原论文 Figure 1:“Example annotation of word-medial /t”, nd/.”。

左例为表示蛇的词,标注把词中清齿塞音切为闭塞段与嗓音起始时间段,波形在闭塞段近乎静默、松开后出现高频噪声再进入元音周期性,语图在相应位置能量缺失后恢复。右例为表示香蕉的词,标注把词中前鼻化音切为鼻段与口段,鼻段波形保持周期性但振幅较小,语图低频鼻共振较强,口段振幅抬高后进入短暂的松开噪声,蓝色基频线在鼻段连续、在松开处快速跌落又回升。这种切分口径直接决定后文鼻口比例的含义,复现时必须沿用强度中点而不是自行改用波形突变点。

嗓音起始时间与闭塞时长各自负责什么?

本节承担的教学任务是把两个核心声学量讲成可执行的测量,而不是名词堆砌。嗓音起始时间回答松开与起振的相对时序,闭塞时长回答阻塞持续了多久,前者区分浊与清的发声类型,后者揭示前鼻化结构带来的额外时长。

嗓音起始时间 × 音位嗓音对比: 嗓音起始时间负责把松开爆破到声带周期性开始的时间间隔量化为毫秒数,音位嗓音对比负责判断这种时间差异是否能区分词义,二者搭配的理由是仅靠听感容易把语境浊化误判为音位,组合后新增的作用是用可重复的正负值分布来检验对立是否成立。

嗓音起始时间为正表示先松开后起振,为负表示在闭塞内部已经起振。本研究中清音全部实现为清塞音,浊音全部实现为前鼻化浊塞音,且浊音的口闭塞显示比清音更强的浊音性,鼻段延续过来的浊音被记录但不视为混淆因素。这种全部分布式的定性观察先于均值比较,保证后文均值差异不是由少数离群点驱动。

闭塞时长 × 前鼻化塞音: 闭塞时长负责度量从闭塞开始到松开的总阻塞时间,前鼻化塞音负责说明这段阻塞内部还分为鼻闭塞加口闭塞两段,二者搭配的理由是浊前鼻化音的总时长天然包含鼻段,组合后新增的作用是能用鼻口比例判断浊音的长闭塞是否来自前鼻化结构。

闭塞时长的分工在于,清音的闭塞就是口腔闭塞,浊音的闭塞是鼻闭塞加口闭塞之和,因此浊音更长并不自动等于发音更用力,而是结构上多了一段鼻闭塞。论文报告清音闭塞均值短于浊音,且浊音的离散略大,这与鼻段时长本身波动较大是一致的。

短延迟嗓音起始时间 × 真嗓音语言: 短延迟嗓音起始时间负责描述清音在松开后很短才起振的正值类型,真嗓音语言负责描述一类清对浊、另一类带预浊音的负值类型的对立格局,二者搭配的理由是只报平均数无法判断属于送气型还是预浊型,组合后新增的作用是把本研究的正值与负值落到跨语言类型坐标上。

把均值落到类型上,清音约短延迟正值,浊音为大幅负值,符合真嗓音型对立的形态,而不是两个正值之间的送气对立。教学例子是,若把英语的短延迟与长延迟想象为都在零上赛跑,本研究的两团则分别在零上和零下起跑,这是需要明确标为例子的类比,真实判断仍以毫秒分布为准。

鼻闭塞 × 口闭塞: 鼻闭塞负责对应软腭下降、有鼻能量但口腔仍闭合的一段,口闭塞负责对应软腭上升后完全口腔阻塞的一段,二者搭配的理由是前鼻化音在波形上是连续浊音,必须用强度下降中点切分,组合后新增的作用是得到鼻口时长比并验证前鼻化是否以鼻段为主。

鼻段与口段的切分动作是看强度包络,强度从鼻段的较低平台跌向口段时取中点为界。论文报告鼻段平均长于口段近 1 倍,鼻段约占总闭塞的 65%,口段约占 35%,这就是前鼻化以鼻为主的声学证据。

最小对立对 × 音素: 最小对立对负责提供除目标辅音外其余环境相同而意义不同的词例,音素负责把这种能区分意义的声音归为不同的底层单位,二者搭配的理由是声学差异必须先排除词汇和环境差异,组合后新增的作用是让声学测量直接回答音系归并问题。

最小对立对与音素的组合保证声学比较的公平性。词表把目标音统一放在第二音节声母即词中位置,前元音统一为短或长的低元音,每类音计划各 6 个词,短长各 3 个,实际因词汇可得性出现数量不均。词首对立只作为补充证据提及,不进入主统计,避免把不同位置的时长混在一起比较。

本研究有没有训练模型?真实计算是什么?

本研究没有训练神经网络,也没有冻结或更新任何模型参数,因此不存在梯度路径、损失函数或早停轮次。把无训练理解为确定性求解是误解,声学测量的不确定性仍来自标注者判断、说话人变异和词项变异,需要用统计模型量化。

真实计算分为两类。第一类是信号处理与数据库操作,全部录音先降采样到 44.1 kHz、16 位,再用 Praat 人工分层标注,随后建成 EMU 语音数据库,用 EMU 数据库管理系统与 R 的 emuR 包提取时长。第二类是统计推断,用 lmerTest 包拟合线性混合效应模型,固定效应为音素、音节数和前元音长短,随机截距为说话人和词项,分别预测嗓音起始时间和闭塞时长。

缺项需要明确指出。原文未报告标注者一致性系数,未报告降采样滤波器细节,未报告 EMU 查询脚本的具体阈值,这些都不能从软件名称推定。复现时应保留人工核对环节,不能直接用强制对齐替代强度中点切分,否则鼻口比例会系统偏移。

被试、词表和录音条件如何保证可比?

实验条件按数据与协议组织。被试为 8 名来自汤戈阿岛的母语者,其中女性 5 名、男性 3 名,年龄 21 岁至 56 岁,部分现居维拉港,均同时使用比斯拉马语和英语或法语,并通过通婚和接触对纳马库拉语及埃法特语言有不同程度暴露。这种多语背景在瓦努阿图具有典型性,论文将其作为背景如实报告,而不是作为协变量建模。

词表基于纳卡纳曼加语词典经大量试测编制,共 12 个双音节 CV.CV 词,目标音在词干第二音节声母。前元音统一为短或长的要求不是实验操纵,而是受限于可用词汇。12 个词按伪随机顺序诱发,避免同类音集中出现。为避免正字法干扰,刺激以图片呈现,必要时给比斯拉马语提示,每个词在载体句中连续读 5 遍,载体句大意为这个词用纳卡纳曼加语怎么说。

录音用便携录音机与心形话筒在汤戈阿岛和维拉港相对安静的室内完成,原始规格为 96 kHz、24 位,分析前降采样。由于元音弱化和动词形态变化,实际产出以双音节为主,约占 81%,三音节约占 18%,四音节约占 1%,未发现单音节 token。分析聚焦词干第二音节声母,剔除受噪声污染的 token 后剩余 443 个。设备、载体句和音节位置的一致性是后文跨说话人和跨词项比较的前提,音节数和前元音长短在模型中作为固定效应加以控制。

嗓音起始时间是否把两类音彻底分开?

要回答的比较问题是,在控制说话人和词项后,清齿塞音与浊前鼻化塞音的嗓音起始时间是否方向相反且幅度足够大。公平条件是同一词中位置、同一载体句、同一套标注口径,指标方向是正值越大表示松开后越晚起振,负值绝对值越大表示预浊音越长。

下图显示两类音的嗓音起始时间分布,读图时先确认零线再看两团的位置关系。

看图路径: 1. 先确认纵轴是嗓音起始时间毫秒数且零线把上下两部分分开;2. 再比较左侧橙色分布整体在零上与右侧蓝色分布整体在零下的位置;3. 最后观察箱体高度和尾部长度判断哪一类的预浊音离散更大

原论文 Figure 2:Distribution of VOT for /t”, nd/

论文图 3。原论文 Figure 2:“Distribution of VOT for /t”, nd/”。

图中左侧橙色为清音,整体位于零线之上,箱体窄而集中,尾部向上延伸有限。右侧蓝色为前鼻化浊音,整体位于零线之下,箱体位置远低于零线,上下尾部比清音更长,说明预浊音时长在鼻段加口段上的波动更大。两团在零线附近没有实质重叠,这是支持音位对立的最直观证据,像素不能精确读出的具体分位数不硬写,以正文均值和模型估计为准。

下表把分布归纳为可核对的数字,比较对象是同一批词中 token 的两类音,基线可理解为浊音的负值中心,本方法列为清音的正值中心,最后一列为混合模型在控制其他因素后的估计差。

对比维度测量指标清齿塞音 /t dental浊前鼻化音 /nd postalveolar模型估计的类别差
松开到起振时序嗓音起始时间均值29 ms−98 ms124.88 ms
统计显著性混合模型检验正值组负值组t = 34.89,p < .001
样本基础可用 token 结构词中位置词中位置共 443 个 token
控制条件随机效应说话人与词项说话人与词项音节数与元音长短已控制

表后解释需要同时给出收益与代价。主要收益是类别差达 124.88 ms,远大于音节数带来的数毫秒波动,且在说话人和词项随机截距下依然显著,说明正负之分可推广到不同人与不同词。代价或反例是浊音标准差更大,预浊音时长更不稳定,四音节词还带来约 30.60 ms 的嗓音起始时间上移,三音节上移约 5.10 ms,前元音长短则不显著。因此不能把均值差理解为每个 token 都恰好相差固定毫秒数,总体趋势不等于每一步都成立。

闭塞时长能否排除偶然的长短波动?

第二个比较问题是,总闭塞时长是否也支持两类音不同,指标方向是时长越长表示阻塞保持越久。公平条件与上一节相同,仍需控制音节数和前元音长短,因为长元音后的塞音闭塞略短,多音节词的闭塞也可能缩短。

下图显示两类音的闭塞时长分布,读图时注意纵轴已换为闭塞时长。

看图路径: 1. 先确认纵轴是闭塞时长毫秒数并找到两侧箱体的中线位置;2. 再比较橙色与蓝色小提琴形的上下延展和最宽处高度;3. 最后看右侧分布向上拖出的长尾对应哪些较长的鼻加口总时长

原论文 Figure 3:Distribution of closure duration for /t”, nd/.

论文图 2。原论文 Figure 3:“Distribution of closure duration for /t”, nd/.”。

图中左侧橙色为清音,中心低于右侧蓝色,分布较集中。右侧蓝色为浊音,中心更高,小提琴形在高值方向拖出更长的尾部,最高可延伸到 150 ms 以上,而清音主体集中在 50 ms 至 110 ms 之间。这种整体上移加长尾的形态与浊音包含鼻段加口段的结构预期一致,但两分布在中部有重叠,因此闭塞时长是辅助证据,不能单独作为分类标准。

对比维度测量指标清齿塞音 /t dental浊前鼻化音 /nd postalveolar模型估计的类别差
阻塞保持闭塞时长均值80 ms98 ms−15.25 ms
统计显著性混合模型检验较短组较长组t = −4.12,p < .001
结构来源时长构成纯口闭塞鼻加口闭塞鼻段为主

表后解释是,闭塞时长的类别差估计为负 15.25 ms,即清音更短,显著但幅度远小于嗓音起始时间的类别差。未胜出项需要如实说明,三音节与双音节几乎无差异,四音节反而缩短约 17.04 ms,长元音后缩短约 8.07 ms,说明韵律结构会压缩闭塞。若只看原始均值会得到 18 ms 差,模型估计略小,这正是控制说话人和词项后的收缩效应。复现时必须同时报告原始均值与模型估计,不能只挑较大的一个。

把浊音拆成鼻段和口段会看到什么结构?

本节相当于对浊音内部结构的分解检验,问题是前鼻化是否以鼻段为主。比较条件是同一批浊音 token 内部的鼻闭塞与口闭塞,指标方向仍是时长越长占比越高,切分口径统一为强度下降中点。

下图显示鼻段与口段的时长分布,读图时注意横轴已变为两段而非两类音。

看图路径: 1. 先确认纵轴仍是时长毫秒数而横轴变为鼻段与口段两类;2. 再比较左侧鼻段分布中心明显高于右侧口段中心的幅度;3. 最后观察鼻段上下尾部更长而口段更集中且在高值处有小凸起

原论文 Figure 4:Distributions of nasal & oral closure duration in /nd/.

论文图 4。原论文 Figure 4:“Distributions of nasal & oral closure duration in /nd/.”。

图中左侧橙色为鼻段,中心明显高于右侧蓝色口段,上下延展更大,说明鼻段本身变异更大。右侧蓝色口段集中在较低区间,箱体窄,但在高值处有一个小凸起,对应少数口闭塞偏长的 token。这种一宽一窄的对比支持鼻段主导总时长的判断,同时提醒口段并非固定常数。

对比维度测量指标鼻闭塞 nasal口闭塞 oral结构比例与样本背景
段时长闭塞分段均值64 ms34 ms鼻口比 1.88
占比结构占总闭塞比例65%35%以鼻为主
样本形态实际音节构成双音节为主双音节为主81% 双音节,18% 三音节,1% 四音节
测量口径切分依据强度中点强度中点非鼻口气流

表后解释是,鼻口比 1.88 与 65% 对 35% 的占比共同显示前鼻化结构成立,这是回答第二个研究问题的关键。需要就近说明的边界是,该比例低于既有气流研究报道的最低约 75%,论文明确归因于测量口径不同,本研究用声学强度, prior 工作用鼻口语气流,未来需用气流数据才能直接对比。另一个未评测边界是发音部位不对称,清音为齿音、浊音为 postalveolar,论文建议用共振峰模式进一步检验,但本研究未测量该维度,不能把时长证据推广为部位证据。

哪些结论不能从这组数据中推出?

首先是位置覆盖的限制。主统计只针对词中第二音节声母,词首最小对立对仅作为补充证据提及,词尾和其他元音环境未系统采样,因此不能把词中发现的正负分布直接推广到所有位置。形态导致的音节数变异虽已建模,但四音节样本很少,其 30 ms 量级的估计不确定性较大。

其次是测量口径的限制。鼻口边界依赖强度下降中点,清音多重爆破统一从第一次松开起算,这些规则保证一致但也引入人为选择。若改用气流或电腭图,鼻段占比可能上移,跨语言比较时必须注明口径。论文未报告标注者一致性,也未测量误判率、延迟或计算成本,因此不能承诺该方法在自动分类或实时应用中的表现。

最后是解释层面的限制。相关性不是因果,与纳马库拉语接触导致中间格局的说法属于待验证假设。恩古纳变体的实现是否更接近莱莱帕语和纳夫桑语的单一系列,仍需独立采样。把本研究的声学对立直接写成历史拟构的定论,会超出证据允许的范围。

要重做这项声学检验先准备什么?

复现的第一步是重建可比的语料。按原文交代,需要 8 名左右汤戈阿母语者,每人对 12 个目标词各读 5 遍并嵌入同一载体句,用图片诱发以避免正字法干扰,录音后统一降采样到 44.1 kHz、16 位。词表应覆盖清浊两类各 6 个词并兼顾前元音长短,若因词汇空缺导致数量不均,应如实报告各格 token 数而不是强行凑平衡。

第二步是复刻标注与提取。按原文动作,在 Praat 中做词、音节、音素和音位 4 层切分,嗓音起始时间从松开爆破量到起振,闭塞从闭塞起点量到松开,前鼻化音从鼻闭塞起点量到口松开,鼻口界取强度下降中点,清音多重爆破从第一次松开起算。随后建成 EMU 数据库并用 emuR 提取,再用线性混合效应模型拟合,以音素、音节数和前元音长短为固定效应,说话人和词项为随机截距。

关于资源可得性,论文称录音已存档于 PARADISEC,链接为目录地址,但本次核对该数据集链接当前不可用,状态为 403,因此当前不能写成已公开可下载。复现时还需补做标注一致性检验和气流对照,并保留关键时长均值作为核对点,清音嗓音起始时间均值、浊音预浊音均值、闭塞均值与鼻口分段均值都应落在相近区间才算复刻成功。

何时值得借用这套两步检验?

当研究对象是正字法不区分、词典频次悬殊但母语者坚称有两个音的边缘对立时,这套先找最小对立对、再用嗓音起始时间看正负分离、用闭塞结构验证前鼻化的方法值得尝试。它的代价是需要大量人工切分和对形态变异的耐心处理,不适合直接搬到大规模自动标注流水线。

回到本研究,论文直接报告的是清音为一致清音、前鼻化音为可靠浊音且鼻段主导,混合模型显示类别效应在控制说话人和词项后依然显著,这支持汤戈阿变体存在清齿与浊前鼻化对立的判断。有限解释是该格局在类型上接近真嗓音对立和充分浊的前鼻化塞音,未验证的推测是接触与历史演变路径。

给研究生的可执行建议是,复述方法时永远先说位置、载体句和切分口径,再报毫秒数,最后才谈音系标签。遇到类似争议,先问分布是否分离、分离能否跨越说话人和词项、结构能否拆出可解释的段成分,这三问都通过才接受对立成立,否则应保留单音素加变体的备选解释并补采气流与多位置数据。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总