英文题目:Machine Learning-Based Evaluation of Mandarin Tone in Patients with Bilateral Vocal Nodules

会议身份:conference:speechprosody:2026:conference-paper-id:hu26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#集成学习 #可解释性 #语音 #病理语音评估

评分:4.6/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Binxin Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Hao Tang:机构信息未能从会议 PDF 纯文本可靠映射
  • Dapeng Lei:机构信息未能从会议 PDF 纯文本可靠映射
  • Wen Liu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究输入为女性普通话四声单字朗读波形,输出为双侧声带小结病理与否的二分类,难点在于轻症小结声学差异细微且与声调调制相互交织。为此方法链分为三步:先在隔音室采集40名发音人的2800个录音并切分元音早中晚三段以保留动态轮廓,输出分段波形进入特征提取。接着用VoiceSauce提取基频等11类声学参数并做共振峰校正,输出校正后特征向量进入分类训练。然后按7比3划分训练测试集并以网格搜索结合十折交叉验证训练6种传统分类器,再用SHAP解析特征贡献以支撑临床解释。与既往持续元音病理检测不同,该工作将声调轮廓作为探测发声控制缺陷的动态负载,其中非平调对声带控制要求更高因而病理差异更显著,具有可解释筛查意义。在测试集评测下,随机森林的准确率为0.861,高于决策树的准确率0.653。该结论适用边界仅限于北方官话成年女性孤立性双侧小结与小样本实验室录音,尚未验证男性、其他病理及连续语流的外推性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完必须带走什么?

这篇解读的输入是 2026 年 Speech Prosody 会议论文全文,目标是让刚进入语音与音频方向的研究生能独立复述方法与核对证据。你读完必须带走三件事:研究对象是谁,声学特征如何从单字录音变成分类器输入,最好的成绩在什么条件下成立。论文研究的是普通话四声在女性双侧声带小结检测中的作用,不是通用嗓音疾病筛查,也不是连续语音识别。作者把声调看作发声系统的灵敏探针,因为声调实现依赖声带振动的精细控制,而小结正好干扰声门闭合。

输出是一套可解释的分类流程,报告随机森林最好,声调 3 最敏感,关键预测因子是基频与倒谱峰突出度。需要提前说明的边界是样本全部为女性北方官话母语者,朗读的是 35 个高频汉字,每字读两遍,共 2800 个样点。录音在背景噪声低于 20 分贝的隔声室完成,话筒距离约 15 厘米,采样率 44.1 千赫,16 位量化。论文没有声称代码或数据已公开,本次也没有收到可验证的开源链接,因此复现只能按文字描述重建流程,不能直接下载原系统。

声调 × 双侧声带小结: 声调负责用基频轮廓区分词义,分工是语言层面的音高目标控制;双侧声带小结负责在声门闭合处制造对称性隆起,分工是生理层面的振动干扰源。二者搭配的理由是声调实现需要精细的声带张力调节,正好放大闭合不全带来的周期性下降,组合意义是把词义性音高曲线变成病理振动的放大器。

为理解后文,先用白话固定术语。声调指普通话用音高曲线区分词义的语言功能,一声高平,二声上升,三声降升,四声下降。双侧声带小结指两侧声带前中三分之一交界处的对称性隆起,发声时妨碍正常闭合。基频指声带每秒振动次数决定的音高物理量,英文为 F0。倒谱峰突出度指倒谱上周期性峰相对背景的突出程度,英文为 CPP,越低表示嗓音越嘶哑不规则。

谐波噪声比指周期成分与噪声之比,英文为 HNR,本文按 4 个频带计算。随机森林指多棵决策树投票的集成分类器,英文为 Random Forest。SHAP 指基于博弈论的特征贡献分配方法,英文为 SHapley Additive exPlanations,正值表示推高判为病理的概率。

同输入同目标的前人做了什么,本文卡在哪个缺口?

在输入与目标都相近的前人工作中,一条路线是用支持向量机、最近邻、高斯混合、梯度提升与深度神经网络区分正常与病理嗓音,声学线索多为微扰、频谱与倒谱参数。另一条路线关注声调语言的病理嗓音,例如越南语肌肉紧张性发声障碍对声调实现的影响,以及非洲语言和粤语中发声障碍对声调感知与可懂度的影响。

这些工作共同说明嗓音病变会损害声调的产生与感知,但多数基于小规模或不易获取的数据集,且对普通话病理嗓音的系统声学分析仍然有限。本文的缺口定位很具体:聚焦临床常见但症状较轻、容易被忽视的双侧声带小结,并把普通话四声作为显式评估维度,同时用可解释方法指出哪个声学线索在哪个声调起作用。

作者还交代了人群选择理由,在已收集的小结数据中男性仅占 9.9%,为避免严重的类别不平衡并控制性别带来的声学差异,研究只纳入女性双侧小结患者与女性健康对照。这意味着结论不能直接推广到男性或单侧病变,也不能推广到自发对话。本文没有与公开病理嗓音库做同条件对比,因此相关工作的对照是路线层面的定位,而非同一测试集上的胜负。

要判别的临床问题如何转成机器学习任务?

临床问题是双侧声带小结的早期筛查与定量评估,传统路径依赖问诊、听感知评估与喉镜,费时费力且不利于及时干预。论文把它转成有监督二分类任务:输入是一个汉字发音的元音段声学向量,输出是病理与健康的标签。举例说明,假设 1 名被试朗读三声字,系统先切出元音的早中晚 3 段,分别提取基频、能量、校正后谐波幅度、4 个频带谐波噪声比与倒谱峰突出度,再把这些数值拼成特征向量送入随机森林,得到判为病理的概率。

这个例子只是帮助理解流程,不代表原文报告过该单字的具体概率。任务的关键约束是按声调分别建模与评估,因为作者假设不同声调对声带控制的要求不同,病理信号的暴露程度也不同。评估指标同时看准确率、精确率、召回率、F1 与曲线下面积,用受试者工作特征曲线比较哪个声调判别力最强。

需要区分的是,论文直接报告的是分类性能,有限解释是声调 3 更敏感的生理原因,未验证的推测是能否直接用于临床诊断,原文只称提供可解释的定量参考,没有承诺替代喉镜。

从录音到判定的全链路先走一遍

全链路可以沿一个样本走完。输入是隔声室录制的单字音频,每字间隔约 1 秒读两遍。表示阶段先在 Cool Edit Pro 中切分,再在 Praat 中标注元音,然后用 VoiceSauce 提取 11 个声学参数,每个参数都在元音的早中晚 3 段取值,因此时间维度被保留下来。组件阶段是 6 种经典分类器并行训练,包括决策树、随机森林、梯度提升树、最近邻、支持向量机与逻辑回归,训练集与测试集按 7 比 3 划分,训练中用 10 折交叉验证与网格搜索调参。目标是最大化对双侧小结的检出能力,同时用 SHAP 量化每个特征的贡献。

输出是每个声调模型的分类标签与概率,以及全局特征重要性排序。原文明确用 R 语言完成统计、建模与可视化。基频用 STRAIGHT 算法提取,谐波幅度参数经过共振峰校正,记为 H1 星减 H2 星等形式。作者特意说明没有纳入传统的抖动与微颤,因为这两项依赖稳定的周期间规则性,更适合持续元音,而普通话声调是连续调制与动态调节,可靠性可能不足。这个取舍是方法全景的重要信息,复现时不应自行加回这两项去比较。

11 个声学参数各自测量什么,为何一起用?

11 个参数覆盖时域与频域两类临床相关线索。基频 F0 测量声带振动速率,用于评估音高与振动动力学。谐波幅度参数测量声门形态,H1 减 H2 越大表示声门开放期更长、漏气更多,H1 减 A1 等越大表示高频能量衰减更快,与闭合速率有关。倒谱峰突出度 CPP 与谐波噪声比 HNR 测量周期性与噪声,越低表示噪声越重。本文的 HNR 不是单一均值,而是 4 个频带的结果,分别对应 0 到 500 赫、0 到 1500 赫、0 到 2500 赫与 0 到 3500 赫。

能量反映发声的声学功率,与振动幅度和气流有关。把它们放在一起的理由是互补:基频看音高目标走偏没有,谐波幅度看声门漏气与闭合形态,CPP 与分频带 HNR 看噪声在哪个频段最重,能量看驱动是否不足。所有参数都取早中晚 3 段,是为了捕捉声调曲线不同位置的病理暴露,例如三声中段转折处可能最需要精细控制。

基频 F0 × 倒谱峰突出度 CPP: 基频 F0 分工是刻画声带振动速率与音高水平,直接对应四声的升降曲拱;倒谱峰突出度 CPP 分工是度量语音周期性与谐波能量相对噪声的突出程度,越低表示非周期噪声越重。二者搭配是因为一个看目标音高是否走偏,一个看振动是否干净,组合后分类器既能捕捉三声转折失稳,又能捕捉全声调的嘶哑性下降。

谐波幅度参数 × 谐波噪声比 HNR: 谐波幅度参数分工是描述声门闭合形态与频谱衰减,例如 H1-H2 反映低频声门开放程度,H1-A1 等反映高频能量衰减速度;谐波噪声比 HNR 分工是按频带量化周期成分与噪声之比。二者搭配是因为前者定位发声形态的漏气与闭合速率,后者给出分频带的信噪证据,组合意义是从形态与能量两个侧面互相印证病理嗓音。

复现时要注意特征口径:谐波幅度必须做共振峰校正,基频提取固定用 STRAIGHT 算法,分段方式是元音时长上的早中晚 3 段,不是整字平均。若改成整字均值或更换基频算法,特征分布会变化,结果不可直接对比。

没有神经网络训练时,模型在学什么?

本研究没有训练深度神经网络,也没有冻结与微调预训练权重,因此不存在梯度反向路径与参数冻结的讨论。6 个分类器的学习都是经典机器学习意义上的参数拟合:在 7 成训练数据上用网格搜索寻找超参数,再用 10 折交叉验证估计泛化,测试集只用于最后评估。随机森林学的是多棵树对特征空间的划分与投票阈值,支持向量机学的是间隔最大的分界面,最近邻学的是训练样本的存储与距离投票,逻辑回归学的是线性加权与阈值。

这些优化都不涉及神经网络的逐层梯度,原文也没有报告具体的网格范围、树的数量或正则系数,因此复现时只能按常规范围自行搜索,并明确记录自己选定的超参数。SHAP 不是训练步骤,而是在最好模型上做的事后解释,用于计算每个特征对病理概率的边际贡献。需要纠正一个常见误解:没有深度训练不等于确定性求解,随机森林的自助采样与特征抽样仍带来随机性,固定随机种子与记录交叉验证划分是可重复的关键。

原文未报告随机种子与划分细节,这是复现时必须补记的缺项。

数据、划分与录音条件是否一致可重放?

实验按问题组织为病理与健康对照的可比设计。被试为 40 名女性北方官话母语者,病理组 20 人,健康组 20 人,均为非吸烟者,无正式歌唱或嗓音训练。刺激为 35 个高频汉字,覆盖四声,元音包括 a、i、u,声母包括零声母与不送气塞音 p、t、k。每字读两遍,构成 2800 个样点。录音设备链为 ThinkPad 笔记本经声卡与调音台连接索尼领夹电容话筒,口距约 15 厘米,软件为 Cool Edit Pro,采样与量化固定。

划分上训练与测试为 7 比 3,训练内做 10 折交叉验证,指标方向都是越高越好。聚合口径上,总体模型混合全部声调评估,声调模型按声调分别训练与测试,因此总体成绩与单声调成绩不能直接比大小。下表把人群与数据规模放在一起,便于核对复现条件是否一致。 表前比较问题是两组是否在性别、语言背景与数据量上公平可比,公平条件是同为女性、日常使用普通话、同样的字表与重复次数,指标方向是人数均衡与年龄接近则混杂较小。

组别人数年龄范围平均年龄字表与重复
病理组女性双侧小结20 人25 到 64 岁40.3 岁35 字每人读 2 遍
健康对照组女性20 人31 到 59 岁43.7 岁35 字每人读 2 遍

表后解释是两组人数完全平衡,总样点 2800 个的算式可直接验算,年龄均值相差约 3 岁且范围有重叠,支持组间可比,但病理组年龄跨度更大且标准差更大,复现时应检查年龄与音高的混杂。未胜出或未评测的边界是男性、吸烟者、单侧病变与连续语流都不在本次设计内,不能用本表推断那些人群的表现。

哪个模型最好,哪个声调最敏感?

主结果分两层:先比算法,再比声调。算法层面上随机森林整体最好,曲线下面积 0.93,准确率 0.86,精确率 0.84,召回率 0.89,F1 为 0.87。声调层面上声调 3 的随机森林最准确,准确率 0.836,精确率 0.800,召回率 0.877,F1 为 0.837,曲线下面积 0.902。声调 2 的曲线下面积达到 0.914,声调 1 最低为 0.854,声调 4 为 0.890。作者的机制解释是非平调需要更大的音高变化与更精确的声带控制,病理差异更容易暴露,其中三声的降升拱形对振动扰动最敏感。

下表把整体最好模型与声调 3 最优条件并置,便于核对可运行策略的实际收益。 表前比较问题是在相同特征与评估指标下,混合声调的整体模型与声调 3 专用模型谁更值得尝试,公平条件是同为随机森林与同套声学参数,指标方向是准确率与召回率越高越好,但需同时看精确率的代价。

模型条件准确率精确率召回率F1 分数曲线下面积
随机森林整体0.860.840.890.870.93
随机森林声调 30.8360.8000.8770.8370.902

表后解释是整体模型的数字略高于单一声调 3 个模型,但两者任务口径不同,前者见过全部声调,后者只在三声上评估,不能理解为整体一定优于分调。声调 3 的价值在于召回率高达 0.877,漏检较少,但精确率 0.800 相对较低,意味着误报代价仍需临床复核。未胜出的反例是声调 1 的一平调判别力最低,说明只用平调做筛查可能浪费声调信息的放大作用。

受试者内声调对比 × 跨模型分类器对比: 受试者内声调对比分工是固定分类器比较一二三四声谁更能暴露病理;跨模型分类器对比分工是固定任务比较决策树与森林等 6 种算法谁泛化更好。前者回答语言学条件的影响,后者回答算法归纳偏置的影响,组合起来才能判断最好的成绩来自更敏感的声调还是更稳健的模型。

声调专用模型的曲线下面积排序需要单独核对,因为准确率排序与曲线下面积排序不完全一致。下表只用原文连续句中明确给出的 4 个曲线下面积,避免把表格裸值与正文四舍五入混用。 表前比较问题是哪个声调的区分能力最强,公平条件是同为随机森林按声调分别建模,指标方向是曲线下面积越大表示排序能力越强。

声调 1声调 2声调 3声调 4判读
0.8540.9140.9020.890声调 2 与声调 3 大于 0.9

表后解释是声调 2 与声调 3 都超过 0.9,支持非平调更敏感的判断,但声调 2 的曲线下面积最高而准确率并非最高,说明阈值选择会影响准确率排序,复现时应同时报告两个指标。限制是这些数字来自单次 7 比 3 划分加交叉验证,没有报告置信区间与显著性检验,不能断言声调 2 与声调 3 的差距具有统计显著性。

下面先看声调模型的受试者工作特征曲线导读,该图横轴为 1 减特异度,纵轴为灵敏度,越靠左上表示区分越好,图例直接给出 4 个声调的曲线下面积。

看图路径: 1. 先看图例中 T1 到 T4 四条曲线的 AUC 标注,确认哪条最靠左上;2. 再看横轴 1-Specificity 从 0 到 1 的范围,确认曲线是否全程贴近纵轴;3. 对比 T2 与 T3 的高 AUC 标注与 T1 的低 AUC 标注,记录非平调更优的顺序

原论文 Figure 2:ROC curves of different tone models.

论文图 2。原论文 Figure 2:“ROC curves of different tone models.”。

从实际像素看,图像右侧图例清晰标注 T1 为 0.854、T2 为 0.914、T3 为 0.902、T4 为 0.89,左侧曲线在横轴接近 0 处密集上升,符合高区分度的形状。由于本次收到的像素左侧纵轴与曲线起点被裁剪,不宜硬读具体阈值点的坐标,只能确认图例数值与正文连续句一致,且声调 2 与声调 3 的优势在图例层面得到支撑。 接下来看绝对 SHAP 值在声调分段上的热力图导读,该图横轴为声学特征,纵轴为声调及其早中晚 3 段,格内数值为平均绝对 SHAP 值,颜色越深表示贡献越大。

看图路径: 1. 先沿底部横轴找到 CPP 与 F0 两列,再沿纵轴区分 T1 到 T4 及其早中晚三段;2. 找出颜色最深的单个格子,核对其中央数值是否为三声中段 F0;3. 比较同一特征在早中晚三行的数值变化,判断贡献是否集中在中段

原论文 Figure 3:|SHAP value| across different tone segments.

论文图 3。原论文 Figure 3:“|SHAP value| across different tone segments.”。

从实际像素看,热力图中最深的格子位于三声中段与 F0 交叉处,数值为 0.1752,明显高于周围格子;同表还可看到二声早段 CPP 为 0.1003、二声中段 F0 为 0.1136、四声整体 CPP 为 0.1131 等较大值。这支持贡献集中在特定声调特定时段,而非均匀分布,复现时应保留早中晚分段,否则会抹平三声中段的峰值信号。

拿掉可解释性会失去什么,特征排序是否稳定?

本文没有做去掉某类特征后重训的消融,因此不能说拿掉基频或 CPP 后性能必然下降多少。实际做的可解释性分析是 SHAP 排序与依赖图,作用是回答没有它会失去什么:失去对关键线索的定位,就无法知道三声靠基频、一二四声靠 CPP。分声调的 SHAP 汇总显示,声调 1、声调 2 与声调 4 的最重要特征都是 CPP,声调 3 的最重要特征是 F0,尤其三声中段的 SHAP 值达到 0.1752。声调 2 中 F0 排第二且与 CPP 差距较小,说明上升调可能同时依赖周期性与音高两条线索。

依赖图进一步显示较低 CPP 与较高 F0 对应更高的病理概率,且呈非线性关系。作者还报告 F0 与 CPP 的方差膨胀因子都小于 5,提示两者共线性不严重,但具体检验数值未在正文列出。 先看分声调特征排序条形图的导读,4 个面板分别为 T1 到 T4 的总体排序,横轴为平均绝对 SHAP 值,条形越长表示贡献越大。

看图路径: 1. 分别查看 T1 Total 到 T4 Total 四个面板的横轴 mean 绝对 SHAP 值范围;2. 对比每个面板第一名条形的特征名与数值,记录 CPP 与 F0 的轮换;3. 观察 T2 面板前两名差距是否明显小于其他声调,判断双线索并重

原论文 Figure 1:SHAP values for different features across

论文图 1。原论文 Figure 1:“SHAP values for different features across”。

从实际像素看,右上 T2 面板第 1 名为 CPP 约 0.1015,第 2 名为 F0 约 0.0956,差距很小;左下 T3 面板第 1 名条形明显更长,数值约 0.1145;右下 T4 面板第 1 名为 CPP 约 0.1131,显著高于第 2 名。这种像素细节支持原文的文字判断:除三声外 CPP 主导,三声由 F0 主导,二声是双线索最接近的 1 例。

随机森林 × SHAP 解释: 随机森林分工是用多棵决策树投票降低过拟合并处理非线性声学交互;SHAP 解释分工是按全部特征排列组合公平分配每个特征对某次判定的贡献值。二者搭配的理由是森林精度高但不透明,SHAP 把黑箱拆成可核对的特征贡献,组合意义是既保留集成学习的判别力,又得到临床可复述的指标排序。

再看核心特征依赖图的导读,左图横轴为 CPP,右图横轴为 F0,纵轴为 SHAP 值,散点颜色区分样本类别,黑色曲线为拟合趋势。

看图路径: 1. 先看左图横轴 CPP 增大方向上散点与拟合曲线的升降,判断低 CPP 对应高贡献;2. 再看右图横轴 F0 增大方向上散点在 120 到 160 区间的分布,判断高 F0 对应高贡献;3. 注意两图纵轴为 SHAP 值而非原始声学值,不要把曲线向下直接读成性能下降

原论文 Figure 4:The impact of core features of specific tones

论文图 4。原论文 Figure 4:“The impact of core features of specific tones”。

从实际像素看,左图 CPP 从 18 增至 24 时拟合曲线先降后略升,低 CPP 一侧散点对应更高的 SHAP 值;右图 F0 在 80 到 200 范围内,120 到 150 附近散点密集且 SHAP 值偏高,拟合曲线呈 U 形。由于像素裁剪了纵轴完整刻度与部分图例,不宜硬读确切阈值,只能定性确认低 CPP 与高 F0 推高病理概率的方向,与正文描述一致。

哪些边界没有测,不能承诺什么?

缺失证据不是技术错误,但必须明确边界。第一,人群边界是仅女性、仅双侧小结、仅北方官话,男性占比过低被主动排除,因此不能承诺对男性、单侧小结或其他方言有效。第二,任务边界是孤立单字朗读,没有连续语流、自然对话与不同语速,声调 3 在单字中最敏感不等于在连续语流中同样最敏感。

第三,评估边界是单次 7 比 3 划分加 10 折交叉验证,没有外部验证集、没有置信区间与统计检验,也没有报告延迟、算力与误判率的临床成本,因此不能承诺实时筛查或降低喉镜使用。第四,特征边界是主动排除了抖动与微颤,理由是声调动态调节下不够稳健,但这也意味着与传统持续元音文献的直接对比条件不一致。第五,可用性边界是本次没有验证可达的代码与数据链接,论文引用 VoiceSauce、Praat 与 R 等工具,但具体脚本与超参数网格未公开,他人重建时会有实现差异。

总体趋势不等于每组每步都成立,例如非平调平均更优不代表每个被试的每个三声样点都更容易检出。

要重做一遍,先做什么,需要补哪项验证?

复现先做三件事。第一,按原文重建数据采集与切分:招募女性病理与健康对照,35 字覆盖四声与 a、i、u 元音,每字读两遍,隔声室录音,Cool Edit Pro 切分,Praat 标注元音,VoiceSauce 提取 11 个参数并保留早中晚 3 段,基频固定用 STRAIGHT 算法,谐波幅度做共振峰校正。第二,按原文重建评估:7 比 3 划分,训练内 10 折交叉验证加网格搜索,6 个分类器同条件比较,指标同时计算准确率、精确率、召回率、F1 与曲线下面积,并按声调分别建模。

第三,重建解释:对最好的随机森林计算 SHAP 全局重要性、分声调汇总与早中晚热力图,再画 CPP 与 F0 的依赖图,检查低 CPP 与高 F0 是否推高病理概率。还需补的验证包括固定随机种子并多次重复划分以给出波动范围,补充外部人群与连续语流测试,记录训练与推理耗时,以及做真正的特征消融即去掉 F0 或 CPP 后重训,原文没有这项,不能用 SHAP 排序代替消融结论。超参数方面原文未给出网格细节,复现时应公开自己搜索的范围与最优值,并说明 R 包版本与 VoiceSauce 版本,否则数值差异难以归因。

何时值得尝试这种声调感知的评估?

当目标人群是普通话女性嗓音,且有条件做安静环境下的单字录音时,这种声调感知的评估值得尝试,因为它把语言学上最需要精细控制的三声变成病理的放大器,同时用 CPP 守住全声调的周期性底线。如果只有持续元音或只有平调,本文的结论不支持直接套用,最好先补录包含升降曲拱的字表。复现时优先从声调 3 与声调 2 入手验证,因为它们的曲线下面积都超过 0.9,且特征指向相对清晰。

需要保持的谨慎是,这仍是初始探索,样本量为 40 人共 2800 样点,验证集中在更大的多样化人群之前,只能作为临床筛查的定量参考,不能替代喉镜诊断。未来的增量应放在混合诊断框架与更多算法的比较上,但任何新增都应保留可解释环节,否则高准确率难以转化为医生可核对的依据。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总