英文题目:Indicateurs phonétiques fondés sur les formants pour l’évaluation de la qualité des systèmes TTS

会议身份:conference:jep:2026:conference-paper-id:miniconi26_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #语音学与音系 #语音 #语音质量评估

评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Natacha Miniconi:机构信息未能从会议 PDF 纯文本可靠映射
  • Jane Wottawa:机构信息未能从会议 PDF 纯文本可靠映射
  • Meysam Shamsi:机构信息未能从会议 PDF 纯文本可靠映射
  • Anthony Larcher:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究输入为法语TTS合成音频与听众自然度MOS排序,输出是可解释的共振峰音质诊断指标,难点在于自然度成因多维且自动MOS预测缺乏语音学可解释性。方法链分三步:先用蒙特利尔强制对齐器做音素对齐得到元音边界,其输出的切分段进入Parselmouth加Burg算法逐实现提取F1与F2并以四分位距按k为1.5剔除离群值。最后由平均共振峰坐标派生三角与多边形面积、元音内离散度与元音间距离三类指标,并与系统级MOS做斯皮尔曼秩相关比较。与既有整体元音空间研究的关键机制差异在于细化到F1与F2分轴的局部对比与特定元音不稳定性诊断,因而能定位压缩或混淆位置以指导数据收集与微调。在BC-FR语料评测设置下,MOS 4-5组的多边形面积指标为186 060,高于MOS 1-2组的多边形面积指标143 317。同时F1轴上/i-E/元音间距离指标与MOS的SRCC为0.48而/o/在F2上的元音内离散度指标与MOS的SRCC为-0.56,前者为正相关而后者为负相关。该结论适用边界受限于单女性说话人朗读体法语与20个TTS系统加1个自然参考的验证范围,向多说话人、自发语体与其他语言的外推尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么听感打分不够,还要看元音的声学位置?

输入是法语语音合成系统的输出音频,目标是判断哪套系统听起来更接近人类语音。初学者容易把任务理解为给音频打一个总分,越高越好。原文要保留的关键信息是:自然度被定义为听者感知的接近人类语音的程度,常用平均意见分来度量,即多人按 1 到 5 打分后取算术平均,1 表示像机器,5 表示像人类。

只靠听感打分存在三处学习依赖。第一是成本与主观性,每段音频至少需要十几名听者,打分受试听条件和个人标准影响。第二是不可解释性,总分能排序系统,但不能指出是哪个元音对比丢失或哪个区域不稳定。第三是自动预测总分的神经网络往往需要大量标注数据,且内部表示难以对应到发音动作。

因此作者引入声学语音学的中间表示。白话说,共振峰就是元音频谱包络上的能量集中区,前两个共振峰 F1 和 F2 最能区分元音。英文为 formant,F1 反映开口度和舌位高低,开口越大 F1 越高;F2 反映舌位前后与圆唇,前元音 F2 高,后圆唇元音 F2 低。把同一说话人或同一系统的多个元音平均点画在 F1 与 F2 平面上,就得到元音空间,英文为 vowel space。

输出不是一个新的总分,而是 3 类可核对的诊断量:空间面积、同一元音内部的离散、不同元音之间的距离。本文只研究法语 7 个口元音,不涉及鼻化元音和辅音质量。

同类评估路线在比什么,为什么本文选共振峰?

要理解本文位置,需要按相同输入、相同目标、相同监督和相同运行阶段作对照。相同输入都是合成语音波形,相同目标都是预测或解释自然度高低。第一条路线是直接做听感测试求平均意见分,监督来自人类打分,运行阶段在系统发布前做主观评测,优点是直接反映感知,缺点是贵且不诊断原因。

第二条路线是训练自动平均意见分预测器,用大量带人类分数的音频监督学习,运行阶段无需人类即可打分。原文提到这类方法泛化需要大数据,且可解释性有限。第 3 条路线是用自监督语音表示的距离做无监督质量估计,例如从 wav2vec 2.0 或 HuBERT 抽取嵌入后算距离,原文指出其与平均意见分的相关可以达到与本文最好指标可比的水平,但同样难以解释是哪组对比出了问题。

本文选择共振峰路线,属于临床语音学和社会语音学中已有的做法,优点是客观、可自动化且能对应到舌位动作。已有英语合成研究显示训练过程中元音空间会变化,低质量系统的空间组织不同,但多为全局度量,缺少对原型与边缘实现、高度轴与前后轴的细粒度区分,也很少覆盖法语。本文的差异化正在于把全局面积拆成局部高度对比和后部稳定性,并首次在法语上系统检验 3 类假设。

本文要回答的具体问题和三个可证伪假设是什么?

问题是:基于元音共振峰的语音学度量,能否成为合成语音自然度的可靠且可解释的指标。作者把它拆成 3 个方向。第一个方向记为 H1,空间大小假设:被听者评为不自然的系统元音空间更小,对比被压缩;自然度高的系统空间更大,更接近自然语音。

第二个方向记为 H2,元音内离散假设:最自然的系统应呈现与人类语音可比的类别内可变性,反映真实的发音变异,但这种容忍度在不同音位上并不均匀。举例只是教学例子:外围的/a/可能容忍更大变异,而后部密集区的/o/对过度离散更敏感,容易与邻近元音混淆。

第 3 个方向记为 H3,元音间距离假设:高自然度系统应保持极端元音之间清晰分离,而声学上本就接近的元音对距离可以较小;低自然度系统则出现扭曲或混淆。这是作者自称首次提出的假设形式。3 个假设分别对应后文的面积指标、离散指标和距离指标,检验方式都是在系统层比较指标排序与平均意见分排序的一致性。

从一段音频到三个指标,流水线经过哪三步?

先沿一个样本走完全程。输入是一段法语音频及其文本,例如朗读文本对应的波形。第一步用自动标注得到每个音素在时间轴上的起止区间,记时间长度为 T。第二步在每个元音区间内逐帧估计 F1 和 F2,每个元音实现得到一个 2 维点,全部实现总数记为 N。第 3 步按元音类别求平均,类别数记为 V,再由此推导 3 类指标,元音对数记为 P,等于 V 乘以 V 减 1 再除以 2。

下面这张总览图把上述数据形态变化画了出来,读图时注意每个方块下方标注的形状含义,这是复现时核对数组维度的关键。

看图路径: 1. 从左侧波形加文本输入出发,沿箭头数出自动标注、共振峰提取和指标计算三个主块;2. 确认第二步输出形状为 2 行 N 列,对应每个实现一个 F1 与 F2;3. 对比第三步分出的三个分支:多边形构建、共振峰离散、元音间距离各自的输出形状;4. 注意最上方面积计算分支只输出一个标量,与下方两个向量型输出不同

原论文 Figure 1:Vue d’ensemble du pipeline d’analyse.

论文图 1。原论文 Figure 1:“Vue d’ensemble du pipeline d’analyse.”。

图中从左到右可见三块蓝色主处理。第一块是自动标注,输入为单通道波形加文本,输出为带音素符号的时间切分。第二块是共振峰提取,输入切分后的元音段,输出形状为 2 行 N 列的散点集合,上行为 F1,下行为 F2。第三块是取度量,输入该散点集合,输出分 3 路。上路先构建多边形再算面积,最终为一个标量。

中路算每个元音的共振峰离散,最终为按元音和共振峰组织的向量;下路算元音对距离,最终为按元音对和共振峰组织的矩阵。像素细节显示各分支输出旁用红紫小块示意多维结构,面积分支末端画成三角形符号,强调标量性质。理解这张图后,后续公式和参数才有安放位置。

三类指标各自算什么,为什么要分 F1 和 F2?

第一类是空间大小。在 F1 与 F2 平面上取平均点,用鞋带公式求面积。三角形只用基点元音/i/、/a/、/u/,代表高度和前后两个维度的最小张开;多边形则按 F2 递减顺序连接/i/、/e/、/E/、/a/、/O/、/o/、/u/的全部外围点,捕捉更精细的整体扩张或压缩。面积大表示开口对比和前后对比保持得好,面积小表示整体压缩。

第二类是元音内离散。对每个元音类别,分别对 F1 和 F2 求标准差。标准差大表示同一音的多次实现忽前忽后或忽开忽闭,生产不稳定;标准差小表示实现集中。分开 F1 和 F2 的原因是高度不稳定与前后不稳定对应不同的发音控制问题,不能混成一个数。

共振峰 × 元音空间: 共振峰负责给出每个元音实现的声学坐标,其中第一共振峰 F1 对应开口度和舌位高低,第二共振峰 F2 对应舌位前后和圆唇程度;元音空间负责把同一系统所有元音的平均 F1 与 F2 点连成三角形或多边形,用面积和形状刻画对比是否被压缩。二者搭配的理由是单个共振峰值只能说明一个音,而空间把多个平均点组织成整体结构,组合后新增的作用是可以同时诊断整体压缩和局部对比丢失。

第 3 类是元音间距离。对每 1 对不同元音,分别在 F1 轴和 F2 轴上用均值作差,记为该轴上的距离。F1 距离反映高度对比,例如/a/与/i/应有大的高度差;F2 距离反映前后对比。分轴计算的理由是感知研究提示高度线索往往比前后线索更显著,压缩可能主要发生在 F1。

平均意见分 × 斯皮尔曼等级相关: 平均意见分负责提供人类听辨的自然度排序,它是对每段音频多人打分后取算术平均;斯皮尔曼等级相关负责检验声学指标的系统排序是否与该人类排序一致,只看名次单调关系而不要求线性等距。二者搭配的理由是声学指标单位是赫兹或面积,听感分数是等级量表,直接比数值没有意义,组合后新增的作用是把赫兹差异转化为可比较的排序一致性证据。

对齐与声学估计如何配合,离散与距离如何分工?

实现层面先要解决边界问题。作者用蒙特利尔强制对齐器和法语词典把语料切成音素段,只保留 7 个目标元音。接着用 Parselmouth 调用 Burg 算法估计共振峰,时间步长 5 毫秒,分析窗 25 毫秒,最多求 5 个共振峰,只用前两个。估计前去掉低能量帧,阈值 20 分贝,只保留浊音部分。频率上限默认 5500 赫兹,对后圆唇元音/u/和/o/降到 4500 赫兹,目的是减少 F2 与 F3 的自动混淆。随后按元音类别做四分位距过滤,容忍系数取 1.5,落在上下界之外的共振峰值视为离群值剔除。

元音内离散 × 元音间距离: 元音内离散负责度量同一个元音多次实现之间的稳定程度,用 F1 或 F2 的标准差计算;元音间距离负责度量两个不同元音平均位置在 F1 或 F2 轴上的分离程度,用均值之差计算。二者搭配的理由是自然语音既需要类别之间分得开,又需要类别内部不过度发散,组合后新增的作用是可以区分压缩型退化与不稳定型退化,前者表现为距离变小,后者表现为离散变大。

这一步的输入是切分区间加波形帧,输出是每个元音类别干净的 F1 与 F2 样本集合。原文给出的类别频数差异很大,/a/最多,/o/较少,这是后文解释/o/统计波动时必须记住的条件。离散用样本标准差,距离用类别均值之差,面积用多边形顶点坐标的鞋带公式,三者都建立在同一组均值之上,因此复现时必须先冻结均值计算,再派生 3 类指标,否则会对不齐。

强制对齐 × 共振峰提取: 强制对齐负责在时间轴上切出每个元音段的起止边界,给出哪个时间区间对应哪个音位;共振峰提取负责在这些区间内的浊音帧上估计 F1 和 F2 数值,并经四分位距过滤去掉离群值。二者搭配的理由是先有边界才能按类别统计,先有逐帧估计才能算均值与标准差,组合后新增的作用是把连续波形变成以元音类别为单位、可直接计算面积、离散和距离的表格化表示。

本研究训练了什么,没有训练什么?

本研究没有训练任何语音合成模型,也没有训练平均意见分预测器,不存在神经网络梯度更新、参数冻结与解冻或早停选择。合成音频全部来自已有语料,声学模型与声码器都是语料中既有的系统,研究者实际执行的计算是测量与统计流程。

真实计算过程可复述为 4 步。第一步调用已有强制对齐模型做推理,得到音素边界,不更新其参数。第二步调用信号处理算法逐帧估计共振峰,属于确定性数值计算加能量门限和上下限设置。第 3 步按类别做四分位距过滤和均值、标准差、面积、距离计算,属于聚合统计。第 4 步在系统层计算指标排序与平均意见分排序的斯皮尔曼相关并检验显著性。

需要指出的缺项是原文未报告对齐错误率、共振峰估计在每类元音上的有效帧保留率,也未给出鞋带公式顶点顺序对面积符号的处理细节。不能从模型名称推定声码器实现,也不能把无训练等同于结果无随机性,因为对齐和离群值过滤仍会引入数据依赖的变动。

数据、系统、打分协议和评价方式如何保持一致?

数据来自法语 BC-FR 语料,即 VoiceMOS 挑战 2023 提供的法语部分,共 882 段音频,来自 20 套语音合成系统加 1 位女性说话人的自然语音,总时长 2 小时,内容源自有声书。合成资源主要基于该说话人的录音,架构覆盖 Tacotron、FastSpeech2 和 VITS 等家族,声码器包括 HiFi-GAN、BigVGAN 和 LPCNet 等组合。复现时必须保留该构成,因为说话人单一意味着结论不能直接推广到多说话人或自发对话。

主观协议是 363 名听者按 1 到 5 打分,1 为像机器,5 为像人类,每段音频至少 15 人打分,取算术平均得到系统或音频的平均意见分。声学侧按系统聚合,先得到每系统每元音的平均 F1 与 F2,再算 3 类指标,最后在系统层与平均意见分算斯皮尔曼等级相关。指标方向需事先明确:面积越大预期越自然,距离中极端对比越大预期越自然,离散则预期接近人类水平而非越小越好,但后部密集区过度离散预期变差。显著性阈值为 0.05,原文用加粗标出显著项。资源状态方面,本次没有收到可用代码、模型或数据的绑定证据,因此不得声称代码或数据已公开,只能按论文文字复现流程。

自然度升高时,元音空间和共振峰均值发生什么变化?

本节测的是分组层面的几何变化。比较条件是把音频按平均意见分划为 1 到 2、2 到 3、3 到 4、4 到 54 组,另设自然语音系统 A 为参照,指标在同组内聚合后比较。先看多边形面积随分组的变化,下面这组面板把压缩到扩张的过程可视化,读图时注意面积数与椭圆宽窄是两个独立信息。

看图路径: 1. 按从左到右顺序读出五个面板标题:四个平均意见分组加自然语音系统 A;2. 对比每个面板上方标注的多边形面积数值随分组升高的变化方向;3. 观察纵轴 F1 向下增大的画法下,开口元音/a/位置的上下移动;4. 重点比较后部元音/o/与/u/对应椭圆在低分组与高分组中的宽窄变化

原论文 Figure 2:Polygone vocalique en fonction de 4 groupes MOS (1-2, 2-3, 3-4, 4-5) et la voix Naturelle…

论文图 2。原论文 Figure 2:“Polygone vocalique en fonction de 4 groupes MOS (1-2, 2-3, 3-4, 4-5) et la voix Naturelle (Système A).”。

像素可见 5 个面板从左到右面积依次增大,低分组面板中后部椭圆互相重叠且横向铺展,/a/对应的红色椭圆位置偏高即 F1 偏小,高分组与自然语音面板中/a/下移即 F1 增大,多边形在纵轴方向被拉开。横轴 F2 为反向刻度,右侧为低 F2 的后部区域,/o/与/u/的椭圆在低分组更宽,高分组收窄。图下方图例按颜色区分 7 个元音,纵轴为 F1 赫兹,横轴为 F2 赫兹,这种纵轴向下增大的画法是语音学惯例,不能误读为数值向下变小。

下表把面积与平均高度变化整理成可核对的对照,比较问题是整体扩张是否主要来自 F1,公平条件是同语料同对齐同提取流程,指标方向是面积与平均 F1 越大越接近自然。

条件指标低分组 1 到 2高分组 4 到 5自然语音 A
相同语料与流程平均 F1426 Hz447 Hz471 Hz
相同语料与流程多边形面积143 317186 060209 776

表后解释需要同时给出收益与限制。收益是趋势支持 H1:平均 F1 从低分组到高分组再到自然语音单调升高,多边形面积同样从 143317 扩大到 186060 再到 209776,扩张主要沿 F1 轴,反映开闭对比恢复。代价与反例是 F2 整体趋势不明显,前元音变化小于 30 赫兹,后部/u/甚至出现向中心靠拢,说明面积的正相关不能细化到每个轴。原文还报告/a/升高约 37 赫兹、/E/升高约 34 赫兹,而离散方面多数元音无系统性差异,只有/o/的 F2 标准差从 259 赫兹降到 243 赫兹再到自然语音 200 赫兹,这是后文唯一显著的离散信号。

哪几个具体指标与听感排序最一致?

本节测的是系统层排序一致性。与谁比的问题转化为每个指标各自与平均意见分的斯皮尔曼相关,条件一致体现在所有指标来自同一套对齐与共振峰流程,指标方向是距离类正相关表示对比越大越自然,离散类负相关表示越稳定越自然。

下表直接选用原文相关表中的关键行,保持原矩阵数值与精度,不补列不改数,比较问题是局部对比是否比全局面积更能预测自然度。

/i/ F1-0.190.05
/u/ F20.390.05
/i-e/ F10.320.05
/a-O/ F10.450.05
/u-o/ F10.310.05
aire_polygone_vocalique0.420.05

表后解释要区分报告与推测。报告显示最强的显著相关来自 F1 上的元音间距离,/i-E/为 0.48,/a-i/为 0.47,/a-O/为 0.45,均在 0.05 水平显著,支持 H3 中高度对比关键的判断。多边形面积为 0.42 但不显著,说明全局扩张有贡献但弱于局部高度对比,部分支持 H1。离散整体偏弱,只有/o/在 F2 上为负 0.56 且在 0.01 水平显著,报告显示该后部元音在前后维度越不稳定,系统自然度越低。未胜出项包括/i/在 F1 上的负 0.19、/O/在 F2 上的负 0.20 等多项不显著相关,不能把它们当作有效诊断量。原文的有限解释是后部声学密集且/o/过宽时可能接近中央元音,感知为不自然,但这属于可能机制,待验证,不能写成因果结论。

最好与最差系统拆开看,退化是否落在同一位置?

如果把全局相关拆成个案对照,能否定位到具体对比,这相当于用极端系统做定性消融。测的是人类参考 A、最好系统 F 与最差系统 BT 三者的空间形状,条件是同语料同指标定义,指标方向与前文一致。下面这张对比图把 3 套空间叠在一起,读图前先确认图例身份,避免把颜色当成同一元音。

看图路径: 1. 先确认图例中三条线的身份:人类参考 A、最好系统 F 和最差系统 BT;2. 沿横轴 F2 观察后部区域三条多边形边的分离程度;3. 找到代表/a/的最低点,比较三个系统在纵轴 F1 上的高低差异

原论文 Figure 3:Polygone vocalique sur l’axe F1-F2 pour la référence humaine (A), pire (BT), et meilleur (F)…

论文图 3。原论文 Figure 3:“Polygone vocalique sur l’axe F1-F2 pour la référence humaine (A), pire (BT), et meilleur (F) systèmes. Les ellipses /o/ sont indiquées.”。

像素可见的 3 条多边形在/a/附近分叉最明显,人类参考的/a/最低即 F1 最大,最好系统略高,最差系统最高即 F1 最小,表现为高度对比被逐级压缩。后部区域最好与最差系统的边与人类参考出现错位,/o/椭圆在最差系统中横向拉长。需要克制的是当前收到的该图像素分辨率不足以精确读出全部坐标,数值仍以正文文字为准。

下表把个案中的关键数字按可部署的诊断量整理,比较问题是高度压缩与后部不稳定是否同时出现在最差系统。

条件指标人类参考 A最好系统 F最差系统 BT
同流程个案/i/与/a/在 F1 距离271.5 Hz250.4 Hz223.4 Hz
同流程个案/o/在 F2 范围599.5 Hz639.6 Hz850.9 Hz

表后解释给出具体代价。最好系统 F 基本复刻人类结构,但高度距离从 271.5 赫兹压缩到 250.4 赫兹,/o/范围从 599.5 赫兹放宽到 639.6 赫兹,提示前后维度轻微不稳定。最差系统 BT 高度距离进一步压到 223.4 赫兹,/o/范围放宽到 850.9 赫兹,两种退化叠加。反例意义在于该个案不能证明所有低分系统都同时有两种问题,也不能把事后选出的最好与最差当作可部署的改进收益,原文提出的针对性数据收集与微调只是展望,未经验证。

这些相关性能说明什么,不能说明什么?

论文直接报告的是相关性,不是因果。高度对比与平均意见分同向变化,支持压缩与自然度下降伴随出现,但不能推出拉大 F1 距离必然提高听感,因为自然度还取决于发音、韵律、节奏等多维因素。原文明确提到适度相关可能源于自然度的多维与主观性。

边界条件同样重要。数据限于法语朗读体、单女性说话人风格、20 套系统,/o/样本较少,统计稳定性弱于/a/与/e/。共振峰上限、能量阈值、四分位距系数都按固定经验设置,未做参数敏感性分析。F2 距离整体作用有限,与高度线索更显著的文献一致,但不能推广为所有语言都如此。

常见误解需要澄清。第一,面积不显著不等于面积无用,它仍能可视化压缩方向,只是排序能力弱于局部 F1 对比。第二,离散越小越好是误读,H2 预期是接近人类变异而非零变异,只有后部密集区的过度离散才显示为负向信号。第三,自监督嵌入距离相关可比不等于可替代,共振峰指标的价值在于可定位到具体元音对和具体轴,这是总体分数做不到的。未测量的误判率、延迟与计算成本不得声称得到改善。

要复现这套诊断,先做什么,需要哪些超参数?

复现起点是拿到同样的音频与文本划分。先用蒙特利尔强制对齐器加载法语声学模型与法语词典,输出每个目标元音的起止时间,只保留/i/、/e/、/E/、/a/、/O/、/o/、/u/。接着用 Parselmouth 的 Burg 方法按 5 毫秒步长、25 毫秒窗、最多 5 个共振峰估计,默认上限 5500 赫兹,/u/与/o/改用 4500 赫兹,剔除低于 20 分贝的弱能量帧。

然后按元音类别对 F1 与 F2 分别算四分位数与四分位距,上下界取四分位数加减 1.5 倍距,界外点剔除。再按系统聚合均值,用鞋带公式算三角形与多边形面积,按标准差算离散,按均值之差算分轴距离。最后在系统层对每个指标与系统平均意见分算斯皮尔曼相关,显著性取 0.05。核对点包括类别频数是否呈现/a/最多、/o/较少,平均 F1 是否随分组升高,/o/的 F2 离散是否随分组下降。

还需补的验证是跨说话人、跨风格与跨语言的重复,以及对齐误差与上限选择对后元音 F2 的影响分析。由于本次没有收到有效的代码与数据可用性证据,应按无公开实现来规划,只能依据论文文字重写流程,不假设权重可下载或一键可运行。

何时值得尝试这套方法,如何收束全文?

当合成系统听感总分上不去,又不知道是整体发音偏紧还是某个元音不稳时,这套方法值得尝试。做法是先看多边形面积与平均 F1 是否明显小于自然参考,再看/a-i/、/i-E/、/a-O/等 F1 距离是否被压缩,最后检查/o/在 F2 上的离散是否异常放宽。3 步分别对应整体、对比与稳定,能把调参方向从笼统的更自然收窄到具体的高度对比与后部稳定性。

收束时回到证据强度。强证据是 F1 高度对比与自然度排序显著相关,弱证据是全局面积正相关但不显著,更弱的是多数离散指标。唯一显著的离散是/o/的 F2,提示后部密集区值得优先检查。全文没有提供可部署的修复收益数字,数据针对性收集与对比微调仍是待验证的展望。合理的使用方式是把它当作主观评测的可解释补充,而非替代听感测试的自动总分。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 5 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 5 页

区域 2 · 查看论文原页

另有 7 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总