英文题目:Une approche bayésienne pour modéliser l’évolution diachronique de la voix comme marqueur du genre en France

会议身份:conference:jep:2026:conference-paper-id:devauchelle26_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#开源工具 #统计分析 #社会语音学 #语音 #语音属性识别

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Simon Devauchelle:机构信息未能从会议 PDF 纯文本可靠映射
  • Lucas Ondel Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • David Doukhan:机构信息未能从会议 PDF 纯文本可靠映射
  • Rémi Uro:机构信息未能从会议 PDF 纯文本可靠映射
  • Nicolas Denier:机构信息未能从会议 PDF 纯文本可靠映射
  • Albert Rilliard:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文输入为法国广电访谈中说话人平均基频及标注性别年龄与录制年代,输出为性别与年龄效应是否随年代变化的模型判断,难点在于生理老化、录音实践演变与性别展演相互混杂且历史样本极不均衡。方法链分三步:先从国家视听研究所档案提取每人平均基频并按性别与年代分组,输出分组样本进入下一步回归建模。接着对年龄施加零至二阶多项式回归并配置伽马正态共轭先验,得到各分组回归的后验分布并送入证据计算。最后以解析对数证据比较无分组性别分组与性别年代分组假设,并经柔性最大化转化为假设后验概率以选择模型。与既往仅报告均值升降的描述性比较不同,该机制以证据对复杂度惩罚直接回答何种分组值得保留,因而能区分真实演变与过拟合。原文未提供可核对的关键定量结果。该结论适用边界受限于名人主导的全国性视听访谈及所涉历史区间,尚未验证向日常口语或整个法国人口的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要检验的传言与本解读的输出承诺

本解读的输入是这篇法语论文的正文证据,不引入外部数据与评价。目标读者是刚进入语音与音频方向的研究生,目标是让你能复述它做了什么检验、控制了什么混杂、用什么标准选模型。必须保留的信息包括数据来源与规模、合成数据的 6 种设定、3 种分组假设与 3 种多项式次数的组合方式、证据比较的结论边界。输出是按学习依赖展开的连续讲解,先走完一个说话人样本从录音到基频均值再到模型预测的全程,再展开分组比较与反证。

论文要回答的社会语音问题很具体:法国女性声音是否随年代整体变低。背景是大众与部分文献转述澳大利亚青年女性基频下降约 1 点 83 半音的研究,并将其推广为普遍趋势,但原文指出另有未被引用的阴性结果,且法国媒体数据的既有研究结论不一致。更重要的是基频同时受生理年龄、录音实践、媒体中男女比例与年龄结构变化影响,直接比较不同年代的女性均值会把人口变老误读成声音变低。因此任务不是把声音丢给分类器输出男女,而是估计在控制年龄与性别后是否还需要年代参数。

平均基频 × 性别标记: 平均基频指一段语音中声带振动频率 fo 的平均值,是可测量的声学量;性别标记指听者用来推断说话人性别的社会感知线索。论文把平均基频当作性别标记的一个可量化成分来建模,分工是前者提供可比较的数字,后者提供社会解释框架,搭配理由是基频同时受生理和发声习惯影响,组合意义在于可以检验年代变化究竟是生理人口结构变化还是性别展演方式变化。

为避免误解,先固定术语。基频指声带振动频率 fo,论文用每人所有元音上中值再取人均值,并换算为以 1 赫兹为基准的半音数,单位是半音。年龄指录音时说话人的实际年龄,性别指档案中标注的女性与男性两类,年代指 7 个采样窗口。论文明确说明档案人物多为有维基页面的公众人物,包括演员、政治、经济、学术与体育界人士,场景主要是广播电视访谈,因此结论只限于该人群与该访谈情境,不能推广到法国全人口或日常对话风格。

相关路线为何不一致:读数、录音与人群的三处分歧

理解分歧要先看 3 条相关路线做了不同选择。第一条是澳大利亚青年女性跨时间比较,它用朗读语音并聚焦年轻人,控制较好但情境单一。第二条是法国媒体档案研究,它用自发访谈并覆盖更宽年龄与更长年代,代表性更好但录音设备、节目类型与说话人构成随时间变化更大。第 3 条是 lifespan 声学规范研究,它报告女性基频随年龄下降、男性随年龄上升的生理趋势,并提示 2 次等非线性形状更符合生命历程数据。

论文的立场是把这 3 条线索放在同一建模框架里检验。它不否认个别年代均值有起伏,也不否认录音实践可能带来偏移,它要问的是在同时考虑性别分组与年龄曲线后,再加入年代分组是否还能提高贝叶斯证据。如果不能,就说明年代起伏可以用更简单的性别加年龄解释,不必假设女性整体下移。这种思路与既有法国研究呼应:此前观察到的男女共同变化更像录音链变化,而非女性特有变化。

初学者常犯的错误是把相关当因果,把某两年女性均值下降直接读成社会变迁。论文提醒法国人口年龄结构本身在变老,媒体中女性占比与角色也在变,随机抽样的女性均值变低可能只是样本更老。控制年龄不是技术装饰,而是得出年代结论的前提。另一个误解是把感知音高完全等同于基频,论文承认共振峰与发声风格也会影响感知高度,但本研究只建模基频均值,因此只能回答基频部分,不能回答全部音高感知。

问题如何形式化:一个人样本走完全程

沿一个样本走一遍最清楚。取 1 位 1975 年窗口中 40 岁女性公众人物,输入是她在访谈中的全部元音段。系统先用自动转写与音素对齐得到每个元音的基频中值,单位为相对 1 赫兹的半音,然后在人内取平均,得到该人的一点观测值。表示就是这一个人均值加 3 个协变量:年龄 40、性别女、年代 1975。组件是按假设分组的回归:若假设是不区分,则所有人共享一条年龄曲线。

若假设是按性别区分,则男女各学一条;若假设是按性别加年代区分,则每个性别在每个年代各学一条。目标是计算每种分组加每种次数下数据的边缘似然,即证据。输出不是单个预测值,而是哪种分组最 plausibly 生成了观测集合,以及在该分组下各年代可比人群的预测均值。

举例只是教学例子,不代表真实参数。假设某女性组线性模型截距为 93 点 43 半音、斜率为负,则 40 岁预测低于 20 岁;若再允许年代分组,则 1975 年女性与 2015 年女性可以有不同截距。论文要比较的正是是否需要后者。关键约束是每人只贡献一个均值,而不是贡献全部 300 多 10000 个元音点,理由是全量建模会显著加重计算而对人均趋势增加有限。这个选择意味着个体内变异被压缩,模型主要解释人际变异。

形式化后,待检验的效应有两类。截距漂移指同一年龄的基频中心随年代整体上下移动,对应传言中的变低。斜率漂移指基频随年龄变化的快慢随年代改变,例如女性年龄斜率越来越负。论文用合成数据分别制造这两类漂移,以检验方法能否区分它们。

方法全景:三种假设乘以三种次数如何比较

方法全景可以概括为分组假设与曲线复杂度的交叉比较。分组假设有三档:不区分性别与年代、只区分性别、按性别与年代联合区分。曲线复杂度有三档:零次常数、1 次直线、2 次曲线。组合后名义上有 51 个回归单元需要估计,因为不区分对应少量回归,按性别区分对应男女两组,按性别加年代区分对应 2 乘 7 共 14 组,再乘以次数展开。每个单元都是带共轭先验的贝叶斯线性回归,证据有解析形式,可直接求对数证据并在分组内求和得到总分,再经柔性最大化换算为在候选集合中最 plausibly 的概率。

贝叶斯证据 × 多项式回归: 多项式回归负责描述基频随年龄变化的曲线形状,零次是常数、1 次是直线、2 次允许弯曲;贝叶斯证据负责给每个回归加分组假设打分,它在拟合好坏与模型复杂度之间权衡。两者搭配的原因是只看拟合会偏向最复杂的按性别加年代分组,而证据会对多余分组扣分,组合后才能在同一标尺上比较 3 类假设谁更 plausibly 解释数据。

操作顺序是先在合成数据上验证选择行为,再把同一套候选套到真实档案上。合成侧已知真相,可以观察当真相无效应时证据是否惩罚复杂分组,当真相只有性别年龄效应时是否选中按性别区分,当真相含截距年代漂移时是否选中按性别加年代区分。真实侧则看同样评分下哪个组合胜出,并进一步检查胜出组与次优组的差距是否足够大,以及次优的年代分组在线性与 2 次之间如何取舍。论文使用的计算平台是开放工具 PTAL,用 Julia 实现,强调解析证据避免数值近似,但本次证据未确认代码链接可达,因此本解读不声称代码已公开可运行。

需要固定的理解是证据不是准确率。它同时奖励拟合与惩罚参数量,复杂分组必须带来足够大的拟合提升才能胜出。这解释了为何在小样本年代单元中,即使均值有波动,证据仍可能拒绝年代分组。

组件与计算:回归输入、基函数与共轭先验的分工

组件细节按输入到输出展开。输入是人的年龄标量,基函数将其展开为 1、年龄、年龄平方等项,权重向量与之点乘得到均值预测,再加精度参数控制的高斯噪声。零次只学截距,1 次增加斜率,2 次增加曲率。论文测试 2 次的理由是文献报告成年后基频随年龄并非直线,2 次是最小的非线性扩展。输出是每组的权重后验与证据值。

年龄效应 × 时期效应: 年龄效应指同一个人随年龄增长声音的变化,已知女性基频随年龄下降、男性随年龄上升;时期效应指同一时代所有人因录音条件或社会习惯导致的整体偏移。论文把两者分开建模,分工是年龄用回归斜率和曲率承担,时期用按年代分组的截距和斜率承担,搭配理由是法国人口老龄化和男女媒体占比都在变,不分开就会把更老样本误读成女性声音变低。

先验采用高斯伽马共轭形式,超参数控制均值中心、协方差尺度与精度分布。正文没有报告具体超参数取值与敏感性分析,这是复现时的缺项,只能按原文说存在先验并用于丰富假设配置,不能推定其无影响。计算目标是数据的边缘似然,即对权重与精度积分后的概率,论文引用其可分解为后验期望似然与先验后验散度之间权衡的标准解释。实现上每个分组独立估计,总对数证据为各组之和,这意味着年代分组的证据优势必须在多个年代单元累积,不能靠单个异常年代驱动。

一个样本的完整路径因此是:年龄经基函数展开,与所属组权重相乘得到期望基频,高斯噪声解释残差,先验约束权重范围,证据汇总所有人的拟合与复杂度代价。性别与年代只通过决定样本归属哪个回归单元起作用,不作为连续数值直接进入回归式。

没有神经网络训练:合成构造与解析估计的真实计算

本研究没有训练神经网络,本节明确说明未训练的模型与实际执行的计算。未训练的是声学特征提取器之外的任何深度权重,也没有梯度下降、早停或冻结解冻策略。实际计算分为两类:合成数据的随机生成,以及各候选模型的解析贝叶斯估计与证据求和。

合成数据 × 模型校验: 合成数据是按文献参数人工生成的基频值,用来模拟无效应、只有年龄性别效应、只有截距随年代下降、只有斜率随年代变化等 6 种已知真相;模型校验是把候选模型套到这些已知真相上,看证据能否选对分组假设。分工是前者提供答案已知的考场,后者检验评分规则是否灵敏,搭配意义在于先证明方法能检出约 1 点 83 半音量级的下降,再去判断真实档案中是否存在同类下降。

合成构造按人生成协变量再生成基频。人数取 2100 以对齐真实规模,性别按二项分布以 0 点 5 比例抽取,年龄在 20 至 80 岁均匀抽取,年代在 7 个年份上均匀分配。每人基频从高斯分布抽取,均值由截距加斜率乘年龄决定,截距与斜率可按性别与年代设定,方差取 1 点 7 半音。6 种场景覆盖无效应、线性年龄性别效应、非线性年龄效应、截距随年代下降、斜率随年代变化、两者兼有。其中截距下降场景模拟每年负 0 点 037 半音,50 年累计约负 1 点 83 半音。

斜率变化场景让男女斜率每年按 0 点 5 百分比幅度反向演变;2 次场景固定 2 次系数为 5 点 6 乘 10 负 4 次方。

估计侧对每组数据计算解析后验与证据,不涉及采样近似。论文未报告先验超参数、数值稳定性处理与运行时间,因此不能承诺推理延迟或资源开销得到改善。复现时应把合成生成随机种子、均匀与二项抽样实现、半音换算基准固定下来,否则无法逐数重放。

实验条件:档案划分、采样口径与指标方向

实验条件分真实与合成两套,协议不同但评分标尺相同。真实档案来自法国国家视听所共享的历时语料,人物总数为 2 096 人,女性 892 人、男性 1 204 人,总语音 330 小时,其中女性 132 小时、男性 198 小时,元音经清洗后超过 3000000 个,但建模时每人只取一个均值。年龄覆盖 20 至 95 岁,年代为 1955 至 2015 每十年一个双年窗口,共 7 个窗口。人物分布受档案保存与媒体代表性限制,女性以及年轻与年老人群欠代表,各年龄性别年代单元人数不均衡。指标是各候选的对数证据,越大越好,并换算为在候选集合中的柔性最大化概率,概率越高表示在已测集合中相对越可信。

下表整理真实语料的可核对规模,比较问题是该语料能否支撑按性别加年代的细分估计,公平条件是同一人均口径与同一证据计算,指标方向是证据越大越可信。

数据来源总人数女性数男性数语音时长
其中女性部分2 096 人中的女性892 人不适用132 小时
年代覆盖7 个窗口1955-1956 起至 2015-2016 止330 小时总量

表后需要解释代价与边界。总量大但细分后每个性别年代年龄单元样本有限,证据会对 14 组回归的参数总量扣分,这是年代假设难胜出的结构性原因。欠代表意味着结论不能外推到法国全人口,只能解释为名人访谈人群在该场景下的表现。每人取均值降低了计算量,但也丢掉了人与情境内变异,若年代效应主要体现在语体或互动层面,该口径可能检不出。合成侧条件更均衡,性别比例 0.5、年龄均匀、年代均匀,因此合成中能检出的效应搬到非均衡真实数据时灵敏度会打折。

下表整理合成构造的控制条件,比较问题是生成真相是否覆盖截距漂移与斜率漂移两类待检效应,公平条件是同一基频分布基准与同一回归比较逻辑。

构造对象人数规模性别抽样年龄抽样年代抽样
合成人群2 100 人0.5 女性比例20 岁至 80 岁均匀7 个年份均匀
噪声设定2 100 人共用二项分布生成性别均匀分布生成年龄均匀分配年代
基频分布高斯分布截距单位半音斜率单位半音每年年代漂移另设
非线性设定2 次系数项两性共用系数5.6×10−4 量级无年代交互时为基线
离散度方差 1.7 半音文献朗读数据为基准年龄性别约束叠加6 种场景分别生成

合成与真实的基频基准都借用文献朗读数据,但真实为自发访谈,语体差异本身会带来偏移,因此合成验证的是选择逻辑而非绝对数值可比性。论文未报告超参数与硬件预算,这是复现缺项,也限制了对计算公平性与复现成本的判断。

主结果:证据支持谁,预测值如何波动

主结果按先合成后真实的顺序报告。合成侧行为符合预期:无效应场景选中不区分假设,且 1 次模型略优,说明证据惩罚了多余性别与年代分组。只有效应而无年代漂移的线性和非线性场景选中只按性别区分,1 次与 2 次概率接近,2 次没有因加入曲率而大胜,原文指出 2 次项设定较弱。含截距年代下降的两个场景选中按性别加年代区分,1 次或 2 次其一胜出。只含斜率年代变化而不含截距漂移的场景反而选中只按性别区分,说明仅斜率渐变在该样本量与噪声下不足以支撑 14 组回归的复杂度。这一组对照表明该方法对截距式下移更敏感,对纯斜率渐变更保守。

后验预测均值 × 可比人群: 后验预测均值是给定性别、年龄和年代后模型预测的基频中心值并附带不确定度;可比人群指固定为 20 岁女性以便与澳大利亚青年女性研究对齐的人群定义。分工是前者给出每个年代的数字,后者保证跨年代比较的是同一年龄性别切片,组合意义在于即使允许年代分组,7 个年代的预测值上下波动但无单调下降趋势,从而不支持变低的说法。

真实档案侧最 plausibly 的是只按性别区分的 2 次模型,线性居次,按性别加年代区分相对 improbably。若强行看年代分组,则其中线性优于 2 次,这与文献中年龄非线性的预期不太一致,论文将其作为年代假设的另一处不协调证据。换言之,允许年代分组后反而需要放弃曲率才能解释数据,而更符合生理文献的是保留曲率但不加年代分组。

为回答变低传言,论文在 improbably 的年代线性假设下仍算出 20 岁女性各年代预测均值,比较问题是同一年龄性别切片是否存在单调下降,公平条件是固定 20 岁女性并附带不确定度,指标方向是半音值越低表示声音越低。下表按年代顺序列出该切片的预测中心与区间宽度。

人群切片1955 年预测1975 年预测1995 年预测2015 年预测
20 岁女性均值90.1 半音89.8 半音91.7 半音91.3 半音
不确定度正负 1.2 半音正负 1.1 半音正负 0.8 半音正负 0.8 半音
中间年代对照91.5 半音92.5 半音92.3 半音波动无单调
中间年代不确定度正负 0.7 半音正负 0.7 半音正负 0.5 半音区间多有重叠
判断非单调波动不支持下移最高在中间年代不支持变低结论

表后解释必须同时给代价与反例。7 个值在 90 点 1 至 92 点 5 半音之间波动,最高出现在 1985 年附近而非最早年代,最低也非最晚年代,且相邻年代区间多有重叠,因此不支持整体下移。代价是该计算来自证据上已落败的假设,属于事后追问性质,不能当作独立证据使用。未胜出项是年代分组本身,它在真实数据上落败,意味着即使数字有起伏,模型选择仍认为不值得为其支付复杂度。边界是只检查了 20 岁女性切片,若年代效应集中在其他年龄或语体中,该切片检验会漏检。

消融与反证:拿掉性别、年代与曲率会发生什么

把本节当作假设消融来读。不区分性别与年代的假设在合成无效应时胜出,但在任何含性别效应的合成真相中都被大幅降级,在真实数据上同样落败,说明性别分组不可省。只按性别区分在真实数据上胜出,表明年龄曲线加性别截距与斜率已能解释主要变异。按性别加年代区分在截距漂移合成中胜出,证明当真相确有下移时方法有能力选中它,因此真实数据上未选中更可能是效应不存在或太小,而非方法天然检不出。但纯斜率漂移合成中该复杂假设落败,说明方法对斜率渐变的检出边界更高,不能把未选中解读为斜率绝对不变。

曲率消融同样重要。真实数据上只按性别区分时 2 次优于 1 次,符合年龄非线性文献;但在年代分组下线性优于 2 次,说明年代参数与曲率存在替代关系,增加 14 组截距斜率后已能吸收原本需要曲率解释的弯曲。这不是证明曲率无用,而是提示过度分组会扭曲对年龄机制的表达。合成非线性场景中 2 次未明显胜出,则提醒当 2 次系数很小时证据不会为微弱弯曲付费。

未评测边界包括先验敏感性、其他基函数形式、个体内变异建模、录音链与节目类型的显式协变量。论文明确说可测试其他配置与先验,因此当前排序只在已测 9 个组合内成立。把搜索最优当作全局最优是常见误读,应表述为在已测集合中最 plausibly,而非所有可能模型中最优。

限制:人群、场景与测量口径的三重边界

限制先看人群。档案人物多为公众人物,需能查到出生日期才能定年龄,这本身就是选择机制,普通劳动者、移民口音群体与非名人缺席,年龄性别单元欠代表。结论因此只能表述为在该媒体名人访谈人群中未发现女性基频整体下移,不能表述为法国女性整体未变。场景边界同样关键,研究限定为访谈类视听节目,未覆盖议会辩论、日常对话、朗读或表演性语体,而性别展演恰恰高度依赖情境,换场景可能有不同结果。

测量口径边界是只用基频人均值。感知音高还受共振峰、嗓音质量与语速影响,论文引用的发声位置与声道长度机制提示男女会用共振策略夸大性别差异,但本模型未纳入共振特征。若社会变化主要体现在共振或语体选择而非基频均值,本检验会给出阴性结果,这不等于性别标记整体未变。数据处理依赖自动转写与对齐,误差与清洗规则会影响元音级中值,但论文未量化该链路的不确定度向人均值的传递。

方法边界是证据比较依赖候选集合与先验。未报告先验超参数使复现者无法判断排序对先验的稳健性,未纳入录音设备与节目类型协变量使年代分组可能混入技术变迁。若未来补上设备与节目标签,年代分组的证据可能进一步下降或出现结构性偏移,这是待验证而非已证实的推测。

复现先做什么:数据、口径与候选集合的固定清单

复现第一步是固定数据口径。获取同一视听档案的人均基频表,确认 2096 人中女性 892 人与男性 1204 人的划分、7 个双年窗口的归属、年龄以录音时实际年龄为准、每人取全部元音中值的均值并换算为以 1 赫兹为基准的半音。若用全部元音点而非人均值,结果不可比,应先复现人均口径。检查各单元人数不均衡是否与原文一致,女性与老少单元稀疏是预期现象,不应通过过采样抹平,因为证据对样本量的惩罚与奖励依赖原始构成。

第二步是复现合成考场。按 2100 人、女性比例 0 点 5、年龄 20 至 80 均匀、年代七值均匀生成协变量,高斯噪声方差取 1 点 7 半音,分别实现无效应、线性、2 次、截距漂移、斜率漂移、两者兼有 6 种真相,其中截距漂移按每年负 0 点 037 半音实现,斜率漂移按每年 0 点 5 百分比幅度实现,2 次系数固定为 5 点 6 乘 10 负 4 次方。固定随机种子并记录生成代码版本,否则选择概率无法逐数比对。

第三步是复现候选集合与评分。实现三档分组乘三档次数的回归,对每组计算解析对数证据并求和,再做柔性最大化得到相对概率。必须保留的超参数是先验的均值、尺度与伽马参数,原文未给出具体值,这是当前最大缺项,复现时应做先验敏感性扫描并报告排序是否翻转。资源状态方面,本次未发现可验证的公开资源绑定,因此不得声称代码模型数据已公开,应以论文描述与自备实现为准,并明确标注 PTAL 链接本次未能确认可达。

收束:何时值得用这套贝叶斯比较,如何一句话复述

何时值得尝试这套方法取决于问题类型。当待检效应可能被人口结构与技术变迁淹没,且需要回答是否值得增加分组时,证据比较比只看拟合更合适。它的优点是把是否分年代转化为可计算的复杂度代价,缺点是对小而渐进的斜率变化不敏感,且结论只在候选集合内成立。若你的数据单元更均衡或效应更大,年代分组仍可能胜出,不应把本次阴性结果当作通用定律。

一句话复述可用于组会:论文用性别与年代分组的多项式贝叶斯回归检验法国媒体访谈中女性基频是否随年代下移,合成验证显示它能检出截距式下移,真实数据证据支持只按性别区分的 2 次模型而不支持再分年代,20 岁女性预测值在 7 个年代上下波动而无单调下降。复述时必须带上边界,即人群为名人访谈、指标仅为基频人均值、年代分组在已测集合中落败。

还需补的验证包括先验稳健性、录音链协变量、共振特征扩展与其他年龄切片。若补上这些后年代分组依然落败,对无整体下移的判断会更稳;若某个子人群或共振维度出现年代趋势,则应修正为基频无趋势但性别标记其他维度可能有变的分维度结论。学习上建议把证据公式的拟合奖励与复杂度惩罚拆开理解,先在合成小数据上亲手算一遍分组求和,再去读真实档案的排序,这样不会把概率最高误读为效应量最大。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 4 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 6 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 6 页

区域 3 · 查看论文原页

另有 15 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总