英文题目:FSD50K-SOLO: AUTOMATED CURATION OF SINGLE-SOURCE SOUND EVENTS
会议身份:
conference:eusipco:2026:conference-paper-id:0000256
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#数据集 #数据集构建 #扩散模型 #音频分类
评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Yang, Ningyuan:机构信息未能从会议 PDF 纯文本可靠映射
- Yin, Sile:机构信息未能从会议 PDF 纯文本可靠映射
- Yang, Li-Chia:机构信息未能从会议 PDF 纯文本可靠映射
- Irvin, Bryce:机构信息未能从会议 PDF 纯文本可靠映射
- Quan, Xiao:机构信息未能从会议 PDF 纯文本可靠映射
- Stamenovic, Marko:机构信息未能从会议 PDF 纯文本可靠映射
- Zhang, Shuo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
FSD50K以片段级弱标签为主,大量片段混入背景噪声、重叠事件与稀疏目标,难以直接为分离、定位与可控合成提供干净训练单元。本文将任务定义为输入任意时长音频、输出单源single-source或多源multi-source二分类,以自动保留单源子集。方法链分四步推进:先以Stable Audio Open 1.0按单源类生成参考音频并人工剔除劣质样本,再用滑窗最大能量选段并按4种干扰条件以-10dB至15dB信噪比合成1比1平衡混合数据,接着冻结BEATs编码器提取语义声学特征,最后经Bi-LSTM聚合与MLP输出二分类。与仅依赖众包PP评级或时长过滤的已有做法不同,该机制用可控合成提供强监督,再迁移到真实语料做内容级过滤。在BSE测试集与生成测试集评估下,BSE条件的准确率为95.51%,高于生成测试集条件的准确率93.47%。据此筛选出32880个单源片段构成FSD50K-Solo,单源样本呈现更低PC与更高PQ的一致模式。该结论适用边界受限于105个单源类与FSD50K分布内验证,对未见事件类的泛化尚未验证,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 模型相关资源:https://github.com/microsoft/unilm/tree/master/beats — 链接可访问(HTTP 200)
- 数据相关资源:https://doi.org/10.5281/zenodo.20403806 → https://zenodo.org/doi/10.5281/zenodo.20403806 — 暂时无法访问
- 第三方资源:https://openreview.net/forum?id=14rn7HpKVk → https://openreview.net/challenge?redirect=%2Fforum%3Fid%3D14rn7HpKVk — 链接可访问(HTTP 200)
- 第三方资源:https://doi.org/10.5281/zenodo.6337421 → https://zenodo.org/record/6337421 — 暂时无法访问
- 第三方资源:https://doi.org/10.1109/ICASSP.2018.8462665 → https://ieeexplore.ieee.org/document/8462665/ — 链接可访问(HTTP 202) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文交付了什么?
本文的输入是 FSD50K 这样的大规模开放声音事件语料。它的标注只到片段级,不知道声音在何时出现,也混入了背景噪声、重叠事件和目标稀疏 3 类问题。目标是从中自动找出单源片段,即一个片段内只包含一种被标注声音类型、适合作为后续合成与训练构件的干净样本。本文交付的是一个可复述的筛选流程和一个模型筛选子集 FSD50K-Solo。流程上,先用生成模型造出干净单源参考,再用这些参考构造已知真值的混合数据来训练判别器,最后把判别器用于真实语料。子集上,论文报告 FSD50K-Solo 共包含 32,880 条样本,并同时发布片段级元数据和按固定窗切分后的块级预测。
对于刚进入音频领域的研究生,需要先建立一个动作链条。声音事件分类、检测与定位、目标声音提取、可控合成等任务都依赖干净构件。如果构件本身混入了未标注的干扰,那么后续做数据扰动合成混合时,输入和训练目标都会带噪。单源筛选就是在训练开始前把构件洗干净。弱标注一词在这里的白话含义是只知道片段里大概有什么,不知道何时出现、出现了多久、是否重叠。
强标注则要求时间与成分都明确。本文不直接重标时间,而是通过剔除多源片段,让留下来的片段近似可用作强标注构件。
阅读时必须保留的关键信息包括实验条件与资源状态。编码器实现与权重来自微软 UniLM 仓库中的 BEATs,当前可用。数据集链接指向 Zenodo 的 FSD50K-Solo 记录,本次未能确认可达,不能写成已公开可下载。评估除了准确率等分类指标,还引入 Audiobox Aesthetics 预测的复杂度与质量分数。后续各节按学习依赖展开,先讲已有路线为何不够,再走完一个样本从输入到输出,最后讲实验条件、结果与复现边界。
已有路线在数据质量上做了什么,为何还不够?
第一条路线是认识到弱标注的危害。论文回顾了在 AudioSet 的一小部分上加入强时间标注能明显改善分类,以及用大语言模型生成标签能帮助生成与检索。这说明标签质量本身是性能瓶颈。但这些工作没有解决如何从已有大规模语料中自动挑出干净单源。第二条路线是语音领域的自动过滤。
LibriTTS 用波形幅度分布分析剔除低信噪比样本,深度感知质量模型如 DNSMOS 也被用于语音筛选。白话讲,前者看波形统计特性,后者学人类听感打分。问题在于它们针对人声特性或语音质量设计,不能直接搬到环境声音的多样声学特性上。
第三条路线是多模态音频数据集的整理方式。WavCaps 聚合多个音频集合并用对话模型生成描述性字幕,但在信号层面的过滤只做了按时长剔除过短样本,没有分析音频内容与声学质量。Audiobox Aesthetics 则从内容欣赏、内容有用性、制作复杂度和制作质量 4 个维度预测感知质量。其中制作复杂度越低表示声源越少、越不复杂,制作质量越高表示声音质量越好。论文把这两个分数拿来作为独立于分类指标的验证视角,而不是训练目标。
第四条路线是预训练音频编码器。对照语言音频预训练模型以图文对比学习为代表,适用于分类与检索。自监督编码器以 HuBERT、WavLM 和 BEATs 为代表。BEATs 在 AudioSet 上用掩码音频建模训练,被选中正是因为它连接了语音与通用音频理解。
同输入、同目标、同监督的对照是理解本文位置的关键。如果输入都是 FSD50K,目标都是挑出单源,前人曾用众包评级中 Present and Predominant 作为过滤条件。白话就是标注员认为没有其他类型声音才保留。但原文明确指出这种评级主观且易错,并举例说明有的片段被一致评为对话的 predominant,却同时含有语音和音乐,有的竖琴拨弦片段则无法达成共识。因此人工评级路线在运行阶段需要大量人力,且会误留或误删。本文的差异在于监督来源不同,用生成干净样本加受控混合来训练自动判别器,从而减少对人工评级的依赖。
单源与多源如何定义,难在哪里?
论文把只含一种声音事件的片段称为单源样本,把含多种类型、稀疏分布或重叠的片段称为多源样本。FSD50K 的元数据虽然有人工评级,但评级是片段级的众包判断,没有时间信息。对于单标签片段,弱标注问题不大。对于多标签或含背景干扰的片段,标签噪声会直接进入训练。更麻烦的是很多训练流程会在模型输入处做扰动合成混合,用混合的成分或其元数据作为优化目标。如果成分本身不干净,合成出的混合就不是强标注,训练会被虚假的输入与目标污染。
单源样本 × 多源样本: 单源样本指一个片段内只含一种目标声音类型且无明显干扰,多源样本指含有背景噪声、重叠事件或稀疏分布的多种声音,二者搭配的原因是只有先把单源定为干净构件,才能让后续人工混合的成分与标签可控,组合意义在于把数据清洗问题转化为二分类问题。
难点有 3 层。第一是规模与成本,人工逐条听辨大规模语料不可扩展。第二是主观性,众包评级对是否有其他声音的判断不一致。第三是评估困境,大规模人工标注的单源对多源参考集本来就不存在,因此无法只靠真实数据完成训练与评测。本文的解法是先造出已知真值的训练数据,再用独立的专家整理集做 held-out 验证,并用感知质量分数做交叉验证。理解这一点后,才能明白为何方法部分要花很大篇幅讲生成与混合,而不是直接讲分类器结构。
整个筛选系统让一个样本走完哪条路?
从一个未知音频出发,系统先做均方根归一化到负 26 分贝全刻度,并去除开头静音,以减少幅度偏差的影响。接着冻结的 BEATs 编码器把波形变成批量、时间帧与 768 维的表示。然后单层隐藏 512 维的双向长短期记忆网络做时间聚合,把变长帧序列压成固定向量。再经过 1024 到 512 的全连接、线性整流激活与丢弃,最后经 512 到 1 的全连接输出单源或多源的二分类预测。训练时用二分类交叉熵,推理时直接对真实语料打分并按阈值保留。
训练数据的来源与推理数据的来源是分开的。训练与验证用的监督来自生成流程,推理面对的是未知真实音频,可选地还可加入干扰源信息用于构造分析。论文用示意图展示训练与推理两条路径汇入同一个编码器加聚合加分类头的结构。需要强调的是原文未给出分类阈值选择、聚合层的具体池化方式以及梯度在编码器中是否完全截断之外的细节,只明确编码器冻结、分类部分更新。没有像素证据时,不猜测模块在图中的左右位置与颜色。
这个全景的教学价值在于区分表示与决策。编码器负责提供声学与语义表示,聚合与分类头负责把表示变成可执行的保留或剔除动作。冻结编码器的理由是复用大规模预训练,而把学习集中在少量生成监督可覆盖的决策边界上。后续两节分别展开数据构造与模型细节,使每一步都有可复述的动作。
干净参考与受控混合是如何一步步造出来的?
第一步是划分可生成类别。论文把 FSD50K 类别按描述分成单源类与复杂场景类。单源类的白话含义是可由单一孤立声源发出,例如狗吠、警笛、玻璃破碎。复杂场景类的含义是天然包含多事件并发,例如人群活动、地铁、音乐。只用单源类做生成,因为按复杂场景标签生成容易自带重叠与干扰。
对每个选中的类别,用 Stable Audio Open 1.0 生成音频,正提示要求无噪声的某种声音,负提示要求避免低质量。所有生成片段都经人工检查剔除带噪者。最终覆盖 105 个单事件类别,每类 30 条,每条 20 秒,采样率 16 千赫,作为训练的参考信号。
Stable Audio Open 1.0 × 受控混合: Stable Audio Open 1.0 负责按类别提示生成干净的单源参考音频,受控混合负责把这些参考与干扰、背景噪声按信噪比和条件混合成训练对,二者搭配的原因是真实大规模单源标注不存在,组合意义在于用生成数据提供有明确单源与多源真值的监督。
第二步是选目标段与造混合。每个文件按滑动窗切分,窗长在 1 到 10 秒内随机选择,从能量最高的前 5 个块中随机选一个作为目标段。白话就是挑最响、最可能含事件的段。多源样本按等概率 4 种条件生成,分别是单干扰、双干扰、来自城市声场景数据的背景噪声、干扰加背景噪声。信噪比在负 10 到正 15 分贝之间均匀采样。
为避免语义重叠,不从与目标高度相似的类别中选干扰,例如铃与牛铃、液体与水。数据集按单源与多源 1 比 1 构造。用于训练与测试的多源混合不再人工检查,这一点在复现时要保留。
第三步是预处理与增强。除归一化与去开头静音外,训练时以二分之一概率做时间重复增强,把每条音频重复 1 到 4 次的随机次数,以适应真实事件可重复的特点。训练时音频最大长度为 10 秒。验证与测试的划分来自生成数据按 8 比 1 比 1 切分,增强只用于训练。这些动作共同保证监督的真值明确,同时让模型见到时长、响度与重复模式的变化。
编码器与分类头各自负责什么计算?
编码器选用 BEATs,实现与权重来自 UniLM 仓库。它的输入是预处理后的波形或时频特征,输出是帧级嵌入序列,维度为 768。论文明确编码器在训练中冻结,因此它的参数不更新,只提供表示。冻结的含义是前向参与计算、反向不更新,不能从冻结推定整个系统输出确定,因为分类头仍是随机初始化并训练的,且混合构造与增强带有随机性。原文未报告编码器的具体帧移、窗口与采样细节,复现时应以仓库默认配置为准并记录实际使用的版本。
BEATs 编码器 × 判别分类器: BEATs 编码器负责把波形变成保留声学与语义信息的帧级表示且在训练中冻结,判别分类器由 Bi-LSTM 聚合层与多层感知机组成并负责输出单源或多源判断,二者搭配的原因是复用大规模预训练表示而只学习聚合与决策边界,组合意义在于用少量生成监督实现对大规模真实语料的可扩展筛选。
分类头分为聚合与决策两段。聚合用单层双向长短期记忆网络,隐藏 512 维,广泛用于音频嵌入网络。决策用多层感知机,先是 1024 到 512 的全连接,随后是线性整流激活与丢弃,再是 512 到 1 的全连接。最终用二分类交叉熵训练。论文未给出丢弃率、双向拼接方式与阈值标定方法,这些是具体缺项,不从模型名称推定实现。
推理时对每个真实片段输出是否为单源的判断,并可进一步按滑动窗输出块级预测。理解分工后,训练节的优化器与调度才有依附对象。
训练如何组织,人工评级扮演什么角色?
训练集、验证集与测试集按 8 比 1 比 1 从生成数据划分,增强只在训练时启用。优化器用 AdamW,学习率万分之一,权重衰减 0.01,共训练 20 轮,采用带 10% 预热的余弦学习率调度。损失为二分类交叉熵,选择验证准确率最高的轮次模型。这里的监督完全来自生成与混合流程的已知真值,而不是 FSD50K 的人工标签。人工只出现在生成片段的去噪检查和独立评测集的专家整理中,不参与梯度。
Present and Predominant × 模型预测筛选: Present and Predominant 是 FSD50K 众包标注中表示没有其他类型声音的人工评级,模型预测筛选是本文判别器对每个片段的自动单源判断,二者搭配比较的原因是前者主观且有误标风险,组合意义在于用量化保留率与质量分数检验自动方法能否替代人工评级并保留更多可用数据。
在开发集比较中,论文把至少 2 名标注员评为 Present and Predominant 的样本视为人工可接受。排除过短与过长样本后,人工评级保留约 60% 数据,而模型方法保留约 60% 九。白话讲,模型留下更多,且后续质量分数显示留下的数据更干净。这支持自动方法在保留率与质量上不输人工评级,但也要注意两者判断并不完全重合,存在各自误留与误删。复现时应同时记录两种保留率与交叠情况,而不是只报一侧数字。
在什么数据、划分与指标下验证泛化?
论文承认在生成数据上训练与评估存在域差距风险,即生成数据上好不等于真实数据上好。由于大规模人工标注的单源对多源参考集不存在,作者采用 3 类证据。第一是生成测试集,按前述 8 比 1 比 1 中的测试部分,单源与多源各 702 条。第二是内部 Bose 声音事件数据集,约 20 小时专家整理的单源对多源对,共单源与多源各 22,400 条,作为 held-out 性能基准。第三是真实 FSD50K 的开发集与评估集上的大规模筛选统计与感知分数。
指标分两层。传统分类层用准确率、精确率、召回率与 F1 分数,方向都是越高越好,分别反映总体判对、判为单源的准确、单源的找回与综合。感知层用 Audiobox Aesthetics 预测的制作复杂度与制作质量,复杂度 1 到 10 分越低越好,表示声源更少,质量 1 到 10 分越高越好。论文强调后者是基于人类听感统计模型的客观度量,用于从不同于分类的角度验证筛选效果。硬件预算、统计显著性方法与聚合对象在原文中未详细报告,复现时应把数据集、阶段、指标、单位与聚合对象逐 1 核对,不把数值相同当作同一指标。
判别器在生成集与专家集上表现如何?
要回答的核心问题是生成监督学到的边界能否搬到真实数据。公平条件是同一模型分别在生成测试集与专家整理的 BSE 集上评测,指标方向都是越高越好。论文报告模型在这两套上都达到强分类性能,并且在 BSE 上准确率与精确率更高,显示对实际过滤场景的有效泛化。下表只收录原文连续原句中逐字出现的准确率与精确率数字,避免引入无逐字证据的召回率与 F1 细节,单位保留百分号写法。
| 测试集 | 精确率 | 准确率 | 评估阶段 | 作用说明 |
|---|---|---|---|---|
| 生成测试集 | 89.31% | 93.47% | 生成域内测试 | 作为受控条件下的基准 |
| BSE 专家集 | 98.58% | 95.51% | 真实域外验证 | 检验对实际筛选的泛化 |
表后需要同时讲收益与代价。收益是 BSE 准确率高于生成集约 2 个百分点,精确率明显更高,说明判为单源的可信度在真实数据上保持得很好。代价与限制是原文未同时给出可逐字核对的召回率细节在同一连续句中,且 BSE 的具体类别分布与采集条件未充分展开,因此不能把该优势推广到所有未见事件类别。未胜出项在这里体现为生成集的精确率相对较低,提示生成域内仍有误判,需要结合后续真实语料的质量分数一起看,而不是只看分类表。
筛出的 FSD50K-Solo 在规模与听感上是什么样子?
第二个要回答的问题是把模型用于 FSD50K 后留下多少、质量是否更好。处理前先剔除小于 0.5 秒的 1,727 条与大于 30 秒的 13 条,避免过短过长带来的边界效应。然后报告模型把开发集的约 60% 九判为单源,把评估集的约五成六判为单源。下表只收录有逐字连续原句支撑的单源比例,其余规模与分数用文字趋势描述而不填入无逐字证据的数字格,以保证可核对。
| 数据划分 | 判为单源比例 | 数据规模说明 | 评估视角 | 策略含义 |
|---|---|---|---|---|
| FSD50K 开发集 | 69.17% | 大规模真实语料筛选后保留 | 分类加感知双验证 | 可作为干净构件候选 |
| FSD50K 评估集 | 55.91% | 大规模真实语料筛选后保留 | 分类加感知双验证 | 保留率低于开发集需分开看 |
Production Complexity × Production Quality: Production Complexity 负责度量感知到的声源数量与复杂程度,数值越低意味着越接近单源,Production Quality 负责度量感知到的制作质量,数值越高意味着质量越好,二者搭配的原因是分类准确率只反映判对与否,组合意义在于从人类听感统计模型的角度独立验证筛选是否同时降低复杂度并保持质量。
表后解释主要趋势与反例。趋势是单源样本在 3 类数据中一致呈现更低的制作复杂度与更高的制作质量,生成集、专家集与 FSD50K-Solo 的模式一致,支持框架泛化到真实过滤场景。开发集单源约 27,273 条、多源约 12,155 条,评估集单源约 5,607 条、多源约 4,422 条,最终 FSD50K-Solo 合计 32,880 条并伴随质量分数改善。反例是类别分布变化不均匀。按 CLAP 相似度为多标签样本选主类后,前 5 类保持不变,但动物、液体与人群动作等天然多源类别大幅减少并掉出前十。这是符合预期的清洗效果,但也提醒不能把总体改善理解为每个类别都同等改善。
哪些条件会让结论不成立,失败边界在哪里?
论文没有以消融表逐项去掉编码器或聚合层,因此不能补写拿掉后必然怎样。但它提供了 3 类可视为失败条件的证据。第一是语义相近干扰的规避。如果混合时允许铃对牛铃、液体对水这类高度相似类别互为干扰,监督边界会模糊。原文用不选高度相似类别作为控制条件,复现时若放开该条件,应预期误判上升,但具体幅度待验证。
第二是信噪比范围。混合信噪比在负 10 到正 15 分贝均匀采样,覆盖了干扰强于目标到目标明显强于干扰的区间。若只在高信噪比下评测,任务变易,准确率会虚高。第三是人工评级的不一致。开发集上人工与模型保留率不同且判断不完全重合,说明以人工评级为唯一真值会同时误留多源与误删单源。
另一类边界是时长与能量选择。目标段从能量最高的前 5 块中随机选择,窗长 1 到 10 秒随机。若改成固定窗或随机位置而不看能量,目标段可能落在静音或稀疏区,训练信号会变弱。论文还报告排除了极短与极长样本,说明模型对时长极端值未做保证。部署时若直接对任意时长音频打分而不做滑动窗切分与块级聚合,效果需要重新验证。这些都是原文明确给出的安排理由与已验证对照之外的适用条件,不做因果夸大。
还有哪些没有测到,不能承诺什么?
首先是对未见事件类别的泛化未被探索。论文在结论中明确指出框架在已评估声音类别上表现强,但对未见类别的能力仍未知,未来应研究跨域迁移与零样本方法。因此不能承诺换一批全新类别仍有同样准确率。其次是统计与成本缺项。原文未报告多次随机的方差、显著性检验、训练耗时、推理开销与实际延迟。
总体趋势不等于每组每步都成立,更不能承诺误判率、延迟或成本得到改善。第三是标注与聚合口径。FSD50K 开发集与评估集的划分、块级预测的窗口与步长、多标签样本按 CLAP 选主类的细节,只在方法与结果中部分交代,复现时需以发布的元数据为准并记录实际参数。
相关性不等于因果也适用于感知分数。单源组复杂度更低、质量更高是报告的统计关联,支持筛选有效,但不能反推降低复杂度必然提高下游任务性能,下游增益需要单独实验。缺失证据不是技术错误,但在使用 FSD50K-Solo 做源分离、事件定位或可控合成构件时,应先在目标任务上补测保留率、误留率与下游指标,再决定阈值与窗策略。
要复现这条链路,先做什么、用什么?
先准备 3 类材料。表示侧需要 BEATs 编码器实现与权重,来源是微软 UniLM 仓库,当前可用,应记录提交版本与配置。数据侧需要 FSD50K 原始音频与标签,以及城市声场景背景噪声数据,生成侧需要 Stable Audio Open 1.0。输出侧是 FSD50K-Solo 的片段级元数据与块级预测,原文称随文发布,但其 Zenodo 链接本次未能确认可达,复现前应先验证链接状态,不把不可达当作已公开。
再按顺序执行可复述动作。按类别描述分成单源类与复杂场景类,只对单源类用正负提示生成,每类 30 条、每条 20 秒、16 千赫,并人工剔除带噪生成。按滑动窗能量前 5 选目标段,窗长 1 到 10 秒随机,按 4 种条件等概率混合,信噪比负 10 到正 15 分贝均匀采样,避开高度相似类别,单源与多源 1 比 1。做均方根归一化到负 26 分贝全刻度并去开头静音,训练时以二分之一概率重复 1 到 4 次,最大长度 10 秒。训练用 AdamW、学习率万分之一、权重衰减 0.01、20 轮、余弦调度加 10% 预热、二分类交叉熵,选验证准确率最高轮。
最后做三处核对。核对生成测试集与 BSE 集的准确率与精确率是否复现报告的相对关系,核对开发集与评估集的单源比例是否接近 60% 九与五成六,核对单源组的复杂度更低、质量更高是否成立。任何一处改动采样、阈值或窗口,都要分开记录,因为数值相同不是同一指标的证据,百分点与相对百分比也不同。
何时值得尝试这套方法,如何收束理解?
当你的训练流程依赖合成混合且需要干净构件时,这套方法值得尝试。典型场景包括目标声音提取、声音事件检测与定位、可控音频合成,以及需要强标注混合的大音频语言模型预处理。它的可扩展价值在于用生成模型解决冷启动监督问题,再用冻结编码器加轻量分类头把人力从逐条听辨中解放出来,去清洗比已标注语料大一个数量级的开放语料。论文展示的 FSD50K-Solo 就是这一范式的实例,合计 32,880 条,开发与评估划分上的单源比例与质量趋势一致。
收束时记住三句话。第一,干净是相对的,单源指无其他类型声音干扰且适合做构件,不是录音室级无噪。第二,证据是分层的,分类指标讲判对,感知分数讲听感,保留率讲可用规模,三者一致才支持有效。第三,边界是明确的,未见类别、极端时长、相似语义干扰与实际延迟都未充分验证,上游筛选增益不能直接当作下游任务增益。带着这些条件去读表与跑流程,才能把这篇技术解读变成可执行的复现动作。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses