英文题目:Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion

会议身份:conference:dafx:2026:conference-paper-id:DAFx26_paper_42

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #迁移学习 #音乐 #语音 #语音转换

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Ben Maman:机构信息未能从会议 PDF 纯文本可靠映射
  • Frank Zalkow:机构信息未能从会议 PDF 纯文本可靠映射
  • Hans-Ulrich Berendes:机构信息未能从会议 PDF 纯文本可靠映射
  • Paolo Sani:机构信息未能从会议 PDF 纯文本可靠映射
  • Christian Dittmar:机构信息未能从会议 PDF 纯文本可靠映射
  • Meinard Müller:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音与歌唱转换需在保留音素内容与基频旋律的同时替换说话人或歌手身份并处理带伴奏混合信号,难点是语音与歌唱标注稀缺且难以统一建模人声与乐器。该工作先用现成wav2vec2变体提取音素后验概率并结合人声分离得到基频轮廓,再用TRILL提取表演者嵌入并用多乐器Onsets and Frames扩展估计钢琴卷帘,从而构成大规模伪标注。接着条件编码器将音素后验概率、基频与钢琴卷帘沿通道拼接融合为时变条件,并以音频嵌入经特征线性调制注入全局表演者与声学条件。最后频谱解码器对含噪梅尔谱做扩散去噪并经通用BigVGAN声码器合成波形,条件缺失训练还支持仅由部分条件自由生成。与专用语音转换流水线相比,关键差异是将乐器合成中的乐谱与版本声学条件转义为语音的语言与身份条件,并在编码器与解码器同时施加条件以增强表演者相似性。在语音音高保持评测下,T5-Voc的RPA准确率为83.0,高于PAD-Voc的RPA准确率78.2。联合引入乐器与混合数据后人声质量下降且音素保真度弱于专用模型,带伴奏歌唱仅做了初步声学转换实验,因而跨域统一建模的适用边界受限。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文输入是一段源人声与一段目标演唱者或说话人的参考音频,目标是生成保留源语言内容与旋律起伏、但听感像目标人唱出或说出的新音频。论文同时覆盖语音转换与歌声转换,不把两者做成两个独立系统。学习时要抓住 3 类信息如何分工:说什么由音素后验图承担,唱多高或语调如何由基频轮廓承担,像谁由演唱者嵌入承担。输出是梅尔频谱经声码器变成的波形。

读完应能复述:时变条件如何拼接融合,全局条件如何调制每一层,训练时条件丢弃如何工作,推理时音高区间如何平移,以及评价从自然度、演唱者相似度、音高保持、音素保持 4 个方面如何组织。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,论文中提到的项目页只能按原文转述为定性样例位置,不作为可用性判断。

语音、歌声与器乐合成此前各走哪条路?

语音转换的目标是把源语音变成目标说话人的音色,常用生成对抗网络、扩散模型与流匹配模型,近年做法是用现成特征提取器得到音素与音高条件。歌声转换与语音转换原理相近,只是多了歌词对齐与演唱旋律,数据稀缺是主要瓶颈,因此常先做人声分离再做歌词音频对齐。器乐合成则从符号乐谱或钢琴卷帘生成多乐器音频,近期扩散模型能以版本或演奏者为条件控制音色与声学环境。

论文把版本理解为更一般的表演者概念,从而把说话人、歌手与器乐演奏者放进同一全局条件机制。音频基础模型能生成歌声加伴奏的复杂音频,但多用文本等弱条件,对逐帧旋律与音素控制较粗。本文的差异在于坚持细粒度时变控制,把乐谱条件扩展为音素加音高,并用同一注意力扩散骨干同时处理语音、歌声与混合信号。

为什么专用模型不够,还要统一框架?

现实音频常处在中间地带,例如说唱、朗唱、带伴奏的歌声,纯语音模型管不好乐器,纯音乐模型管不好语言。论文要回答的问题是:为多乐器设计的注意力扩散模型,能否只靠改造条件方式就做好人声转换。难点有三。第一,语言内容必须可懂,不能只生成好听的哼唱。第二,音高必须可控,跨性别或跨音域转换不能出现不自然的过高或过低。

第三,演唱者身份必须可换,且换身份时不破坏内容与旋律。教学例子:把 1 位女歌手的片段转给男歌手,理想动作是保留每个字的发音顺序与旋律走向,只把整体高度搬到男声舒适区并换上男声音色;若直接复制基频数值,就会又高又不像,这是后文音高区间自适要解决的。论文不主张统一模型在所有指标上都赢专用模型,而是用对照暴露统一的代价。

整个系统让一个样本走完需要哪三步?

拿一个样本走完全程有助于建立依赖顺序。第一步是特征提取:对源音频估计基频轮廓,用语音训练的音素模型提取音素后验,用声学嵌入模型提取目标表演者向量;若是带伴奏的混合信号,先做人声分离再提人声特征,另用转录模型估计器乐钢琴卷帘。第二步是条件融合与生成:时变特征在通道维拼接后送入条件编码器,融合成一个表示,再经交叉注意力送入频谱解码器;表演者嵌入与扩散时间步经多层感知机生成每层的缩放与平移。

第三步是声码:解码器从加噪梅尔频谱估计噪声,迭代去噪得到梅尔频谱,再用通用 BigVGAN 声码器变成波形。论文选用通用声码器而非纯人声声码器,是为了保留生成人声加器乐混合信号的可能性,代价是纯人声质量可能不是最优。 以下导读帮你带着主路径与分支汇合问题去看总览图,重点区分时变条件走编码器交叉注意力、全局条件走每层调制的两条路径。

看图路径: 1. 先从左侧三路时变输入沿 CAT 箭头看到编码器,确认音高、音素与乐谱在哪里汇合;2. 再看编码器经交叉注意力进入解码器的紫色箭头,区分时变条件与全局条件的作用位置;3. 观察右侧演唱者嵌入与扩散时间步经多层感知机生成缩放平移的路径;4. 核对下方梅尔频谱加噪声进入解码器、上方输出估计噪声并算 L1 损失的闭环

原论文 Figure 1:Overview of our model. “CAT”: Concatenation along the channel axis, “C.A.”: Cross-attention, ‘N’:…

论文图 1。原论文 Figure 1:“Overview of our model. “CAT”: Concatenation along the channel axis, “C.A.”: Cross-attention, ‘N’: Number of stacked blocks.”。

该图左侧显示基频、音素后验与钢琴卷帘经拼接进入编码器做条件融合,中间显示编码器经交叉注意力引导解码器,解码器下方接收梅尔频谱加噪声、上方输出噪声估计并计算损失;右侧显示表演者音频嵌入与扩散时间步经多层感知机得到每层的缩放与平移。虚线表示钢琴卷帘只在混合建模时加入,纯人声时只有基频与音素参与融合,这与后文纯人声模型与全数据模型的条件差异直接对应。

时变条件与全局条件各自管什么,如何配合?

时变条件管每 1 帧说什么与唱多高。每个音素类别与每个音高状态被当作独立通道,沿通道维拼接后送入编码器学习融合表示,再作为辅助输入引导解码器。全局条件管整体像谁与当前去噪处于哪一步。表演者嵌入与时间步先经多层感知机,再以特征线性调制作用于编码器与解码器的每个块。论文强调表演者条件同时加在编码器与解码器,而基线流匹配模型的表演者条件主要在其前端编码部分,这是后文解释相似度差异的机制线索。

音素后验图 × 钢琴卷帘: 音素后验图负责逐帧说的是哪个音素,钢琴卷帘负责乐谱上何时出现哪个音高,两者都是随时间变化的条件;论文把它们在通道维拼接后送入同一编码器,是因为语音与歌声既要乐谱式音高控制又要语言内容控制,拼接让解码器同时看到说什么与唱多高。

时变分支内部还需要处理缺失与强弱。训练时每个条件独立随机丢弃,全部条件还以一定概率联合丢弃,这样模型见过只有音素、只有音高或无条件的样本,推理时才能做部分条件生成与无分类器引导。

特征线性调制 × 演唱者嵌入: 演唱者嵌入负责把目标说话人或歌手的音色与录音环境压缩成一个全局向量,特征线性调制负责用该向量算出缩放与平移参数去调节每一层隐特征;两者搭配的原因是音色不随时间逐帧改变,适合做全局控制,与逐帧的音素和音高条件形成互补。

跨音域转换另需显式平移。论文在半音域上计算源与目标轮廓均值,把源轮廓整体平移至目标均值,公式在原文第 3.3 节给出;选择半音域平均而非赫兹线性平均,是为了更符合音乐音程感知。推理时同一源内容配不同目标歌手,都先平移到目标音域再生成,从而把音高绝对高度的影响与音色条件的影响分开。

丢弃、引导与音域平移如何改变生成行为?

条件丢弃不是正则化点缀,而是让模型学会在信息不全时仍能生成合理音频。举例说明:只给音素后验而不给基频,模型应能自由补出一条合理的语调或旋律;若训练从未见过缺失条件,推理时去掉条件会导致不可预期退化。无分类器引导利用了有条件与无条件两条预测,在采样时放大条件方向,从而控制内容服从程度。论文未报告具体的丢弃概率数值与引导权重扫描,复现时只能按原文描述实现独立丢弃加联合丢弃,并把引导强度当作待调超参数记录下来,不猜测最优值。

条件丢弃 × 无分类器引导: 条件丢弃负责在训练时随机把单个条件或全部条件置零,无分类器引导负责在采样时调节有条件与无条件预测的组合强度;前者制造了部分条件缺失的训练样本,后者才能在推理时利用这些样本控制条件强弱,例如只给音素让音高自由生成。

音域平移发生在特征层面而非波形变调。先把源基频转成以半音为单位的对数表示,求均值后整体平移至目标均值,再作为条件送入模型。教学例子:女声源均值高于男声目标,平移后整条旋律下移,但音程起伏形状保留;模型再结合男声嵌入生成男声音色。若不做这一步,即使给了男声嵌入,模型仍可能沿着过高的轮廓生成偏女声的听感。

音高区间自适应 × 半音均值平移: 音高区间自适应负责解决源与目标歌手自然音域不同的问题,半音均值平移负责在对数半音域上把源轮廓整体搬到目标均值附近;选择半音域而非赫兹线性域做平均,是因为音乐音程是对数关系,平移后旋律相对关系不变而绝对高度落入目标舒适区。

特征提取全部用现成模型的好处是无需人工标注即可构造大规模伪标注数据。代价是误差会向下游传递:人声分离质量、基频估计错误、语音训练的音素模型在歌声上的域偏移,都会影响条件质量。论文明确验证了语音训练的音素模型在歌声上仍能提供有效条件,这是支持跨域自监督训练的关键证据。

模型训练了什么,损失与监督从哪里来?

声学模型训练的是从加噪梅尔频谱估计所加噪声的能力,监督来自干净梅尔频谱加噪后的噪声真值,损失为预测噪声的 L1 损失。条件编码器与频谱解码器端到端联合训练,梯度同时更新两部分;表演者嵌入提取器、基频估计器与音素提取器是冻结的现成模型,只提供条件,不接受生成损失的梯度。论文比较了两类骨干。

第一类是基于 T5 变换器的扩散模型,编码器与解码器各由多层自注意力堆叠组成,解码器交错使用交叉注意力引入时变条件,全局条件经特征线性调制作用于两端。第二类是专用语音转换基线:前端 PAD-VC 基于 1 维卷积加长短时记忆网络,用频谱 L1 重建损失训练,输出粗糙频谱估计;后端 FlowMAC 基于流匹配,在前端输出条件下生成更高质量频谱。原文未给出优化器、学习率、批量大小与训练步数的完整清单,这是复现时必须补记的缺项,不能从模型名称推定。

声码器统一用现成 BigVGAN,不参与本研究训练。

数据、划分、基线与指标如何保证可比?

数据由三部分组成。语音约 33 小时,含 5 位英语说话人,留出每人 50 条完整话语共约 19 分钟做测试。歌声约 31 小时,含 SingStyle111 的 8 位歌手约 13 小时独唱,加混合数据经分离得到的约 18 小时有效人声,留出每位歌手 3 首歌共约 1.3 小时做测试。混合训练集约 90 小时,含舒伯特冬之旅约 11 小时、流行摇滚约 34 小时与西洋古典器乐约 47 小时;混合测试集约 3 小时,含 40 首流行歌曲,覆盖训练见过与未见过的歌手。

纯人声训练集是语音与歌声训练集的并集,全数据训练集再并入混合训练集。模型命名上,T5-Voc 只用人声数据训练,T5-All 用全部数据并额外拼接乐谱钢琴卷帘与数据类型独热编码,PAD-Voc 与 MAC-Voc 只用人声数据训练。评价分四方面。自然度与演唱者相似度用人听测试,辅以 Fréchet 音频距离;音高保持用基频估计准确率,音素保持用音素后验距离。

听测试设隐藏参考与低锚点,参考为声码器重建的原始音频,低锚点为 PAD-Voc 的粗糙输出;对隐藏参考多次打分低于 95 的听众做事后剔除。客观评价用随机抽取的异体目标表演者做转换,避免同体复制带来的虚高。

自然度听测:音乐模型能否追平专用人声模型?

自然度问题是生成音频是否真实自然,比较条件是同一批源内容、同一目标身份、同一声码器上限下的不同系统。指标方向是 0 到 100 分越高越好,并报告两两 Wilcoxon 符号秩检验的 p 值。语音测试 25 位有效听众,歌声测试 25 位有效听众。结果显示纯人声 T5 模型与专用 MAC 模型接近,歌声上略优,语音上无显著差异;混合数据训练的 T5 模型明显下降。

比较前先明确公平条件:四者都以基频、音素与表演者为条件重建或转换,参考均为声码重建上限,低锚点均为粗谱重建,分数越高表示越自然,p 值越小表示差异越可信。

条件指标T5-Voc 均值MAC-Voc 均值显著性
语音自然度 0 到 100 分听测均值68.6368.34p 等于 0.69 不显著
歌声自然度 0 到 100 分听测均值59.1155.84p 等于 7.24e-3 显著

表后解释需要同时看到收益与代价。

收益是源自器乐合成的注意力扩散模型在人声自然度上达到专用模型水平,歌声上小幅领先约 3 分,说明时变音素加音高条件与全局表演者调制的迁移是有效的。代价有二:一是歌声整体低于语音,说明表情丰富的歌声更难生成;二是 T5-All 比 T5-Voc 低约 10 到 15 分,说明加入异域器乐数据增大任务复杂度,在当前容量下专用模型仍占优。未胜出项是 PAD-Voc 仅得约 16 到 20 分,证明只靠重建损失的粗谱估计不足以完成该任务,必须依靠生成建模。

以下导读带你先看语音自然度的分布形态,再核对 T5 与专用模型是否真的没有拉开差距。

看图路径: 1. 先确认横轴五个系统顺序与纵轴 0 到 100 自然度评分范围;2. 比较 T5-Voc 与 MAC-Voc 箱体中位线与均值菱形的高低;3. 查看 T5-Voc 与 MAC-Voc 之间标注的 p 值为 0.69,判断差异是否显著;4. 观察 PAD-Voc 箱体明显偏低、参考音频集中在顶部的位置

原论文 Figure 3:Speech naturalness listening test results.

论文图 3。原论文 Figure 3:“Speech naturalness listening test results.”。

该图显示语音自然度下 PAD-Voc 集中在低分区,T5-All 居中,MAC-Voc 与 T5-Voc 的箱体与均值点高度重叠且远高于前两者,但仍低于顶部的参考音频;T5-All 到 MAC-Voc 的 p 值极小而 MAC-Voc 到 T5-Voc 的 p 值为 0.69,支持语音上两者相当、混合训练显著更差的判断。像素可辨的箱体宽度与小提琴形分布还提示评分方差较大,均值差异需结合显著性理解,不能只看小数点后 2 位。

歌声自然度与分布距离是否给出一致结论?

歌声自然度问题与语音相同,只是内容换成歌唱,表情与音高动态更大。客观侧用 Fréchet 音频距离补强,总体距离越小表示越接近真实录音分布,表演者距离越小表示越接近目标表演者子分布。论文报告 T5-Voc 在总体与表演者距离上多为最优,表演者距离优势最明显;声码重建在总体距离上最优但在表演者距离上最差,恰好证明表演者条件把分布推向了目标而非源。

比较前需明确距离的参照集合:总体距离分别相对测试集与训练集计算,表演者距离相对同一表演者的真实子集计算,数值越小越好,训练集距离更小部分源于集合更大分布更平滑。

条件指标T5-VocMAC-Voc方向
歌声目标歌手相似度 1 到 5 分听测均值3.252.75越高越像目标

表后解释要把相似度与自然度连起来。T5-Voc 配目标歌手均值 3.25 对应量表上 probably the same person 附近,配其他歌手降至 1.76,说明同一内容换条件确实改变听感指向。

且 T5-Voc 高于 MAC-Voc 的 2.75,p 值小于 1e-7,支持其表演者条件更强的判断。论文的有限解释是 T5 把表演者调制同时加在编码器与解码器,而基线主要在前端,这可能带来更强的身份控制,但属于待验证的机制假设。反例是相似度仍未达到 5 分完全同一人,说明身份控制仍有提升空间。 以下导读帮你确认歌声自然度的排序是否与语音一致,以及混合训练的惩罚是否依然存在。

看图路径: 1. 先确认横轴同样五个系统、纵轴为歌声自然度 0 到 100 分;2. 比较 T5-Voc 箱体是否略高于 MAC-Voc,注意均值与中位线的相对位置;3. 查看 T5-Voc 与 MAC-Voc 之间 p 值为 7.24e-3 的显著性含义;4. 观察 T5-All 箱体低于两个纯人声模型、参考音频仍在顶部的格局

原论文 Figure 4:Singing naturalness listening test results.

论文图 4。原论文 Figure 4:“Singing naturalness listening test results.”。

该图显示歌声自然度下排序仍为参考最高,T5-Voc 略高于 MAC-Voc,T5-All 居中,PAD-Voc 最低;T5-Voc 与 MAC-Voc 之间的 p 值为 7.24e-3,达到显著但差距幅度小于与 T5-All 或 PAD-Voc 的差距。结合前一节语音图可得一致结论:纯人声 T5 模型追平或小幅超过专用模型,而加入器乐数据的统一模型在纯人声上付出约 10 分量级的自然度代价。

换歌手、加器乐与音高音素控制各付出什么代价?

本节把 3 个对照放在一起:换歌手是否真换身份,加入器乐能否换来混合建模能力,音高与音素哪一个更容易保持。歌手相似度测试每次随机抽目标歌手与同性别其他歌手,用同一源内容生成两版并做音域归一化,要求听众按 1 到 5 量表打分,20 位听众参与。音高保持用 CREPE 重提轮廓后算原始准确率与总体准确率,阈值含 50 音分与 25 音分。音素保持用语音模型重提音素后验后算 Jensen-Shannon 散度与 Wasserstein 距离,越小表示越忠于源内容。

比较前明确各指标方向:相似度越高越像目标,音高准确率越高越好,音素距离越小越好;混合实验的 Fréchet 距离越小表示越接近真实演出。

条件指标仅器乐谱器乐谱加人声条件方向
混合测试集Fréchet 距离0.2770.236越小越好
混合训练集Fréchet 距离0.250.213越小越好

表后解释需分开看收益与反证。混合建模的收益是明确的:加入基频与音素后,测试集距离从 0.277 降至 0.236,训练集从 0.25 降至 0.213,支持人声与器乐特征联合能提高带伴奏歌声的真实感,这是纯人声模型做不到的任务。

反证有二:一是音素距离上 MAC-Voc 最优而 T5-Voc 更差,说明高自然度与强表达力不等于高音素保真,论文举例 T5 把德语喉音 r 唱成英语近音 r;二是音高上 T5-Voc 多为最高但领先仅 1 到 3 个百分点,歌声原始准确率达 92 到 95%,语音明显更低,可能与语音基频估计不稳有关。未评测边界是音素保真只有客观距离,缺少系统的可懂度听测。 以下导读带你核对相似度图中条件切换的效应是否大于模型间差异。

看图路径: 1. 先确认横轴四组为同模型配目标歌手与配其他歌手、纵轴为 1 到 5 相似度量表;2. 对比 T5-Voc 与其配其他歌手对照组的中位线落差;3. 比较 T5-Voc 与 MAC-Voc 在目标歌手条件下的箱体高度与均值点;4. 查看图中标注的 p 值数量级,确认跨模型与跨条件差异均显著

原论文 Figure 5:Singer similarity listening test results.

论文图 5。原论文 Figure 5:“Singer similarity listening test results.”。

该图显示配其他歌手时 2 模型中位线落在 1 到 2 分区,配目标歌手时升至 3 分区附近,T5-Voc 的箱体上限与均值点高于 MAC-Voc;图中 3 个 p 值均极小,支持条件切换有效且 T5 条件更强的结论。像素上两侧对照组的分布更矮更集中,目标条件组向上拉长,说明换身份主要抬高整体分布而非只移动个别样本,但仍有部分样本落回低分区,提示身份控制的稳定性因样本而异。

哪些结论有支持,哪些还只是推测?

直接报告的结论有三:纯人声 T5 模型在自然度上追平或小幅超过专用模型,在演唱者相似度与表演者距离上更优,在音高保持上多为最高。有限解释的是表演者调制位置带来更强身份控制,这与结构差异吻合但未做消融把调制只加在一端来验证,只能表述为可能。未验证的推测包括模型容量不足导致混合训练拖累人声质量,以及注意力结构缺少卷积约束带来更多样但更易偏离音素的渲染,两者都符合观察但缺乏容量扫描与结构消融支持。

数据局限同样明确:语音、歌声与混合数据多为内部复合集,虽特征提取器公开可复现同类流程,但他人无法逐样本复刻;混合测试含训练见过的歌手,其他歌曲的身份泄露可能影响泛化判断。评价局限是音素保真缺少听测,音高评价依赖 CREPE 自身精度,总体趋势不等于每位歌手或每句都成立。

要复现与复核应先做什么,需要补哪些验证?

复现应先固定信息条件:用同一源提取基频与音素,用同一目标提取表演者嵌入,对跨音域转换先做半音域均值平移,再送入同一声码器。基线必须保留原文实际可运行的策略,即 PAD-VC 粗谱前端加 FlowMAC 后端,以及声码重建上限与粗谱下锚,不能只与搜索最优或事后最优比较。超参数方面,原文缺失丢弃概率、引导权重、扩散步数与训练优化细节,复现时应把这些当作显式变量记录并做小范围扫描,而不是默认某个常用值。

验证上至少补三项:把表演者调制分别只加在编码器或解码器,检验相似度优势是否消失;做容量或数据配比扫描,检验混合训练的惩罚是否随容量缓解;对音素保真补可懂度听测,区分保留源口音与适应目标口音两种任务定义。何时值得尝试统一路线:目标包含带伴奏歌声或说唱等中间形态,且能接受纯人声质量小幅下降;若只做纯语音转换且要求最高可懂度,专用模型仍是更稳妥的起点。

一句话收束:迁移带来了什么,又拿走了什么?

论文的价值在于证明同一套条件语言可以横跨器乐、歌声与语音:时变分支管说什么与唱多高,全局调制管像谁,丢弃与引导管条件强弱,平移管音域适配。带来的好处是自然度与身份控制达到专用水平,并获得建模带伴奏歌声的能力;拿走的是部分音素保真与纯人声质量,混合训练的代价在当前设置下清晰可见。对初学者而言,复述时不要把高自然度等同于高可懂度,也不要把总体距离下降等同于每位歌手都变好。

每次引用数字都要同时说清数据集、基线、阶段、指标与聚合对象,百分点差异与相对百分比不可混用。下一步最值得做的是在统一框架内补上身份调制位置、容量配比与可懂度听测三块证据,让统一音频生成的取舍从观察变为可操作的选型依据。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 18 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 dafx-2026 论文汇总