英文题目:Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.967

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#多任务学习 #音频大模型 #环境声 #语音 #音频理解

评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Linhao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuhan Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Aiwei Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Chuhan Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Sijun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Jia:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Houfeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhou Xiao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为包含语音、音乐与环境声的通用音频,输出为转写、问答与语音合成,难点在于以恢复规范文本为目标的自动语音识别监督会把韵律、情感、音色与声事件归一化掉,导致模型能推理却听不清细节。方法分三步:首先用音频描述模型对原始音频生成副语言与场景字幕,抽取自动语音识别丢弃的声学信息。接着用大语言模型将字幕与真值转写归一化为转写、副语言学、非语言事件三段式JSON,形成结构化监督。然后以该结构做适配与指令微调,并辅以问答训练与强化学习,使感知知识转化为任务表现且兼容现有评测。相对同源非结构化字幕融合,关键差异是以正交槽位强制解耦语言内容与感知属性,并以低熵固定词汇降低优化难度,从而保证完备性与句法不变性。在MMSU基准下,UAS-Audio的感知准确率为55.7%,高于Kimi-Audio的感知准确率44.8%。该结论适用边界受限于英汉高资源语音与单主说话人场景,重叠语音、多说话人解耦与低资源语言尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

本文解读的对象是会议论文提出的结构化音频监督方法。输入是原始波形,输出是既能转写又能回答感知问题还能做推理和语音生成的音频大语言模型。

目标读者是刚进入语音、音乐、音频方向的研究生,需要能复述方法而不只是记住结论。因此本解读必须保留 3 类信息。

第一是监督的形状:转写字段如何保证与自动语音识别等价的语言保真度,副语言 6 个子字段如何取值,非语言事件如何区分离散与连续。第二是数据的来路:3 阶段合成管线每一步的输入输出、过滤规则和人工抽检规模。

第三是实验条件:评测基准的划分、基线模型、连续与离散两种架构、训练 4 阶段的冻结与更新方式,以及主结果和消融的具体数字与适用边界。后续按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算。

然后讲训练构造与推理,最后讲实验条件、结果反证、复现与收束。教学用的举例会明确标为例子,不把例子当作论文报告的数值。

已有路线在解决什么,留下了哪个缺口?

已有音频大语言模型一般走两条输入路线。白话说,连续表示路线是用音频编码器把波形变成稠密向量再投影到语言模型空间,保真度高。离散表示路线是把音频先切成符号再直接扩充词表,便于自回归生成语音。

两条路线在论文中都有对应实现,连续版本基于 Qwen2.5-7B 加音频变换器加线性投影,离散版本基于 Qwen2.5-3B 并沿用 GLM-4-Voice 的分词器。相关工作还包括更丰富的转写尝试。

一种是通用音频描述把转写和声学描述融成一段自由文本,另一种是在转写流里插入特殊标记表示笑声或情绪。论文认为前者把说什么和怎么说缠在一起,学习目标熵高且不稳定。后者是扁平标记,适合稀疏事件但难以表达韵律、音色、情感这类稠密连续属性。

缺口在于主流训练仍以自动语音识别为主要对齐信号。为了恢复规范文字,训练会刻意归一化掉韵律、说话人身份、情感和声学上下文。模型因此被奖励回答说了什么,被隐式劝阻关注怎么说和还有什么声音。

论文用 MMSU 上的现象支撑这个判断:复杂推理可达约 70%,基础感知掉到约 40%,而且换更大骨干或编码器仍持续存在。下面是一个教学例子,例子不是论文实验:同样一句我没事,转写相同,但颤抖的声音提示不安,关门声提示交互突然结束,转写监督本身不要求模型保留这两条信息。

为什么推理强不等于听得细?

问题可以拆成三问。第一问是任务定义:音频理解不仅要输出说了什么,还要回答说话人属性、说话方式和环境事件,并在此基础上推理。第二问是失败模式:模型能正确转写我很好,却听不出颤抖,也能回答常识问题,却注意不到背景中的门声或音乐。

第三问是成因假设:不是容量不够,而是监督不对称。自动语音识别目标只要求语言层正确,副语言和环境信息在优化中被当作噪声压掉。论文把 Laver 的语音符号学作为依据,把语音看成语言层、副语言层和言外层的复合。

语言层传抽象语义,副语言层是自愿的音调和韵律变化,言外层包含年龄性别等生物约束和物理环境特征。方法上的对应是把这 3 层映射为可写的 3 个功能维度,而不是让模型从一段自由描述里自己猜。

自动语音识别监督 × 统一音频模式: 自动语音识别监督的分工是把语音映射到规范文字,保证说什么被对齐;统一音频模式的分工是把同一段音频同时写成转写、副语言、非语言事件 3 个槽位,保证怎么说和还有什么声音也被保留。搭配理由是前者熵低易学但会把韵律和环境当噪声压掉,后者用固定槽位降低学习难度,组合意义是让模型既保留语义对齐又被迫编码感知细节。

沿一个样本走一遍有助于建立直觉。输入是一段讲飞机机翼的技术讲解音频。理想输出不是只有逐字稿,而是同时写出成年男性、南方英语、中性情感、平稳有条理的韵律、略闷的音色。

以及持续的合成和弦与低水平背景嘶声。转写字段保证语义不丢,后两个字段保证感知不丢。推理时模型可以只回答其中一个槽位,但训练时必须完整预测,从而把细粒度声学编码进参数。

统一音频模式把一段声音写成什么样子?

统一音频模式的英文名是 Unified Audio Schema,后文简称 UAS。白话说,它是一份固定形状的 JSON 作业纸,模型训练时必须按格子填写。顶层有 3 个格子。

第一个是 transcription 即转写,保留逐字内容,与标准自动语音识别输出等价的语言保真度。第二个是 paralinguistics 即副语言,含年龄、性别、情感、口音、韵律、音色 6 个子字段。第 3 个是 nonLinguisticEvents 即非语言事件,含整体环境描述、离散事件表和连续事件表。

每个事件再写标签加特征,例如门撞击加短促响亮,背景嘶声加低水平持续。对于没有人声的纯环境或音乐片段,转写和相关副语言子字段置为 null,避免无中生有。论文强调 3 个设计好处。

第一是解耦学习,把整体理解拆成显式子任务,迫使模型区分说了什么和怎么说。第二是句法不变性,固定槽位比自由描述熵低,优化更稳定。第三是程序可访问性,JSON 可被下游直接解析,不需要再从长文本里抽取。

下面先看模式总览图,理解 3 个部分的并列关系,再回到文字解释该图只用于理解权衡方向。

看图路径: 1. 先看左侧三个色块如何把一段话拆成转写、副语言、非语言事件;2. 再看副语言下年龄性别情感口音韵律音色的并列槽位;3. 最后看右侧散点横轴感知纵轴推理以及红色星形的位置方向

原论文 Figure 1:Overview of the Unified Audio Schema (UAS) and evaluation results.

论文图 1。原论文 Figure 1:“Overview of the Unified Audio Schema (UAS) and evaluation results.”。

这张图左侧展示了 UAS 的 3 个色块。转写块是连续英文句子,副语言块是 6 个键值对,非语言事件块进一步区分离散事件和连续事件,每个事件都有标签和特征。右侧是 MMSU 上感知为横轴、推理为纵轴的散点,UAS-Audio 位于右上,含义是感知明显右移而推理高度基本保持。读图时不要把右侧星形的位置读成具体数值,精确数字以正文表格为准。

三个字段各自怎么算,模型结构如何配合?

先讲字段计算的含义,这里计算指从音频到结构化文本的映射,不是手写公式。转写字段的输入是波形加已有逐字稿的约束,目标是原样保留,验证用与真值逐字匹配,保证零语义损失。

副语言字段的输入是声学描述加受控词表,年龄性别情感等分类字段必须落在封闭集合里,例如情感只允许愤怒、厌恶、悲伤、高兴、中性、惊讶、恐惧 7 类,韵律和音色是短语描述但要区分时间与音高模式和音质本身。非语言事件字段的输入是环境描述,目标是把可定位的短事件和贯穿全程的背景分开。

每个事件标签唯一并带强度或持续特征。无话语音频的规则是转写为 null 且副语言全为 null。

副语言 × 非语言事件: 副语言的分工是描述说话人自身如何发声,包括年龄、性别、情感、口音、韵律、音色;非语言事件的分工是描述说话之外的听觉场景,包括整体环境描述、离散事件和连续事件。搭配理由是前者附着于人声,后者独立于人声但共享同一时间轴,组合意义是把 Laver 的语言层、副语言层和言外层的理论映射为可写的 JSON 字段,避免把两者混成一段自由描述。

再讲模型结构如何配合。连续版本 UAS-Audio 包含 4 个部件:音频编码器把波形变连续表示,投影层对齐到语言模型嵌入空间,大语言模型做联合推理,语音解码器基于流匹配加声码器把音频符号变回波形。离散版本把音频分词器输出直接嵌入词表,不需要投影对齐。

输出有两种模式:纯文本模式输出符号序列,音频输出模式输出文本加音频符号交错序列再进解码器。训练时不引入新模块或特殊损失,只是把 UAS 数据接入标准多阶段对齐流程。下面看架构图,确认两条输入路径和两种输出模式的位置。

看图路径: 1. 先看底部两种输入路径在何处汇入大语言模型;2. 再看顶部纯文本输出与音频输出模式的分叉;3. 最后确认适配器与编解码器各自只出现在一条路径上

原论文 Figure 3:Overview of UAS-Audio architectures.

论文图 3。原论文 Figure 3:“Overview of UAS-Audio architectures. Au- dio input is processed via either discrete tokenization or continuous encoding (left).”。

这张图底部是两条输入路径,左侧离散路径经过音频分词器直连大语言模型,右侧连续路径经过音频编码器再经适配器进入同一模型,中间标有或字表示二选一。顶部是输出,向上是纯文本,向下是文本加音频符号再进音频解码器。火焰图标表示可训练,雪花表示冻结,具体哪阶段冻结见训练节。读图时注意适配器只属于连续路径,离散路径没有该部件。

数据和模型分哪几步练出来,推理时还要输出长 JSON 吗?

数据合成管线分 3 个阶段。第一阶段是声学描述生成,给定原始音频和原转写,用描述模型生成富含副语言和环境信息的段落,提示要求覆盖年龄性别情感口音韵律音色以及离散连续事件。第二阶段是结构化合成,把声学描述与真值转写一起送入大语言模型。

按手写提示抽取归一化并组织成 UAS,要求转写逐字保留、副语言归入预设类别、非语言事件按离散连续分层。第 3 阶段是质量验证,包括本体约束、转写完整性精确匹配、逻辑一致性规则、时长内容对齐启发式。例如空转写必须对应副语言为 null,性别标签与音色描述矛盾则丢弃。

描述复杂度与时长严重不成比例则视为幻觉丢弃。人工验证抽查 400 段覆盖语音音乐环境声,3 位熟悉音频分析的志愿者听音并对 9 个字段选正确、错误或不确定,多数投票为准,多数属性准确率超 95%,情感和离散事件相对低但仍在高位。下面看管线图,理解两路输入如何合并为完整结构。

看图路径: 1. 先沿左侧波形分叉看逐字稿与声学描述两条输入;2. 再看中间结构化合成与质量验证的通过与丢弃分支;3. 最后看右侧完整 JSON 如何同时保留转写和声学字段

原论文 Figure 2:Overview of the UAS Data Generation Pipeline.

论文图 2。原论文 Figure 2:“Overview of the UAS Data Generation Pipeline.”。

这张图从左到右是 3 个阶段。左侧波形分出两路,上路是真值逐字稿但缺声学,下路是声学描述但缺逐字细节。中部结构化合成输出原始样本,质量验证分出通过与丢弃。右侧是通过后的完整 JSON,底部标有结构化且完整。观察时重点看缺什么补什么:转写补语义保真,描述补感知完整,验证负责删幻觉。

模型训练分 4 个阶段。第一阶段是离散符号对齐,用自动语音识别和文本转语音任务只训练嵌入层和输出头,建立语音生成接口。第二阶段是音频到大语言模型适配,只在 UAS 标注上训练投影层,骨干和编码器冻结。

目的是先建立结构化理解,避免先学纯转写再遗忘。第 3 阶段是全指令微调,解冻除编码器外全部参数,混合基础音频数据、UAS 标注和 UAS 问答。UAS 问答含直接问答、选择题、是非题 3 种,覆盖全部字段,教模型应用知识。第 4 阶段是组相对策略优化,进一步提升能力。

离散架构简化为两步:无适配器对齐,不做强化学习,依次做 UAS 标注和 UAS 问答微调。

统一音频模式标注 × 统一音频模式问答: 统一音频模式标注的分工是让模型从音频完整生成 JSON,学会感知什么;统一音频模式问答的分工是针对某个字段提问并回答,学会把感知用于任务。搭配理由是前者提供稠密完整的监督,后者提供指向具体槽位的显式应用信号,组合意义是消融显示两者互补,拿掉问答的感知下降更大。

连续架构 × 离散架构: 连续架构的分工是用音频编码器加投影层输出连续表示,保真度高;离散架构的分工是用音频分词器把声音变成离散符号直接进词表,利于生成。搭配理由是两者输入表示不同但都需要同样的感知监督,组合意义是论文在两条路线上都验证统一音频模式有效,说明增益来自监督结构而非某一种编码器。

推理时不必每次输出完整 JSON。论文明确训练时用稠密监督,推理时用任务提示对齐标准评测:转写用标准转写提示,合成用合成提示,理解用判别式提示,因此不增加额外延迟。需要时可整体生成 UAS 做压力测试,也可用目标提示只抽情感性别等短答案,感知能力已内化在参数中。

用什么数据、和谁比、在什么条件下测?

评测分理解与生成两类。理解用 3 个基准。MMSU 含 5000 个音频问答三元组覆盖 47 个任务,显式分为感知与推理子集,直接对应论文目标。MMAU 含 10,000 段音频覆盖语音环境音乐,需要专家知识和复杂推理。

MMAR 含 1000 个精选三元组,强调多学科多步推理。生成用 Seed-TTS 的中英文集,检验文本转语音质量是否被感知训练拖累。基线是同为 70 亿规模语言骨干的 Qwen2.5-Omni、Kimi-Audio 和 Step-Audio2-mini,离散对照是 GLM-4-Voice。

结果引用自相应技术报告并采用相同评测框架。训练数据是数十万小时量级,约 90% 开源加 10% 内部,开源清单包括 LibriSpeech、Multilingual LibriSpeech、GigaSpeech、Yodas、Hi-Fi TTS、VCTK、LibriTTS、AISHELL-1、WenetSpeech、Common Voice、Emilia 和 AudioSet。

实现上连续版本语言骨干为 Qwen2.5-7B,音频编码器为音频变换器,优化器为 AdamW 加余弦加线性预热,各阶段超参数见附表。需要复述的关键条件是:推理用任务专用提示而非强制长 JSON,保证与基线延迟可比。

离散与连续分开比较,不跨表示混排胜负。主结果表同时给出感知与推理,避免只看平均掩盖权衡。自动语音识别能力对比专用提示与整体 JSON 内转写字段,语音合成对比中英文词错率。

感知提升了多少,推理和生成保住了吗?

比较问题是:在相同评测协议下,UAS 是否在不损失推理和生成的前提下提升细粒度感知。公平条件是同基准同提示框架,指标方向是准确率越高越好,语音合成词错率越低越好。先看结构化与非结构化监督的对照,它隔离了格式本身的作用,两者都不含最后强化学习阶段。

4) in both settingsto strictlyisolate theimpact of
Target FormatPerceptionReasoningAverage
Unstructured Caption48.475.561.5
Structured UAS54.876.065.2

这张原表显示结构化 UAS 在感知上为 54.8,明显高于非结构化描述的 48.4,推理分别为 76.0 和 75.5 基本持平,平均为 65.2 对 61.5。主要收益是格式带来的 6.4 个百分点感知增益,代价很小,推理没有下降。未胜出项是非结构化基线,它在概念上对应近期通用描述路线,说明同样数据源下槽位化仍更有效。

再看跨基准的主结果,需要同时核对数据集、模型、阶段、指标与聚合对象,百分点差值不要说成相对百分比。下面整理表把分散在正文的数字放在同一视图,表头单位与数值写法保留原文含义。

评测条件指标说明UAS-Audio对照基线差距含义
MMSU 感知感知准确率55.7%44.8%高 10.9 个百分点
MMAR 总体总体准确率60.1%基线之下最高总体
MMAU 总体总体准确率69.4%72.7%未登顶但均衡
3 基准平均平均得分65.2%基线之下最高平均

感知准确率 × 推理准确率: 感知准确率的分工是衡量能否听出说话人属性和声学事件;推理准确率的分工是衡量能否基于听到的内容做多步推理。搭配理由是 MMSU 把两者分开评测,才能看出以往模型推理强但感知弱的错位,组合意义是统一音频模式把感知大幅拉高而推理基本不掉,支持感知与推理可分别改进的判断。

这张整理表对应的原文报告显示,UAS-Audio 感知 55.7%,比最好的 Kimi-Audio 的 44.8% 高 10.9 个百分点。推理 77.4%,仅比最高的 Qwen2.5-Omni 的 77.6% 低 0.2 个百分点。MMAR 总体 60.1% 为最高。

MMAU 总体 69.4% 不及 Step-Audio2 的 72.7%,但 3 类分数更均衡,语音 67.0%、声音 70.0%、音乐 71.3%。3 基准平均 65.2% 最高。主要代价是 MMAU 总体不是第一,说明统一理解仍有领域差异。离散路线上平均从 24.4% 提到 44.2%,接近翻倍。生成侧平均词错率 1.6 优于基线,转写鲁棒性上整体 JSON 中的转写字段与专用转写提示仅差约 0.1。

拿掉哪一块会掉多少,强化学习是主因吗?

消融按去掉的部件组织。测什么:UAS 标注、UAS 问答、强化学习阶段各自对 MMSU 感知与推理的贡献。与谁比:完整模型与去掉某一块的变体,条件一致且都不改变架构。指标方向是准确率越高越好。

关键数字是去掉 UAS 降 6.3 个百分点,去掉 UAS 问答降 9.6 个百分点,同时去掉降 15.0%,推理在各配置下保持稳定。问答影响更大,说明显式问答更关键地把声学知识转成任务表现。强化学习阶段去掉后感知从 55.7% 到 54.8% 降 0.9 个百分点。

推理从 77.4% 到 76.0% 降 1.4 个百分点,即使去掉仍比最强基线高 10.0 个百分点,因此主增益来自结构化监督而非最后优化。下面整理表把 3 组消融放在同一粒度下,数值与单位保留原文写法。

消融条件感知指标推理指标对照基线结论指向
去掉 UAS 标注下降 6.3%基本稳定完整模型完整标注必要
去掉 UAS 问答下降 9.6%基本稳定完整模型应用信号更关键
同时去掉两项下降 15.0%基本稳定完整模型两者互补
去掉强化学习55.7% 到 54.8%77.4% 到 76.0%44.8%主增益非强化学习

这张整理表把 3 组消融放在同一粒度下。收益是定位清晰:感知瓶颈而非推理瓶颈。代价或反例是强化学习仍有小幅提升,不能说它无用。情感与离散事件的人工准确率相对低,说明合成数据在主观与稀疏事件上仍有噪声。未评测边界包括重叠语音和低资源语言。

哪些情况还不适用,数字的边界在哪里?

论文明确承认两类局限。第一是语言多样性,验证集中在英语和中文等高资源语言,因为主流基准如此,模式本身与语言无关,但在低资源或语码混合场景的效果待验证。第二是复杂重叠语音,当前模式聚焦主要说话人的副语言分析。

对鸡尾酒会式多说话人同时需要解耦的场景覆盖不足。数字边界也要讲清。人工抽检 400 段显示多数字段超 95%,但情感约 89.0%、离散事件约 91.75%,置信区间下限仍在 84% 以上。

说明客观稳定的年龄性别和连续事件更可靠,主观情感和短时稀疏事件噪声更大。MMAU 总体未登顶提示跨领域仍有方差。资源状态方面,本次收到的证据中没有完成验证的开源资源记录。

因此不能写代码模型数据已公开或当前可用,只能说论文正文给出仓库链接,读者需自行确认可达性。未测量延迟、误判率和训练成本时,不承诺这些量得到改善,长 JSON 训练是否增加训练开销原文未量化,推理侧通过目标提示避免额外延迟,但目标提示本身的节省未给出精确计时。

要复现先做什么,需要哪些信息条件?

复现先做三件事。第一是复刻数据管线:准备带真值转写的音频,用描述模型生成声学段落,再用指令模型按固定提示转成 JSON,最后跑 4 类自动过滤。关键超参数和信息条件是情感 7 类封闭集、事件标签唯一、空转写对应副语言为 null。

以及时长与复杂度启发式阈值,以及转写精确匹配。提示词原文在附图中给出,复现时应逐字使用而非改写。第二是复刻训练顺序:连续路线先只训投影层再全量微调除编码器外,最后做组相对策略优化。离散路线只做两步监督微调且不用强化学习。

优化器用 AdamW,学习率余弦加线性预热,离散两步分别从较小学习率起步。第三是复刻评测:MMSU 分开报告感知与推理,MMAR 与 MMAU 报告总体与分域,Seed-TTS 报告中英文词错率,转写鲁棒性对比专用提示与整体 JSON 内转写字段。

还需补的验证是低资源语言、重叠语音、多轮对话中的槽位保持,以及训练与推理的实际耗时与显存。区分 3 类可运行性:论文方法可运行不等于仓库可下载,权重可下载不等于系统可一键运行,当前无验证资源时应先跑小规模合成加人工抽检,再扩大训练。

何时值得尝试,一句话如何带走?

当你的模型转写很好但答不对话筒后的人和环境,当推理基准很高但一问口音情感背景声就错,当自由描述训练不稳定或下游解析困难时,值得尝试把监督改成固定槽位的 JSON。先沿单样本走完输入到表示到组件到目标到输出,再展开训练阶段。

先保证转写逐字不丢,再加副语言与事件约束。先用小数据验证情感与离散事件的噪声,再全量训练。术语对照可帮助初学者回查:自动语音识别监督指以转写为主要对齐信号的方式,统一音频模式指转写加副语言加非语言事件的 JSON 监督。

副语言指年龄性别情感口音韵律音色六项,非语言事件指环境描述加离散事件表加连续事件表。韵律指节奏音高语速重音语调模式,音色指与音高响度独立的音质。连续架构指编码器加投影路线,离散架构指分词器直连词表路线。

带走的判断是:结构丰富度是除规模之外的关键变量,感知与推理可以分别改进,而统一音频模式用低熵目标和强制完整换来了 10.9 个百分点的感知提升,同时保住了推理、转写与合成。未验证的推测用可能表达:更密的韵律音色监督可能进一步帮助生成,但需待验证。相关性不是因果,规模与数据配比的影响仍需控制实验。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总