英文题目:AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.1464

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #偏好优化 #音频大模型 #音频问答

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yanxi Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenhui Zhu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiwen Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhipeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xin Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Peijie Qiu:机构信息未能从会议 PDF 纯文本可靠映射
  • Hao Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuanzhao Dong:机构信息未能从会议 PDF 纯文本可靠映射
  • Yujian Xiong:机构信息未能从会议 PDF 纯文本可靠映射
  • Anderson Schneider:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuriy Nevmyvaka:机构信息未能从会议 PDF 纯文本可靠映射
  • Yalin Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

大音频语言模型需以声学序列与指令为输入生成回答,难点在于声音事件随时间重叠展开,模型易依赖语言先验而虚构时序细节。本文先以事件遗漏、虚假身份、时序关系与定量时序四维分类界定幻觉,为扰动合成与评测提供对齐目标。接着由复杂声景字幕构建共享音频问题池,统一派生对齐与评测两条支路,使监督信号在不同输入模态下保持一致。然后用文本大模型按分类合成语言流畅但时序矛盾的反事实硬负例,经人工筛选与字幕真值配对形成偏好数据。最后以直接偏好优化在Qwen2.5-Omni-7B上做低秩适配后训练,增大真值似然并显式抑制特定幻觉负例。与仅用监督微调的基线相比,关键差异在于用偏好目标惩罚看似合理却违背声学证据的伪造,迫使策略优先声学 grounding 而非语言流畅,从而提升细粒度推理泛化。在AHA-Eval基准下,Qwen-Audio-AHA的定量时序错误率为52.6%,从基线Qwen2.5-Omni的69.6%降至52.6%。该结论适用边界受限于字幕衍生问题与短剪辑场景,尚未验证长音频、强重叠与噪声下的外推能力,训练硬件为4张NVIDIA A100 GPU共训练8轮,推理开销与部署延迟尚未验证。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文解读的输入是论文正文与官方原图像素,目标是让刚进入语音音乐音频方向的研究生能复述方法与实验条件。需要保留的信息包括 4 类幻觉定义、共享音频问题池的两视图构造、偏好对中正确与拒绝回答的来源、直接偏好优化的训练对象与超参数、诊断基准与公开基准的评测协议与指标方向。

输出是 1 篇按学习依赖展开的技术解读,不做营销式判断。先说任务直觉,音频与图像不同,声音事件在时间轴上展开并经常重叠。模型不仅要听出有什么,还要说清谁先谁后、持续多久、出现几次。

当声景复杂难解析时,大音频语言模型容易退回语言先验,生成语法流利但与声学现实脱节的回答。论文把这种失败称为粒度幻觉,也就是为了听起来连贯而编造精确细节。仅靠监督微调难以修复,因为正例训练缺少否定约束。

论文因此提出统一管线,用反事实硬负例提供可证伪的时间对比,再用偏好优化把接地要求压进模型。理解这条主线后,后文先沿一个样本走完输入到输出,再展开构造细节、训练计算、实验条件与限制。

关于资源可用性,本次未发现来源绑定且完成安全协议状态验证的资源,不得声称代码、模型或数据已公开。复现应按自建管线理解成本,不默认存在可下载权重。

已有路线走到哪里,为什么还缺一块?

已有路线可以按输入与目标分成 3 段。第一段是把音频当作离散符号或联合词表做统一序列建模,代表工作包括把语音表示做扎实的基础模型,以及早期把语音对话能力接到大语言模型上的尝试。第二段是通用音频理解,通过多编码器融合环境线索或多任务指令微调扩大覆盖。

典型例子是同时处理语音与非语音事件的系统,论文提到的通用音频理解模型属于这一段。第 3 段是全模态低延迟交互,用语音文本混合数据流与分工架构实现边听边想边说。论文把自身定位为后训练对齐阶段的补块,而不是再做一个基座模型。

幻觉研究此前多局限在子任务。语音识别方向关注静音诱发的循环重复,音频描述方向关注编造不存在的物体。这些工作能解释局部错误,但缺少对通用模型复杂细粒度推理失败的系统分类。

论文的对照策略是同输入同目标比较,即同样面对多事件、重叠与转场音频,同样要求回答顺序、因果、计数与时长时,既有监督微调范式是否保证严格接地。论文报告的诊断结果显示,即使较强系统也在事件遗漏维度出现高错误率。

这支持了缺失负约束的判断。需要区分的是,相关工作的类别差异不能直接当成同条件胜负,本文后文的数字比较只在论文实际运行的模型与基准范围内成立。

模型要回答什么,什么算错?

论文把大音频语言模型形式化为从声学序列与文本指令到文本回答的映射。时间音频推理要求回答同时满足 4 个可核查点:发生了什么事件,何时发生即时间顺序,持续多久即时长,出现几次即计数。任何回答都应严格接地到声学证据。

论文把接地失败拆成 4 类。事件遗漏指可感知的事件被忽略,例如响亮冲击前的微弱嘶声被丢掉。错误事件身份指编造或标错声音,包括无中生有与语义类别错配。时序关系错误指顺序或因果被扭曲,例如把先后说反。

定量时间错误指次数或时长估计错误,例如把出现 1 次说成 2 次,或把最短说成最长。这个分类与后文数据管线的可控扰动一一对应,便于归因与度量。教学例子如下,例子不代表论文数值。

假设音频真值是先水声后狗叫,若模型只说狗叫就是遗漏,若把水声说成快门就是身份错误。若说先狗叫后水声就是关系错误,若说水声出现 3 次就是定量错误。论文强调所评测的先进模型也表现出全部 4 类。

声学接地 × 语言先验: 声学接地的分工是要求回答中的事件、顺序、次数与时长都能在音频波形中找到可感知证据,语言先验的分工是模型在声景复杂时按文本常见搭配补全情节,搭配理由是声音随时间展开且经常重叠,模型容易用流利叙事掩盖听觉缺失,组合意义在于把幻觉从一般流利但错误收窄为可核查的时间线偏离。

以下导读针对 4 类定义的示意图,先建立分类心智再进入构造。该图把 4 类并排展示,每类给出定义与基座模型的诊断示例,适合初学者逐类核对文字定义与示例差异。

看图路径: 1. 先从左到右读四个色块标题,确认遗漏、身份、关系、定量四类定义;2. 再看每类上方英文定义中对漏报、错标、顺序颠倒、计数错误的表述;3. 最后对照下方字幕、问题与回答示例中真值与模型输出的差异点

原论文 Figure 2:Four principal hallucination types observed in temporal audio reasoning: Event Omission, False…

论文图 2。原论文 Figure 2:“Four principal hallucination types observed in temporal audio reasoning: Event Omission, False Event Identity, Temporal Relation Error, and Quantitative Temporal Error.”。

看完图后应能复述每类的判定动作。遗漏看回答是否丢掉可感知事件,身份看是否有编造或错标。关系看事件先后是否被交换,定量看次数与最长最短判断是否与真值一致。后文所有偏好对与评测标注都按这 4 类生成与打标。

统一管线如何一鱼两吃?

论文提出的方法名为音频幻觉对齐,核心动作是先建共享音频问题池,再分叉出对齐视图与评测视图。共享池的输入是复杂声景音频及其字幕级描述,输出是音频问题对与每个问题关联的幻觉类型集合。音频选择偏向多事件顺序或重叠、频繁转场、时间依赖非平凡的片段。

问题生成按模板从字幕中实例化事件占位符,覆盖显式排序、时间逻辑与反事实、计数与时长比较 3 组。模板复用了公开问答与多选基准中的常见问法,以保证问题贴近真实挑战同时聚焦细粒度推理。分叉后左侧对齐视图构造偏好对,用于直接偏好优化。

右侧评测视图收集人工核验的简洁真值答案并标注幻觉类型,用于诊断基准。这种安排的理由在原文中明确写出:同一批音频问题对被两种监督格式复用,使训练惩罚的错误与评测度量的错误保持一致。

对齐视图 × 评测视图: 对齐视图的分工是产出偏好对用于训练,评测视图的分工是产出带人工核验答案与类型标注的问答基准,二者搭配的原因是共用同一音频问题池可以保证训练惩罚的错误类型与评测度量的错误类型一致,组合意义在于用一套管线同时解决监督信号与度量标尺问题。

以下导读针对管线总览图,重点看分叉前后的数据形态变化。该图顶部是音频选择与问题生成汇入共享池,中间分出左右两路,左侧经正确与拒绝候选再经人工筛选得到对齐数据。

看图路径: 1. 先沿顶部音频选择与问题生成汇入中间共享池的主箭头看流程;2. 再比较左侧对齐分支的正确与拒绝两路与右侧评测分支的人工核验一路;3. 最后确认底部两个最终数据集的产出位置与标注差异

原论文 Figure 3:The unified data construction pipeline for AHA.

论文图 3。原论文 Figure 3:“The unified data construction pipeline for AHA.”。

看完图后应抓住 3 个动作。第一,共享池只存问题与类型,不直接存最终答案,保证两视图同源。第二,对齐路的正确回答来自字幕真值,拒绝回答由外部纯文本大语言模型按分类提示生成。第三,评测路的答案必须由可感知声学证据支持,避免问题未要求的额外时间元数据。

偏好对与诊断标注分别怎么做?

对齐数据的构造称为反事实硬负例合成。对每个音频问题对,正确回答直接从真值字幕派生,保证事实准确。拒绝回答用结构化提示要求外部模型按分类制造反事实错误,例如交换两个事件的先后、修改计数、编造不存在的声音。

每个实例先生成多个候选,再由 10 名有音频理解经验的志愿者选出语言上合理但按声学证据明显错误的一个,最终形成包含音频、问题、正确回答与拒绝回答的四元组。所谓硬负例,指拒绝回答模仿正确回答的语言流利度,但在时间逻辑上严格矛盾。

反事实硬负例 × 幻觉分类体系: 幻觉分类体系的分工是把笼统幻觉拆成事件遗漏、错误身份、时序关系错误与定量时间错误 4 种可操作的扰动目标,反事实硬负例的分工是按这 4 类把真值改写成语言流利但时间逻辑矛盾的错误答案,搭配理由是只有负例与分类一一对应优化器才能获得精确惩罚方向,组合后形成针对时间接地的靶向对齐数据。

评测数据的构造复用同一批音频问题对,但监督格式不同。对其中一个子集,同样由 10 名志愿者人工核验简洁真值答案,并为每个评测实例标注其关联的幻觉类型集合。自动化偏好构造阶段使用音频时间语料的字幕对作为基础,并用外部模型实例化共享问题池。

生成提示中包含每类幻觉的详尽定义与示例,输出为结构化对象以便后处理,自动生成后人工审计会丢弃含糊或与声学证据不一致的样本。优化目标采用直接偏好优化,不需要单独奖励模型。记输入为音频与问题的组合,数据提供偏好回答与拒绝回答。

策略模型相对冻结参考模型的似然比经系数调节后送入逻辑函数取对数期望,目标是提高接地回答的似然并压低特定幻觉的似然。符号含义是策略为待训模型,参考为冻结的基座,系数控制偏离参考的程度。

\[LDPO(πθ; πref) = −E(x,r+,r−)∼Dalign\]

该公式的计算目标是让模型在同一输入下更偏好正确时间线而非被篡改的时间线,梯度路径按原文只更新低秩适配参数,参考模型冻结。监督来源是字幕真值与人工筛选的拒绝回答,未报告逐层梯度细节,解读时不从模型名称推定实现。

真正训练了什么,冻结了什么,花了多少?

训练阶段明确存在,对象是问答基座的偏好对齐,不是预训练。基础模型为 7000000000 参数规模的全模态模型,为降低计算成本采用低秩适配,只在注意力与多层感知机层附加适配参数。参考模型以 16 位精度冻结,直接偏好优化的偏离系数控制偏离程度。

训练多轮,优化器为权重解耦的自适应矩估计,实验在多块图形处理器上进行。对齐后的模型在后文简称为对齐模型。复现时需注意参数更新范围与数据来源,更新的是适配参数而非全量权重。

监督微调 × 直接偏好优化: 监督微调的分工是只给正例让模型学会流利回答,搭配原因是它缺少负约束因而压不住看似合理但与声学矛盾的说法,直接偏好优化的分工是同时给一个正确回答与一个反事实幻觉回答并拉开二者似然差距,组合意义在于把时间顺序与数量等可证伪对比信号直接变成梯度,迫使模型依据声学证据选择。

下表把关键超参数与运行条件整理成五列,便于按列核对复现动作。表前比较问题是训练条件是否可重放,公平条件是固定同一基座与同一偏好数据,指标方向是越接近原文设置越好。

阶段对象参数设置优化设置运行条件
适配训练注意力与多层感知机层秩 16,缩放 32偏离系数 0.34 卡
对齐优化策略相对冻结参考学习率 2×10 −6训练 8 轮,全局批量 1616 位精度冻结参考
数据监督正确回答对拒绝回答字幕派生正确回答人工选最具代表性拒绝回答10 名志愿者筛选与核验

表后解释主要收益与代价。收益是只训适配参数即可获得可度量的接地提升,代价是拒绝回答的质量依赖外部模型提示与人工筛选。若筛选标准漂移,偏好信号会变弱。未胜出项是原文未验证全参数训练是否更好,也未评测不同偏离系数下的稳定性边界。

在什么数据与协议上测,与谁比?

评测分为域内诊断与域外泛化两类。域内是自建问答基准,每个实例带有一或多种幻觉类型标注,采用大语言模型作为裁判,裁判可看到真值字幕并按 4 维打标模型回答。由此计算事件遗漏率、身份错误率、排序错误率与计数错误率,方向均为越低越好。

域外是公开音频基准,包括多模态音频理解测试集及其精简版、专业版与另一推理基准,指标为准确率,方向为越高越好。比较对象共 6 个,分别为基座模型、基座加直接偏好优化的对照、另外两个公开音频模型、一个音频火焰模型以及两个闭源多模态系统。

对齐模型与基座的比较条件是一致的输入与问题集合,差异仅在于是否经过本文偏好数据对齐。数据基础方面,对齐与评测同源,音频选自带字幕语料中易幻觉的复杂场景。问题模板覆盖排序、逻辑反事实、计数时长 3 组。

人工环节有两处,一处是从多个拒绝候选中选最具代表性者,标准是仅看字幕推理时合理但按声学证据明显错误。另一处是核验评测真值答案并保证简洁且有感知支持。自动评测的风险在原文中有专门失败案例。

模型把笑声说成人们大笑与字幕中的轻笑同义,但裁判未能弥合语义差距而误判为遗漏与身份错误。这提示当前幻觉基准存在误报可能,复现时应记录裁判与人工的一致率。

对齐后变好多少,哪里没赢?

主结果先看域内诊断。论文报告对齐模型在 4 维上均降低错误率,其中定量时间错误与事件遗漏的绝对降幅最大,时序关系错误几乎减半。以下导读针对四格对比示例图,每格给出字幕、问题与基座及对齐模型的回答。

该图适合逐格验证接地是否回到真值,左上为水声加狗叫,右上为船笛加咳嗽,左下为纸张摩擦加缝纫机,右下为海浪加雷声。

看图路径: 1. 先看四个面板各自的字幕与问题,确认声学真值的时间与次数;2. 再对比每个面板中基座模型与对齐模型的回答差异;3. 最后观察对齐回答在顺序与次数上如何回到字幕

原论文 Figure 1:Illustrative examples showcasing the improvements after performing the proposed AHA framework…

论文图 1。原论文 Figure 1:“Illustrative examples showcasing the improvements after performing the proposed AHA framework alignment.”。

看完图后应能说出具体动作。在左上示例中,基座重复输出相机声,对齐模型回到液体倾倒声加狗叫。在右上示例中,基座编造机动车声,对齐模型回到车辆经过声加咳嗽。在左下示例中,基座把顺序说反并引入打字机,对齐模型恢复先揉搓后缝纫机的顺序。在右下示例中,基座把各 1 次说成各 2 次,对齐模型恢复各 1 次。

域外泛化的比较问题是诊断集上的接地改善是否迁移到公开理解任务,公平条件是同一基座与同一公开测试划分,指标方向越高越好。下表引用原表矩阵,呈现复杂细粒度推理准确率,包含必要基线与实际可运行的对齐策略。

COMPLEX FINE-GRAINEDREASONINGACCURACIES (HIGHERIS BETTER)
ModelMMAU-MiniMMAU-TestMMAU-Pro
Qwen2.5-Omni (Base)70.859.564.4
Qwen-Audio-AHA (Ours)77.167.865.0

表后解释主要收益与具体代价。收益是对齐模型在精简版、测试集与专业版上均有提升,支持缓解特定幻觉有助于更广多模态推理的判断。代价是总体趋势不等于每子项都成立,原文柱状图显示少数子类别停滞或轻微下降。未胜出项是专业版上增益较小,说明迁移幅度与任务形式有关。

域内数字的比较问题是同问题集合下错误率是否下降,公平条件是同一裁判与同一类型标注,指标方向越低越好。下表把定量与关系 2 维的基线、结果与变化整理成五列,数值来自原文连续句中的逐字证据。

条件指标基线本方法变化描述
同一诊断问题集定量时间错误率69.6%52.6%降低 17.0% 对应维度
同一诊断问题集时序关系错误率30.5%15.9%几乎减半
同一诊断问题集定量与遗漏综合17.0% 和 16.8% 降幅52.6% 与 15.9% 结果侧全面下降

表后解释主要收益与代价。收益是定量与关系错误率明显下降,支持反事实硬负例迫使模型放弃语言先验的解释。代价与反例是错误身份维度降幅相对较小且绝对错误率仍高,说明身份接地仍是短板。不能把全面下降读成每维都是最优。

哪些对照支撑判断,缺了哪些对照?

论文的已验证对照包括 3 层。第一层是基座前后对照,同一模型经偏好对齐后在诊断 4 维与公开基准上同步改善,排除了仅靠换基座带来的解释。第二层是多模型横向对照,多个模型在同一诊断协议下均暴露高遗漏率。

这说明问题具有普遍性而非单个模型缺陷。第 3 层是公开基准的子类对照,柱状图按十余个子类展示对齐前后准确率,多数提升而少数回退,支持了无对齐税但非全胜的表述。以下导读针对公开测试的子类柱状图,重点看提升最大的时间事件推理与语音序列解码。

该图横轴为子类别缩写,纵轴为准确率百分比,蓝色为基座,橙色为对齐,底部标注每类变化量,适合逐类核对泛化边界。

看图路径: 1. 先确认横轴为公开测试的子类别缩写与纵轴准确率百分比;2. 再比较每个子类别上蓝色基座柱与橙色对齐柱的高低;3. 最后找出底部标注为负向的少数停滞或回退子类别

原论文 Figure 4:Categorical accuracies before and after align- ment in MMAU-test benchmark.

论文图 4。原论文 Figure 4:“Categorical accuracies before and after align- ment in MMAU-test benchmark.”。

看完图后应抓住两点。第一,多数维度对齐柱高于基座柱,尤其时间事件推理与语音序列解码提升明显。第二,少数子类别出现停滞或零点几的回退,说明总体提升不等于每组都成立。原文未报告的对照需要明确列出缺项。

未见去掉某类幻觉负例后的消融,未见不同偏离系数、不同适配秩或不同训练轮数的敏感性分析。未见仅用自动生成而不用人工筛选的对照,因此不能补写拿掉某类负例后必然怎样。

也不能从模型名称推定某超参数最优。失败条件方面,除自动裁判的语义误判案例外,原文还提到对齐模型输出更简洁且更贴近时间元数据。但简洁本身未被量化为指标,解读时应视为定性观察而非已验证收益。

在什么边界内有效,什么还没测?

有效边界首先是数据条件。音频选择依赖字幕作为音频代理,问题实例化依赖从字幕推断的事件提及,正确回答直接从字幕派生。这意味着若字幕本身漏标弱事件或时长不准,对齐信号与评测真值都会继承偏差。

其次是人工条件。拒绝候选的最具代表性选择与评测真值核验均依赖 10 名志愿者,标准强调语言合理但声学错误。复现时若换人或换标准,偏好对比的锐度会变化,监督信号的强度难以完全复制。

第三是评测条件。诊断基准用外部模型当裁判且裁判可见字幕,存在同义表达被误罚的假阳性。公开基准则多为客观题,与开放生成的幻觉率不是同一指标,数值相同也不是同一含义。百分点与相对百分比不同。

本文所有降幅均为百分点差值,不应读成相对下降比例。未测量项包括推理延迟、输出帧率、训练总耗时与显存峰值,因此不承诺这些量得到改善。适用人群是能获取字幕语料并承担人工筛选的研究组。

若只有纯音频而无可靠字幕,管线第一步就需要补验证。总体判断用分级表达,论文直接报告的是 4 维错误率下降与公开准确率小幅提升。有限解释的是接地改善有助于推理泛化,待验证的是该机制在音乐、语音重叠与长时监控等更复杂场景下的稳定性。

要复现先做什么,需要哪些信息条件?

复现先做三件事。第一,重建共享音频问题池。从带时间字幕的语料中筛选多事件、重叠与转场片段,按显式排序、时间逻辑反事实、计数时长 3 组模板生成问题。并为每题标注关联的幻觉类型,保证训练与评测同源。

第二,重建偏好对。正确回答保持严格接地且不添加问题未要求的时间元数据,拒绝回答按 4 类分别改写顺序、数量或身份。再经人工选出每题一个最具代表性的拒绝回答,丢弃含糊样本,保证语言流利但逻辑矛盾。

第三,按原文超参数做适配对齐。冻结参考模型,适配秩与缩放、偏离系数、训练轮数、学习率与全局批量均按训练节表格固定。在多卡上运行并固定随机种子与数据划分,避免把适配训练误读为全参数微调。

评测时需同时跑诊断协议与公开协议,诊断侧用同一裁判提示与同一类型标注计算 4 类错误率。公开侧按官方划分计算准确率并保留基座与对齐两个实际可运行策略,搜索最优或事后最优值另行标明。

信息条件方面,原文给出了适配目标层、优化器类型与主要超参数,但未给出数据规模、问题模板全量、人工指南全文与裁判提示全量。资源状态按本次核验,未发现可用链接,不得声称代码权重或数据已公开,复现应按自建管线理解成本。

何时值得尝试,一句话如何带走?

当你的音频问答系统出现流利但时间线不对的错误,且错误集中在漏报弱事件、认错声音、说反先后或数错次数时长时,值得尝试本文思路。用分类把错误拆成可改写的扰动,用反事实硬负例把正确时间线与被篡改时间线的对比做成偏好对。

再用小系数偏好优化把接地要求压进适配参数,训练时只更新适配层而冻结参考模型。带走的判断是,该方法在论文条件下显著降低诊断幻觉且未观察到明显的对齐税,并在公开基准上获得小幅泛化。

但身份维度的残留错误、自动裁判的语义误判与字幕代理偏差仍在,复现时应先固定原文超参数与人工标准。再补留一消融与人机一致性验证,避免把相关性读成因果。

初学者复述时可按样本路径背诵。输入为音频加问题,中间经共享池分出偏好对与诊断标注,训练经偏好优化更新适配参数。输出为更简洁且顺序数量回到声学证据的回答,度量看诊断错误率下降与公开准确率小幅上升,限制看数据、人工与评测 3 类条件。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总