英文题目:Temporal Precision Matters: Brain-Tuning Speech Language Models with Millisecond-Resolution Neural Signals

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.1911

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#SFT #语音大模型 #脑信号 #语音 #言语神经解码

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.5/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhejun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenqing Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Haozhe Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Lin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Lei Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

针对功能磁共振约2 s积分将声学语音与高阶语言加工抹平为单一监督信号、难以定向训练的问题,该工作以词起始锁定的毫秒级皮质电图高频伽马响应为输出目标,用连续语音输入预测全时空神经活动。方法链分三步衔接:首先将词起始前30 s音频送入冻结特征提取器的语音编码器得到各层隐状态,为词级建模提供长上下文;接着对末10帧跨层拼接并均值池化形成词级向量,使上一步的帧级输出压缩为固定维表示后进入预测头;然后经线性头以均方误差拟合对应窗口内的高频伽马功率,并按语音窗口与语言窗口分开监督,使早期声学语音编码与晚期词法语义编码进入不同损失。相对已有脑调优的关键机制差异在于保留完整时空动态而非时间平均,并以约150 ms为界实现阶段靶向,使毫秒级时序结构本身成为额外训练信号。在跨被试评测设置下,句型预测任务的性能提升为31%,高于音素与情感识别任务4–7%的提升幅度。语言窗口调优在语言响应区的增益更大且下游语音理解性能未受损,表明时序分工具有实际意义。结论适用边界受限于9人约4.5 h单播客英语听理解与1268电极临床覆盖,跨被试、跨语言与跨范式外推尚未验证,全部三架构实验的训练成本约为330 GPU小时。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么功能磁共振的脑调优留下了时间问题?

输入是连续讲述音频,目标是让语音语言模型既能转写识别又能预测人脑活动。已有脑调优做法是拿功能磁共振信号做微调,论文报告它能提升语义理解和下游表现。但功能磁共振每个采样把约 2 秒神经活动积分成一个值,不同加工阶段被混在一起,训练时无法指定到底在学早期声学语音还是晚期语言整合。对于刚入门的读者,白话说就是监督信号太慢太粗,只能告诉模型这段话大致对应这片脑活动,不能告诉它第几十毫秒发生了什么。

电皮层脑电的优势是毫秒精度与高信噪比,且已有编码研究显示言语编码峰在词 onset 后约 54 毫秒,语言编码峰在约 247 毫秒,中间约 200 毫秒的分离是功能磁共振看不见的。本文要回答的就是能否把这种时间精度变成可训练的监督增益。

语音语言模型 × 脑调优: 语音语言模型负责把 30 秒音频转成多层语义声学表示,脑调优则要求它额外预测人脑记录的高频信号;二者组合才把听觉输入与神经时间过程配成可监督的词级样本,前者提供表示基础,后者提供时间精度的监督目标。

本文默认从原文独立写作,不继承其他解读。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开,原文中出现的代码链接本次未能确认可达。后续所有数字只引用原文连续证据,不做额外推断。

同输入同目标的已有路线差在哪里?

同输入同目标的直接前作是语音模型的脑调优。施瓦茨等人先用语言模型与功能磁共振做编码微调,穆萨等人把它扩展到语音语言模型并报告下游提升,后续有多被试训练双语数据多模态音视频与低秩适配等变体。这些工作共享同一运行阶段,即以预测神经响应为主要训练目标,用神经编码对齐度与下游任务衡量效果。本文与它们的区别不在目标而在监督来源的时间粒度,从约 2 秒的血氧信号换成毫秒级颅内高频信号。

另一类相关工作是认知特征注入与关联记忆,前者在预训练中加入眼动或脑电特征,后者不直接做神经监督,机制不同故不能当同条件基线比较。时间动态方面的神经科学证据是另一条线,混合编码层次研究显示模型浅层对齐早期神经响应、深层对齐晚期响应,播客电皮层脑电数据集则提供了自然听故事的公开资源。已有工作多把时间结构用于评测对齐,本文把它转为训练信号,并设计两个时间窗分别监督,这是方法上的新增动作。

任务到底要模型学会什么?

任务是词级时空预测加对齐评测加实用检验三件事。给定 30 分钟播客音频与词级时间戳,每个词构成一个训练样本,模型要根据词 onset 前的长音频上下文预测该词对应时间窗内所有电极的高频功率矩阵。评估时不直接用训练投影头,而是冻结模型抽表示,用岭回归重新拟合编码模型并在留出测试词上算预测与真实神经响应的皮尔逊相关,平均到全部电极或语言响应区。

实用检验则冻结表示加线性探针,做音素多标签分类、音素句型三分类与情绪六分类,报告宏平均值。举例只是帮助理解流程,例子说若某词在第 100 秒开始,模型看的是到该词后 200 毫秒为止的 30 秒音频,预测的是该词前后两个 200 毫秒窗之一的神经矩阵,评估时再换一套回归器检验表示是否更像脑。原文没有给出新的解码生成任务,所有结论都限定在这 3 类评测内。

电皮层脑电调优的全景是什么?

全景可以沿一个词走完。音频侧取以词 onset 加 200 毫秒为终点的 30 秒上下文,送入语音编码器。编码器是 12 层变换器,隐藏维度 768,微调部分约 95 到 102 兆参数。基础版波形模型与自监督掩码模型先经卷积特征提取器得到 20 毫秒间隔的帧特征,语音识别模型则把 30 秒转成对数梅尔谱。按前人做法,卷积特征提取器冻结,只调变换器编码器,语音识别模型只调编码器而解码器冻结。

每层取最后 10 帧做均值池化再跨 12 层拼接,得到高维向量,经线性投影预测电极数乘 102 时间点的神经矩阵,损失是批量均方误差。神经侧以词 onset 为锚点切出两个 200 毫秒窗,言语窗覆盖减 50 毫秒到加 150 毫秒,语言窗覆盖加 150 毫秒到加 350 毫秒,分界 150 毫秒约取两个编码峰的中点。每个被试单独训练,因为临床植入导致电极数从 72 到 235 不等。

言语窗口 × 语言窗口: 言语窗口负责捕捉词 onset 附近偏早的声学语音编码,语言窗口负责捕捉偏晚的高阶语言编码;二者以 150 毫秒为界分开正是因为编码峰值分别在约 54 毫秒和约 247 毫秒,搭配使用才能把不同加工阶段变成可分别监督的训练条件。

下段导读对应方法总览图,重点是音频长上下文与神经短窗口如何配对,以及多层拼接与投影如何把表示变成时空矩阵,请按观察动作依次查看。

看图路径: 1. 先沿左上词对齐音频经特征提取器到 12 层变换器的主路径看表示流向;2. 再看每层最后 10 帧如何经均值池化与拼接形成向量 z;3. 对照右上神经响应时间轴上言语窗与语言窗的起止位置;4. 最后看投影层同时指向言语与语言两路记录与预测波形的损失闭环

原论文 Figure 1:Overview of the temporally targeted ECoG-tuning framework.

论文图 1。原论文 Figure 1:“Overview of the temporally targeted ECoG-tuning framework.”。

该图显示左上两条词对齐音频分别标注言语窗与语言窗走向,中间蓝色特征提取器带冻结标记、橙色 12 层变换器带训练标记,右侧神经响应曲线用青色与粉色区分两个窗口,底部投影层把拼接向量映射为记录与预测波形的两路损失。这种画法把长音频上下文压缩成最后 200 毫秒表示、再展开成多电极多时间点目标的计算路径讲清楚了,也说明 2 次训练分别只监督一个窗口,而非 1 次同时监督两个窗口。

表示聚合与投影如何保留时间?

组件分工需要先说清。特征聚合负责把时间压缩但不丢层级信息,线性投影负责把压缩后的向量展开成神经时空维度,均方误差负责逐电极逐时间点惩罚偏差。原文刻意用线性投影与均方误差以隔离结构复杂度,让增益更直接归因于神经信号,而非复杂解码器。训练时每个词的目标是电极数乘 102 的矩阵,102 来自 200 毫秒按 512 赫兹采样,输入音频采样 16 千赫,批量 32,编码器学习率 1 乘 10 的负 5 次方,投影头 2 乘 10 的负 5 次方,权重衰减与梯度裁剪与线性预热加衰减按附录配置,验证相关连续 5 轮无提升则早停。

时空预测 × 时间平均: 时空预测要求模型同时复现电极维与 102 个时间点维的完整矩阵,时间平均则把 200 毫秒压成一个均值向量;前者保留毫秒动态,后者只保留空间模式,对比二者才能分离时间结构本身的训练价值。

音频上下文的截取方式是原文明确给出的实现,先解释符号与输入再看计算目标。符号中大写字母表示整段播客波形,小写下标表示当前词,增量固定 30 秒,终点为词 onset 加 200 毫秒,起点取 0 与终点减增量的较大值以处理开头不足 30 秒的情况。

\[Aw = A[max(0, te −∆) : te]\]

聚合后向量的维度是层数乘隐藏维度,12 乘 768。投影把该向量线性映射为电极数乘时间点数的预测矩阵,偏置逐目标元素相加,训练只更新编码器与投影头参数。

\[ˆEw = Wz + b ∈RN×K\]

这种设计保留了毫秒动态,因为目标矩阵的每一列都是一个真实采样时刻的高频功率,而不是先平均再预测。若换成时间平均对照,目标就退化为电极维向量,时间维信息被显式丢掉,后文消融正是靠这个对比量化时间价值。

训练按什么协议更新与停止?

训练协议是分被试有监督回归。数据按 8 比 1 比 1 切分为训练验证与留出测试,词级样本每被试约 5000 个,30 分钟音频按词切分可得约每分钟 170 个样本,远密于功能磁共振的约每分钟 30 个。优化器用亚当,超参数贝塔 1 为 0.9 贝塔 2 为 0.999,编码器与投影头用不同学习率,最大 30 轮,早停看验证相关,最小提升阈值 0.001,训练验证差距超过 0.03 判为过拟合。每次迭代对批量内每个词抽音频窗与神经窗,前向得到各层隐状态,池化拼接投影后算批量均方误差,再反向更新编码器与投影头。

原文还设置 4 个对照以分离监督来源,块置换打乱音频神经对应但保留统计特性,时间平均压掉动态,大模型蒸馏用同家族约 1,000,000,000 参数表示为目标,大语言模型蒸馏用文本表示为目标。损失函数选择经预实验验证,均方误差在脑对齐与下游上优于负相关损失与余弦加均方混合损失,故主实验统一用均方误差。跨被试验证把 9 人 1268 电极拼成统一目标空间共用投影头,用于检验增益是否依赖单人优化。

数据评估与成本按什么条件测?

数据用播客电皮层脑电数据集,9 名被试听 30 分钟播客共 5137 词,质控后保留 1268 电极,总通道 1455 中剔除无定位噪声与非脑通道。预处理沿用数据集提供的高频流程,重采样 512 赫兹去尖峰共平均重参考,陷波去除工频及其谐波,带通 70 到 200 赫兹后希尔伯特包络再按电极标准化。电极按蒙特利尔神经学研究所空间映射到格拉泽分区,语言响应区包括颞中回额下回角回额中回颞上回排除初级听觉区与颞极。

评估分两套,脑对齐在测试分区做 10 折时间连续交叉验证防自相关泄漏,每层每电极独立岭回归,正则在对数网格中选,指标是预测与真实响应的皮尔逊相关,再按电极平均。下游用冻结表示每层训线性分类器再跨层平均,音素用听力数据集 39 音素多标签,句型分方言平衡自然 3 类,情绪用 91 人 7442 片段六分类。硬件为双 24 吉字节图形处理器,单模型平均约 2 小时,每架构约 112 图形处理器小时,三架构约 330 小时。

编码对齐 × 线性探针: 编码对齐用岭回归把冻结的模型表示映射到神经响应并算皮尔逊相关,线性探针则把同类冻结表示映射到音素句型情绪标签并算宏平均;前者检验像脑,后者检验有用,二者分工才能判断对齐增益是否以牺牲实用为代价。

编码对齐的电极级定义是原文明确给出的计算,先看符号再看聚合。符号中预测与真实都是跨测试词的向量,相关按电极计算,层间对齐再跨折平均,总体对齐再跨电极平均,语言区对齐只平均落入语言区的电极。

\[rn = corr(ˆen, en)\]

下表把数据与训练条件的关键配置集中呈现,用于核对复现时的采样率窗口长度划分与优化器设置,阅读时注意单位与聚合对象不要混淆。

条件样本神经目标划分优化设置
单被试词级约 5137 词每人约 5000 样本70 到 200 赫兹高频功率电极数乘 102 点训练 80 验证 10 测试 10编码器 1 乘 10 的负 5 次方投影头 2 乘 10 的负 5 次方耐心 5
跨被试拼接9 人共 1268 电极同上统一目标空间同上时间连续 10 折同上共享投影头
对齐评测测试词岭回归预测响应跨折平均再跨电极平均正则网格 10 的负 4 到 10 的 4 次方
下游探针音素句型情绪冻结表示加线性分类器跨层平均宏平均标准测试划分
成本三架构单模型约 2 小时每架构约 112 图形处理器小时共约 330 图形处理器小时

该表说明复现先要准备词时间戳与 512 赫兹高频包络,再按 30 秒上下文与 200 毫秒神经窗配对,代价是电极数越多投影头越大,跨被试时 1268 维输出显著增加显存与时间。未报告的是推理延迟与逐词解码帧率,训练成本不能直接当部署开销。

脑对齐与下游到底提升了多少?

首要问题是电调优是否提升脑对齐,与谁比条件是否一致。比较对象包括预训练基线、置换对照、时间平均对照、大模型蒸馏与文本大模型蒸馏,指标都是留出测试上的皮尔逊相关,方向越大越像脑。原文报告在 3 个架构上一致提升,语音识别模型增益最大,绝对提升约 0.062,效应量 0.72,显著性小于 0.001,自监督 2 模型提升约 0.04 到 0.06,显著性小于 0.05,且均优于置换对照,说明需要正确刺激对齐而非任意神经统计。

蒸馏对照上,电调优优于同家族大模型蒸馏与文本表示蒸馏,语音识别与掩码模型的效应量分别在 0.71 到 0.79 与 0.91 到 1.03 区间,支持神经监督提供了扩参数与纯文本不易捕获的信息。层间模式显示增益贯穿 12 层,语音识别模型在 9 到 10 层峰值提升约 50%,另 2 模型分布更均匀,早期层亦为正,说明影响不只在深层。

下段导读对应脑对齐主结果图,重点是柱状高度层间曲线分离与提升率差距,请按动作观察后再读解释。

看图路径: 1. 先看首行三组柱状图中电调优与预训练基线及时间平均置换对照的相对高度;2. 再看中行层间曲线中实线彩色与灰色虚线的全层分离;3. 最后看末行提升率曲线中实线与虚线的层间差距是否持续为正

原论文 Figure 2:ECoG-tuning significantly improves brain alignment across all three SLMs (∆r up to +0.062,…

论文图 2。原论文 Figure 2:“ECoG-tuning significantly improves brain alignment across all three SLMs (∆r up to +0.062, Cohen’s d = 0.72).”。

该图首行显示电调优柱高于预训练与时间平均及置换柱,中行实线彩色全程位于灰色虚线上方,末行实线提升率全程高于虚线时间平均。像素上语音识别模型的层间提升曲线峰值最陡,另 2 模型曲线更平坦但仍保持正差距,误差带为 95% 置信区间。这种全层全窗一致分离支持增益不是单层偶然,但也提示架构不同则层分布不同,不宜做严格功能层级解读。

下游问题是增益是否以实用为代价。3 个任务上电调优总体持平或提升,音素预测最一致且优于蒸馏对照,句型预测 3 模型优于预训练、其中 2 模型优于蒸馏,情绪识别 2 模型提升、一模型持平,原文解释情绪更依赖韵律而自监督预训练已较好。下段导读对应下游柱状图,重点是任务行与模型列的交叉比较。

看图路径: 1. 先按行区分音素预测句型预测情绪识别三组任务的纵轴量级;2. 再按列比较三个模型下电调优柱与预训练柱的高低;3. 最后观察蒸馏对照柱在部分任务上明显偏低的位置

原论文 Figure 4:Downstream task performance of ECoG-tuned models and their comparisons.

论文图 4。原论文 Figure 4:“Downstream task performance of ECoG-tuned models and their comparisons. Bar colors/styles as in Figure 2 a,d,g. Error bars: 95% CI across layers and participants.”。

该图显示首行音素任务电调优柱普遍略高于预训练,中行句型任务自监督模型的电调优柱优势更明显,末行情绪任务掩码模型的电调优与预训练接近而蒸馏对照在部分格明显偏低。像素细节支持论文的判断,即神经监督没有损害实用且常有小幅增益,但不同任务幅度不同,不能把总体趋势推广为每层每被试必胜。

本节第一张数字表直接选用原文层间提升率矩阵,用于核对时间平均对照在每一层都被完整动态超越,阅读时注意这是相对预训练基线的层间提升百分比而非原始相关。

The patternof task performanceprovidessug- most linguistically demanding task—while Wspeech
Emotion Wlang0.4440.5020.495
Wspeech0.4580.5100.499
Phoneme Wlang0.3990.4620.466
Wspeech0.4030.4650.467
Sentence Wlang0.2640.5140.485
Type Wspeech0.2510.5120.481

该表显示 12 层中电调优列在言语与语言两窗下逐层高于时间平均列,语音识别模型高层差距更大,自监督模型差距较均匀。代价是完整时空目标维度为电极数乘 102,投影参数与显存高于时间平均向量目标。未胜出项是时间平均本身亦优于预训练,说明空间模式已有价值,时间结构是额外增益而非全部来源。

本节第二张表把可运行策略的绝对增益与时间结构增益集中对比,用于回答调优值多少、时间值多少,指标方向均为越大越好,显著性与效应量一并保留。

模型对比脑对齐绝对增益时间结构额外增益蒸馏对比效应量
语音识别模型电调优相对预训练约 0.062 相关约 17% 相对时间平均约 0.71 到 0.79 优于大语音模型
波形自监督模型电调优相对预训练约 0.04 到 0.06 相关约 7% 到 8% 相对时间平均约 0.91 到 1.03 优于文本大模型
掩码自监督模型电调优相对预训练约 0.04 到 0.06 相关约 7% 到 9% 相对时间平均同上区间优于文本大模型
3 个模型置换相对完整完整显著更高需刺激对齐显著性小于 0.05

该表的主要收益是电调优超越预训练与两种蒸馏,且完整动态超越时间平均与时间打乱。具体代价是增益幅度因架构而异,语音识别模型时间增益最大,自监督模型较小,且所有比较都基于 9 人单播客,语言多样性不足可能低估句法类任务的上限。

时间精度与窗口位置各自贡献了什么?

消融围绕两个问题展开,毫秒动态是否多余,窗口放在早还是晚是否重要。测法是固定其他条件,只把目标换成时间平均或电极内时间打乱,或把监督窗换成言语窗与语言窗,指标仍是脑对齐相关与语言区增益。完整动态相对时间平均平均高约 17%、7% 到 8%、7% 到 9%,在语音识别与掩码模型上显著,层间逐层成立。时间打乱保持目标维度不变但破坏时序,结果在 3 模型上均低于完整,效应量 0.30、0.28、0.46,显著性分别 0.003、0.005 与小于 0.001,说明优势来自时序本身而非维度变大。

窗口分离上,语言窗在语言响应区的增益更大,语音识别模型语言窗绝对提升 0.054 相对 24.7%、言语窗 0.043 相对 15.2%,掩码模型语言窗 0.058 相对 22.9%、言语窗 0.033 相对 1.4%,波形模型语言窗 0.045 相对 10.0%、言语窗 0.021 相对 7.7%,其中 2 模型显著。空间图显示两窗都在全脑有增益,但语言窗在额下回与额中回等词汇语义区更强,与早期声学峰晚期语义峰的神经科学发现一致,但原文也提醒该区间残余声学相关不能完全排除。

刺激对齐 × 置换对照: 刺激对齐指音频词与神经窗在时间上正确配对,置换对照通过块置换打乱这种配对但保留信号统计;保留配对才涨、打乱配对不涨,才能把增益归因于真实神经时间信息而非任意神经样噪声。

窗口时长敏感性固定中心在词后 50 毫秒比较 100、200、300 毫秒,3 模型均以 200 毫秒最高,支持默认选择。联合双窗等权训练优于预训练但不超最优单窗,如何加权或课程调度仍是开放问题。损失函数预实验显示均方误差在脑对齐与下游上最好,故主实验统一用它。失败条件方面,置换对照与打乱对照的下降正是反证,说明拿掉刺激对齐或时序必然损失增益,但原文未报告去掉空间模式会怎样,不宜外推。

哪些边界会限制结论的外推?

直接限制先说数据。播客数据集虽稀有但仅 9 人 30 分钟单播客,语言多样性与句法覆盖不及 27 故事的功能磁共振数据集,句型任务增益较小可能与此有关。电极按临床需要植入,覆盖可变且不完整,按兴趣区调优值得未来探索。模态比较上,电皮层脑电与功能磁共振在信号起源时空尺度与数据集上根本不同,原文明确视为互补而非竞争,联合两者是开放方向。方法边界上,层功能层级解读需谨慎,单层可能混合多级加工。

双窗联合、跨被试、多语言与非侵入脑电扩展都只做了初步或未做,脑电信噪比更低需专门特征工程。统计上主结果报告了效应量与显著性,但未测量误判率延迟与部署成本,不能承诺这些量同步改善。相关性不等于因果,脑像不等于脑用,下游小幅增益的机制仍需因果验证。

要复现先准备什么与先跑哪一步?

复现先做数据与环境核对。数据需播客电皮层脑电的词时间戳与 512 赫兹高频包络,按 70 到 200 赫兹带通与标准化流程处理,电极按好坏与定位筛选,映射到格拉泽分区以便语言区分析。模型用基础版波形与掩码模型及小语音识别编码器,冻结特征提取器,只训 12 层编码器与线性投影头。

先跑单被试单窗 200 毫秒基线,音频取 30 秒上下文到词后 200 毫秒,每层最后 10 帧池化拼接,批量 32,学习率按编码器与投影头分别设置,早停耐心 5,再跑时间平均与块置换对照以确认时间增益与对齐必要性。通过后再试语言窗与言语窗对比与时间打乱对照,最后做跨被试拼接与下游线性探针。原文超参数与计算预算已在前表交代,代码链接本次未能确认可达,因此应以论文附录的预处理与训练设置为准,不宜假设权重与脚本可直接下载运行。

验证时保留数据集模型基线阶段指标单位与聚合对象,百分点与相对百分比不要混用,不同指标差值不要并列比较。

何时值得尝试这种时间靶向监督?

当监督信号本身有明确时间分层且任务需要区分早期声学与晚期语义时值得尝试,例如语音模型的音素精化与高阶语言区对齐。做法是先用编码峰或先验确定窗口边界,再用完整时空目标训练并以时间平均与打乱为必备对照,只有完整显著高于两者才算证明时间价值。若只有非侵入脑电或小数据,应先解决信噪比与样本多样性,否则 200 毫秒窗的增益可能被噪声淹没。

何时不值得是当目标任务只依赖长时韵律或句法多样性而数据单一时,单播客的提升可能有限,此时扩大语料或联合功能磁共振的空间覆盖更优先。总体上,该工作提供了电生理可做脑调优的初步证据,把何时编码的神经科学发现转成了何时监督的训练策略,但结论限定在 3 个模型与 3 类探针任务内,跨模型跨语言与实时部署仍待验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总