📄 对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化

英文题目:Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

一句话:论文把语义矛盾的音视频配对当作组合推理探针,用三级时序对齐与对数透镜审计检验 VideoLLaMA 2-7B-AV,发现时序对齐只会搬运答案偏置而无法把准确率抬离随机线,承诺层稳定在 25.5±1 层的晚期固化覆盖了 15 至 18 层已出现的冲突检测信号。

标签:#音视频理解 #多模态模型 #参数高效微调 #可解释性

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5

👥 作者与机构

  • Adarsh Sudheer:Independent Researcher
  • David Li:Independent Researcher
  • Omar Elbanna:Independent Researcher
  • Ishaan Kodarapu:Independent Researcher
  • Arjun Bahuguna:Independent Researcher
  • Vasu Sharma:Independent Researcher

💬 毒舌点评

把音视频矛盾包装为组合泛化探针并用对数透镜定位到 25.5±1 层的晚期固化,为先验主导提供了可复现的机制叙事;代价是行为评估依赖精确字符串匹配的 Yes/No 子集且机制审计仅在 100 样本上以未校准阈值完成,对齐流水线又未做序列长度等混淆因素对照,结论更多是相关性描述而非因果验证。

📌 核心摘要

论文研究音视频大语言模型(Audio-Visual Large Language Model,AV-LLM)在音视频语义矛盾下的组合失效,提出先验主导(prior dominance)假说,即模型在晚期层固化为内部偏好的回答模式而非真正比较两路证据。以 VideoLLaMA 2-7B-AV 为审计对象构建三级对齐流水线,并以现成 InternVideo2 作外部行为基线,配合对数透镜(logit lens)与注意力头消融定位承诺层。与提出新对齐模块的工作不同,本文不追求增益而是将矛盾样本作为组合推理探针,检验时序对齐能否转化为矛盾解决能力。主结果显示 InternVideo2 在完整 AVHBench 上为 60.1% 而在矛盾子集跌至 27.8%,VideoLLaMA 2 三种配置在可评分 Yes/No 子集上准确率徘徊在 49.0%至 50.2% 且承诺层稳定在 25.5±1 层。该现象对具身与多传感器部署具有警示意义,但证据目前局限于单一架构的晚期解码相关性,尚未通过因果干预证明可控性。

🔗 开源与复现资源

  • 代码:https://github.com/AdarshSudheer09/AVHBench-dmai,论文中明确该仓库包含 mechanistic audit 与 behavioral evaluation 的复现代码和数据
  • 模型权重:论文中未提及具体 HuggingFace 或 ModelScope 权重链接,实验使用的模型为 VideoLLaMA 2-7B-AV 与 InternVideo2,仅给出论文引用未提供权重下载地址
  • 数据集:AVHBench 全量数据集约 6300 样本,AVCD 数据集,以及从二者通过自动化过滤构建的对抗冲突子集 1281 样本,冲突样本示例为 dog 视觉搭配 car 音频,数据集获取方式为通过上述 GitHub 仓库提供,论文中未提及独立数据集下载链接或开源协议
  • Demo:论文中未提及
  • 复现材料:论文在正文与附录中提供复现要点,包括基于 VideoLLaMA 2-7B-AV 的 3 种对齐配置 ACTC、TATI 与 AMD,使用 LoRA adapter 联合训练定制 vision projector 与 audio projector,batch size 为 64,每视频采样 16 帧,TATI 采用 1:1 时序交错并添加共享可学习 temporal embedding \(E_{temp}\),评估采用 temperature 为 0.01 的 greedy decoding 并通过 exact string match 计算 Yes/No 准确率,mechanistic audit 覆盖 layer 14 至 27 的 attention head 并通过 mean ablation 计算 \(\Delta\) 指标,logit lens 覆盖全部层并定义 snap layer \(\ell^*\) 约为 25.5 ± 1,附录 A 包含校正 \(E_{temp}\) 后的 AV survival 分析
  • 论文中引用的开源项目:VideoLLaMA 2-7B-AV (Cheng et al., 2024)、InternVideo2 (Wang et al., 2024)、AVHBench (Sung-Bin et al., 2025)、AVCD (Jung et al., 2025b)、AVicuna 及其 AVTI 时序交错机制 (Tang et al., 2024),论文中均仅以文献引用形式提及,未提供上述项目的具体 URL 链接

🧭 深度解读

为什么听见和看见对不上,比听不见更考验模型?

想象一段监控:画面里是一只狗在吠,音轨里却是汽车引擎的轰鸣。单看任何一路,模型都能说出合理描述;但要回答“音视频是否匹配”,就必须同时抓住两路证据,把它们暂时绑在一起,再判断是否兼容。很多评测只奖励“对得上”的样本,模型靠单模态的共现捷径就能拿分,矛盾样本才逼它做真正的跨模态比较。

这个区别对刚入门的同学很重要。音视频大语言模型,英文叫 Audio-Visual Large Language Model,简称 AV-LLM,本质是把视频帧和音频片段各自编码成词元,再交给同一个自回归语言模型去生成答案。模型学会了流畅续写,却不一定学会在生成前完成证据绑定。论文关心的正是这种落差:当两路信号同步却语义不兼容时,模型是比较后再回答,还是直接沿用内部更顺手的回答模式。

这篇工作站在哪条研究脉络上?

过去两年,音视频领域的评测围绕三件事展开:接地、幻觉和时序同步。AVHBench、AVCD 等基准先把“是否幻觉”量化出来;AVicuna 等方法则用交织、时间嵌入等方式把音视频在序列层面绑得更紧。另一条线在解码时做自适应纠偏,试图在生成阶段压制幻觉。共同的隐含假设是:对齐越强,推理越好。

这篇论文没有再叠一层对齐模块,而是把矛盾本身当探针。它把 AVHBench 和 AVCD 中严重矛盾的配对抽出来,追问一个更窄的问题:时序对齐的压力,能否转化为矛盾解决能力?与此同时,它引入可解释性工具来定位答案何时固化,而不是只报告准确率升降。这种“行为探针加机制审计”的组合,让它更像 1 篇诊断性的方法研究,而非刷榜工作。

论文如何定义一次成功的组合判断?

作者把 1 次成功的组合判断拆成 4 步有序任务:从音频流 X_a 提取音频证据,从视频流 X_v 提取视频证据,暂时绑定 2 流,最后判断兼容性。输入是同步但语义不兼容的两路信号,输出是一个 Yes/No 的匹配判断,以及模型在每一层对 Yes 与 No 的概率轨迹。

这个定义把评估从“像不像”拉回到“是否比较过”。如果模型只在某一路找到熟悉模式就直接回答,4 步中的绑定与判断就被跳过了。论文的全部流水线都围绕这个操作化定义展开:前端构造矛盾样本并规定计分规则,中间用 3 级对齐去考验绑定是否发生,后端用逐层透镜去看答案何时被写定。

一条从信号到答案的流水线长什么样?

流水线不是单一新模型,而是多阶段的评估与审计系统。视频帧与音频先经各自编码器得到特征,再经投影器映射到 3584 维的共享嵌入空间,形成视觉词元序列与音频词元序列。随后有两种组织方式:一种是前缀拼接,另一种是逐帧交织并叠加时间信息。组织好的序列送入冻结的语言模型主干,训练时只有投影器与低秩适配器参与更新,推理时残差流被分流到两个审计分支。

审计分支一是逐层对数透镜,英文叫 logit lens。它把每一层的残差流 h^{(\ell)} 经过最终的 RMSNorm 与解嵌矩阵 W_U 投影回词表分布,用来追踪 Yes 与 No 何时可被线性读出。形式上记为

\[\hat{p}^{(\ell)}=\mathrm{softmax}\!\bigl(W_{U}\,\mathrm{RMSNorm}(h^{(\ell)})\bigr)\]

其中 h^{(\ell)} 是第 \ell 层的残差流,W_U 是最终解嵌矩阵,\hat{p}^{(\ell)} 是该层的预测分布。快照层,英文叫 snap layer,记作 \ell^*,定义为顶层预测首次稳定到最终层且不再改变的最早层。

审计分支二是注意力头消融。研究者在 14 至 27 层之间逐头做均值替换,观察幻觉率的变化 \Delta,再用干净样本到矛盾样本的激活补丁检验泛化。整条流水线的设计取舍很清晰:用显式对齐与随机遮蔽去检验“对齐能否修复组合”,代价是交织带来的序列长度变化没有单独对照,审计也未在微调后的配置上重复。

三级对齐各自在做什么,为什么这样分工?

第一级叫音频条件化词元拼接,英文 Audio-Conditioned Token Concatenation,简称 ACTC。它的输入是 BEATs 抽取的音频特征与视觉词元,输出是把音频投影后与视觉前缀顺序拼接的长序列。它承担基线职责:让模型同时看到两路信息,但不强制时序对应,模型仍可自由偏向任 1 模态。

第二级叫时间戳感知词元交织,英文 Timestamp-Aware Token Interleaving,简称 TATI。它借鉴 AVicuna 的 AVTI 思路,对 16 帧采样视频做 1:1 同步交织,每帧视觉词元旁就放对应音频词元,并为同一时间步 t 的 2 模态叠加同一个可学习时间嵌入 E_{temp}。形式为

\[\tilde{v}_{t}=v_{t}+E_{\text{temp}}(t),\quad\tilde{a}_{t}=a_{t}+E_{\text{temp}}(t)\]

其中 v_t 与 a_t 是原始视觉与音频词元,\tilde{v}_t 与 \tilde{a}_t 是叠加时间嵌入后的版本。它的职责是强制逐帧同步处理,减少时序混淆,检验“更紧的对齐是否带来更好的比较”。

第 3 级叫非对称模态丢弃,英文 Asymmetric Modality Dropout,简称 AMD。它在有监督微调时以概率 P_{mask} 随机遮蔽整段视觉或音频词元,期望抑制单模态捷径。它的职责是正则化,但作者也点出反作用:随机遮蔽可能教会模型“只看一路也能答”,反而绕过矛盾检查。附录里还有一个余弦相似度代理 s_{AV}(\ell),用于探测去掉 E_{temp} 后的音视频表征相似度,作者明确只把它当启发式参考,不作为核心证据。

原论文 Figure 1:The Logit Lens capture pipeline and snap layer detection.

论文图 1。这张图来自原论文 Figure 1:,图示内容为“The Logit Lens capture pipeline and snap layer detection.”。请结合“三级对齐各自在做什么,为什么这样分工?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

模型是怎么训练的,哪些细节论文没有展开?

这不是从零训练新主干的工作。所有 3 级配置都冻结 VideoLLaMA 2-7B-AV 主干,只训练定制的视觉与音频投影器以及低秩适配器,英文 Low-Rank Adaptation,简称 LoRA。监督微调在 8 张 A100 上以批量 64 进行,视频每样本采样 16 帧,共享嵌入维度为 3584,TATI 采用 1:1 交织并叠加共享时间嵌入。

论文未披露的细节不少:优化器、学习率、预热与调度、训练步数或轮数、LoRA 的秩与缩放系数、AMD 的具体 P_{mask} 数值、训练时长与权重衰减等均未给出。损失函数也未写明公式与权重,按常规推断为自回归语言建模损失,但原文没有提供可复核的配置。外部行为基线 InternVideo2 则直接使用现成权重,未做微调。

推理与计分侧反而写得很细:贪婪解码温度 0.01,Yes/No 准确率按精确字符串匹配计算,未命中 Yes 或 No 的生成单独计为未评分。对数透镜覆盖全部层并在 1281 条矛盾样本上投影,头消融覆盖 14 至 27 层并以 \Delta 的阈值正负 0.01 判定类型。

数据从哪来,如何计分,又和谁对比?

评测以 AVHBench 全量约 6300 样本为最终口径,同时从 AVHBench 与 AVCD 自动过滤出 1281 条严重语义矛盾子集,典型例子是狗的画面配汽车引擎声。作者特别提醒该子集标签偏斜达 92% 为 No,若直接在子集上计分,模型只要偏向拒绝就能虚高,因此最终的行为对比以类别更均衡的全量集为准。可评分的 Yes/No 子集按精确匹配筛选,约 5165 至 5302 条,其余约 1000 条因未按格式输出而被排除。

指标方向很直观:总体准确率与按真值为 Yes 或 No 分组的准确率越高越好,预测的 Yes/No 分布用来观察偏置漂移,指令格式失效次数用来衡量矛盾对指令遵循的冲击。对照组包括冻结主干的基线 VideoLLaMA 2-7B-AV、3 级流水线的逐级叠加,以及现成的 InternVideo2 外部基线。机制侧则在 100 条矛盾样本上做头消融,在 1281 条上做全层透镜。

下表把数据集构成与实验协议收拢在一处,方便对照论文正文的描述核对取数口径与评估条件。

数据集/子集样本规模构造与采样方式评估协议与计分用途
AVHBench 全量约 6300原始基准全量,类别相对均衡温度 0.01 贪婪解码,精确字符串匹配计 Yes/No,未命中计为未评分主行为评估口径
矛盾子集1281从 AVHBench 与 AVCD 自动过滤的严重语义矛盾配对同上精确匹配;另用于全层 logit lens 投影组合探针与机制审计
头消融审计集100从矛盾子集抽样14 至 27 层逐头均值替换,以 Δ 判定头类型定位冲突解决头
开放式描述抽样59矛盾样本上的 caption 生成定性分析开头语义脚手架行为侧先验延续证据

论文提供的 4 张图各有分工,阅读时可按问题对应:图 1 展示对数透镜的捕获与快照层定义,看残差流如何在层间被投影;图 2 是 14 至 27 层的头消融热图,蓝色与红色分别对应幻觉头与矛盾解决头的 Δ 方向;图 3 是目标词元的逐层概率轨迹,关注曲线何时收敛到最终预测;图 4 是余弦代理 s_{AV}(\ell) 的层间变化,作者已声明仅作启发式参考。

更强的对齐把准确率抬起来了吗?偏置又去了哪里?

先看外部基线的崩落幅度。InternVideo2 在完整 AVHBench 上为 60.1%,在矛盾子集上跌至 27.8%,下降 32.3 个百分点且低于 2 分类随机的 50%,同时出现 1108 次、占比 17.3% 的格式失效,不再按 Yes/No 输出而生成填充文本。这说明矛盾不是让模型随机猜,而是系统性地把它带偏。

再看 3 级流水线在可评分 Yes/No 子集上的表现。按论文报告值整理如下,重点看总体准确率是否离开随机线,以及预测分布如何搬运。

比较条件指标论文报告值这项数字支持什么
ACTC总体准确率 / 可评分样本数49.8% / 5165接近随机,未显示组合能力
ACTC真值为 Yes 准确率 / 真值为 No 准确率55.5% / 44.1%略偏 Yes,预测 2895 Yes 对 2270 No
ACTC+TATI总体准确率 / 可评分样本数49.0% / 5288加入时序交织后仍在随机线附近
ACTC+TATI真值为 Yes / No 准确率46.9% / 51.1%偏置趋于均衡,预测 2529 对 2759
ACTC+TATI+AMD总体准确率 / 可评分样本数50.2% / 5299叠加随机遮蔽后仍未超越基线 51.7%
ACTC+TATI+AMD真值为 Yes / No 准确率35.1% / 65.2%强偏 No,预测 1853 对 3446,靠偏置置换准确率
InternVideo2总体准确率 / 可评分样本数52.3% / 5302外部基线同样在随机线附近,预测 2600 对 2702

机制侧的轨迹与行为相互印证。所有配置与基线的快照层都稳定在 25.5±1 层附近,且在 18 层前几乎没有显著的目标词元概率质量;而 21 个矛盾解决头集中在 15 至 18 层,未发现满足阈值的幻觉头。开放式描述中 59 条有 42 条以“演奏乐器”等固定语义脚手架开头,说明生成在保持流畅的同时失去了接地。

不能从这些数字推出的是因果结论。准确率在 49.0% 至 52.3% 之间的徘徊未报告多次运行方差与统计检验,难以区分真实无效与噪声;精确匹配的严格计分会系统性低估指令遵循脆弱模型的能力;头审计仅 100 样本且阈值未经校准,21 个头的稳定性仍需更严格的随机基线对照。

原论文 Figure 2:Distribution of hallucination and conflict resolution heads throughout layers 14–27 of…

论文图 2。这张图来自原论文 Figure 2:,图示内容为“Distribution of hallucination and conflict resolution heads throughout layers 14–27 of VideoLLaMA2-7B.”。请结合“更强的对齐把准确率抬起来了吗?偏置又去了哪里?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

原论文 Figure 3:Logit-lens probability trajectories for the target token.

论文图 3。这张图来自原论文 Figure 3:,图示内容为“Logit-lens probability trajectories for the target token.”。请结合“更强的对齐把准确率抬起来了吗?偏置又去了哪里?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

原论文 Figure 4:Exploratory cosine-similarity proxy sAV(l)s_AV^(\\ell) across layers.

论文图 4。这张图来自原论文 Figure 4:,图示内容为“Exploratory cosine-similarity proxy sAV(l)s_AV^(\ell) across layers.”。请结合“更强的对齐把准确率抬起来了吗?偏置又去了哪里?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。

哪些边界作者已经承认,哪些还需要更严格的对照?

作者承认的边界很具体:机制证据仅限 VideoLLaMA 2 架构,行为基线虽包含 InternVideo2,但透镜与头消融未扩展到后者;可评分表的严格探针属性意味着约 1000 条非 Yes/No 生成被排除;TATI 的序列长度增加未与时序对齐效应分离;余弦代理 s_{AV}(\ell) 在深层已混合信息,不能当作模态归因的直接度量;头审计阈值只是操作性设定,未发现幻觉头不代表不可定位;晚期稳定与早期检测的时序错位目前只是相关性观察,需要在 20 至 24 层做转向向量或残差抑制等因果干预来验证。

从审稿视角看,还有几处对照缺口值得补上。矛盾子集依赖自动过滤,但过滤规则与人工核验未披露,92% 的标签偏斜虽在最终评估中被规避,仍可能影响审计样本的代表性;17.3% 的格式失效与精确匹配相互作用,缺少更鲁棒的语义匹配对照;LoRA 冻结主干限制了对齐干预的表达能力,向全参数微调或不同架构的外推需要谨慎;开放式描述中乐器先验的频次统计缺少对照组与显著性分析。

这些局限并不否定诊断价值,但提醒读者把“先验主导”先当作有层级定位的相关性假说,而非已验证的因果机制。后续工作若能在同一流水线上补齐序列长度对照、统计校准与跨架构复现,结论的可控性会更强。

如果要复现,需要哪些材料与计算条件?

论文提供了代码与数据仓库 https://github.com/AdarshSudheer09/AVHBench-dmai ,其中包含行为评估与机制审计的复现代码和数据。数据集侧可通过该仓库获取 AVHBench 约 6300 样本、AVCD 以及由此过滤的 1281 条矛盾子集;模型权重则未提供独立下载链接,实验所用 VideoLLaMA 2-7B-AV 与 InternVideo2 仅以文献引用形式给出。

可复现的要点包括:基于冻结 VideoLLaMA 2-7B-AV 的 3 级配置,批量 64、8 张 A100、每视频 16 帧、TATI 的 1:1 交织与共享时间嵌入 E_{temp}、温度 0.01 的贪婪解码与精确匹配计分、覆盖 14 至 27 层的头均值消融与全层对数透镜及快照层定义。

缺失的拼图也应如实记录:学习率、优化器、调度、训练步数、LoRA 秩与缩放、AMD 的 P_{mask} 数值、权重衰减与混合精度等均未说明,检查点与完整配置未发布,训练时长未报告。这意味着行为趋势可被复核,但要逐参数复刻训练过程仍有难度。

这件事对做多传感器系统的人意味着什么?

把结论收束成一句可操作的提醒:当音视频在语义上直接冲突时,更紧的时序对齐会改变模型更愿意说 Yes 还是 No,却不会让它更愿意先比较再回答。行为上是偏置的搬运,机制上是晚期承诺对早期检测的覆盖,快照层稳定在 25.5±1 层,而能缓解幻觉的头早在 15 至 18 层就已出现。

对具身与多传感器部署而言,这是一个方法论警示。能在一致样本上流畅作答,不等于能在矛盾证据面前保持可信;检测到冲突与依据冲突采取行动是两回事。若晚期生成先验总能覆盖早期的比较信号,系统在关键时刻就可能对矛盾视而不见。

未来的工作因此有两个自然延伸:一是把矛盾组合作为常规评估维度,与对齐强度分开考核;二是在 20 至 24 层附近设计可控的因果干预,例如转向向量或残差抑制,去检验能否让早期检测真正影响最终承诺。只有当干预能稳定改变快照层的方向而不只是搬运偏置,先验主导才算从相关性走向可控性。

📎 论文与评分元数据

标签:#音视频理解 #多模态模型 #参数高效微调 #可解释性

6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5

6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #多模态模型 | #参数高效微调 #可解释性 | arxiv

⚖️ 评分依据与证据(展开查看)

逐维得分、全文证据与扣分边界
  • 创新性 (1.2/2):将 1281 条矛盾样本重构为四步组合探针并提出先验主导假说,以 ACTC 与 TATI 的 1:1 交织加共享 E_temp 及 AMD 构成递进对照,定位 25.5±1 层快照与 15 至 18 层 21 个解决头的时序错位,属问题重构与机制定位组合创新而非新模型架构

  • 技术严谨性 (1.0/1.5):给出残差流经 RMSNorm 与 W_U 的 logit lens 公式及 snap 层定义,明确承认余弦代理 s_AV 仅为启发式且深层已混合、阈值 ±0.01 未校准、晚期稳定仅为相关性,需 20 至 24 层转向干预验证因果,推导无硬错误但因果链条未闭合

  • 实验充分性 (0.8/1.5):在可评分 5165 至 5302 样本上对比 ACTC 49.8% 与 ACTC+TATI 49.0% 与全流水线 50.2% 及 InternVideo2 52.3% 并报告 60.1% 到 27.8% 的 32.3 点跌落与 17.3% 格式失效,但头审计仅 100 样本且未校准、未报告方差与统计检验、TATI 序列长度未对照、机制未扩展至 InternVideo2

  • 清晰度 (0.7/1):摘要与方法对四步组合定义、ACTC 与 TATI 的 3584 维投影与 16 帧交织、AMD 随机遮蔽及 logit lens 轨迹的叙述结构清晰,表格区分总体与按真值分组准确率及预测分布,但部分关键参数如 P_mask 数值与 LoRA 秩在正文中未显式呈现影响阅读连贯性

  • 影响力 (0.8/1.5):针对 AV-LLM 在同步但语义不兼容输入下的组合失效提出可复现警示,InternVideo2 矛盾子集 27.8% 低于随机与 VideoLLaMA 三配置近随机结果对多传感器具身部署具方法论价值,但机制证据限于单一架构且未证明可控干预,音频领域外推需谨慎

  • 开源 (1.0/1.5):代码与数据通过 https://github.com/AdarshSudheer09/AVHBench-dmai 开放并包含行为评估与机制审计复现材料,AVHBench 约 6300 与 1281 矛盾子集可经仓库获取,但模型权重未提供独立下载链接且文档未完整说明检查点与协议,属部分核心产物开放

  • 可复现性 (0.1/0.5):披露冻结 VideoLLaMA 2-7B-AV 上 LoRA 联合训练定制投影器、批量 64 与 8 张 A100、16 帧采样与温度 0.01 贪婪解码及精确匹配计分,但学习率、优化器、调度、训练步数、LoRA 秩与缩放、P_mask 数值等关键配置大量缺失

  • 工程/实践价值 (0.9/1.5):给出从 BEATs 与 STCConnector 到 ACTC 拼接与 TATI 时序交织加 E_temp 再到 AMD 遮蔽的完整可复用流水线,并配套全层 logit lens 与 14 至 27 层头均值消融审计分支,但未报告真实延迟、吞吐或资源占用的部署测量


← 返回 2026-08-31 语音/音乐/音频论文速递