英文题目:Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards

会议身份:conference:aaai:2026:conference-paper-id:40323

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#强化学习 #测试时自适应 #鲁棒性 #语音识别

评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Linghan Fang:机构信息未能从会议 PDF 纯文本可靠映射
  • Tianxin Xie:机构信息未能从会议 PDF 纯文本可靠映射
  • Li Liu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为含环境噪声与非母语口音偏移的英语语音,输出为转写文本,难点在于轻量Whisper模型在无标签测试时置信度与正确性严重错位,熵最小化与伪标签会强化高置信错误。方法首先在Whisper解码器前端注入长度为四的可学习软提示以干预生成轨迹,干预后的解码状态进入下一步候选探索。接着以温度采样并行生成多个转写候选以暴露反事实假设,候选集合连同原始音频一起送入奖励评分。然后用对比语言音频预训练模型计算音频文本对齐奖励,并经策略梯度同时更新提示与模型参数以转向语义一致输出。与依赖内部置信度的方法不同,该方法用外部语义一致性作为适应信号,因而能纠正初始低置信但语义正确的候选并缓解确认偏误。在LibriSpeech test-other叠加MS-SNSD噪声的评测条件下,ASR-TRA的WER为28.64%,低于SGEM的30.22%。结论适用边界受限于单句英语离线自适应,CLAP主要支持英语使多语言与流式对话场景尚未验证,推理开销方面平均延迟为0.720秒而引入大语言模型奖励会带来数倍延迟增长。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/fangcq/ASR-TRA — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么噪声和口音难?

这篇论文只研究 1 个任务:自动语音识别,也就是把一段语音波形转写成文字。输入是麦克风采集的连续语音,输出是词序列。评价用词错误率,做法是把模型输出与参考文本对齐后统计插入、删除、替换 3 类词级编辑操作,再除以参考词数,数值越低表示转写越准。

研究生首先要建立的直觉是,实验室里干净朗读的英语与真实部署时的语音并不相同,背景噪声会掩盖声学细节,非母语口音会改变发音方式,轻量模型在这些分布偏移下很容易把发音相近但语义不同的词搞混。论文以轻量 Whisper-Tiny 为主要对象,该模型约有 39000000 参数,适合端侧或流式等对延迟敏感的场景,但也因此对偏移更敏感。

作者明确指出,传统做法是在离线阶段做多条件训练或噪声增强,可是在测试时拿不到标注,无法重新训练,所以需要一种在推理时刻只用当前无标注语音就完成 1 次适应的方法。这就是后文测试时适应的由来,输入条件必须记住:单条测试语音、无真值、改完就要给出这条的转写。代码当前可用,已公开在官方仓库地址,可供核对流程与超参数。

已有路线在拿什么信号做无监督适应?

理解本文位置需要先区分 3 条路线。第一条是语音识别主干,代表是 wav2vec 2.0 与 Whisper,前者用自监督对比预训练学语音表示,后者用约 680000 小时弱标注数据训练编码器解码器结构,在多领域上表现强,但论文报告其在噪声、口音、自发语音等偏移下仍会明显退化。第二条是测试时适应,早期 Tent 按每个测试样本最小化熵并冻结大部分参数,语音领域的 SUTA 用高置信预测生成伪标签,SGEM 做序列级广义熵最小化,它们的共同点是学习信号来自模型内部的置信度或熵。

第 3 条是强化学习做适应,例如用奖励驱动分类器适应的工作,以及用正确或错误二值反馈做片段适应的工作,但大多面向分类或导航,动作空间与反馈都比语音这种结构化序列简单。论文的判断是,内部信号在严重偏移下不可靠,高置信不等于正确,继续沿着置信方向更新会把错误越推越远。同时,现有强化适应缺少针对语音序列的外部语义反馈设计。因此作者提出把因果干预与外部奖励结合起来,既保留 Whisper 的结构,又不用模型自己的不确定性来给自己打分。

置信度高为什么反而可能是陷阱?

论文用一个极小的教学例子讲清矛盾:噪声下真实词应为世界对应的英文词,但模型初始更相信发音相近的另一词。若适应信号就是复用模型自己的高概率输出,那么更新方向会继续抬高错误词的概率,第二次推理仍然输出错误,这就是确认偏误。作者进一步把这种现象称为盲目自信,即在分布偏移下模型的内部确定性与真实转写准确率脱钩。

证据来自对 LibriSpeech 测试集另一部分加高斯噪声后挑出的前 100 个最高置信样本,这些样本按常理想应最准,但 Whisper-Tiny 基线在上面的词错误率反而很高,而强依赖置信熵最小化的 SUTA 在该子集上进一步恶化。下面的示意图把两条路线并排对比,上面是置信驱动,下面是奖励引导,中间用柱状高低表示错误假设被压低、正确假设被抬高的过程,初学者应把注意力放在反馈来源的不同,而不是模型变大了。

伪标签自训练 × 确认偏误: 伪标签自训练分工是把模型自己高置信输出当作监督信号回传,确认偏误分工是描述当初始高置信本身是错的时该回路会放大错误,搭配起来解释了为何在噪声下仅最小化熵或复用伪标签会越适越错,组合意义是引出必须用独立于模型置信的外部语义奖励来做判断。

为读懂该对比,先说明图中左右两端的含义:左侧都是同一段输入语音波形与同一个识别模型,右侧都是最终输出的英文句子,差别只在中间的适应闭环如何决定往哪个方向改,上面闭环引用伪标签,下面闭环引用奖励打分。

看图路径: 1. 先看上面一行置信驱动分支中从错误转写指回模型的 adapt 箭头;2. 再看中间三根柱子中红色 False 与蓝色 True 在适应前后的高低变化;3. 最后对比上下两行最右侧输出框中 word 与 world 的底色标记差异

原论文 Figure 1:Overview of test-time adaptation strategies under noisy conditions.

论文图 1。原论文 Figure 1:“Overview of test-time adaptation strategies under noisy conditions.”。

该图上半部分展示了错误伪标签被增强的闭环,错误词在适应后柱子更高且输出不变,下半部分展示了奖励修正的闭环,初始置信低的正确词在奖励作用下柱子反超并改变输出,箭头方向表明适应发生在推理之前且只针对当前输入,柱体颜色区分了其他、错误与正确 3 类假设。

不看真值的一次适应是如何走完的?

先沿着一条语音样本走完全流程,再拆公式。输入是一段语音的对数梅尔频谱图,编码器把它变成隐表示,解码器自回归地逐词生成转写。适应阶段并不直接改输入音频,而是在解码器输入端前置一段可学习的提示向量,让解码器每一步都能看到它,从而改变后续所有词的生成轨迹。接着用随机采样的温度参数多次解码,得到多个不同的候选转写,可以理解为在同一音频和同一提示下设想多种可能的说法。

然后用 CLAP 计算每条候选文本与输入语音的相似度作为奖励,分数越高表示音频文本越对得上。最后用策略梯度把高奖励候选的概率调大、低奖励候选的概率调小,同时更新提示向量与模型权重,更新完再做 1 次正式解码得到当前样本的转写,做完就把模型与提示恢复到原始状态,不把这次改动带到下一个样本。整个过程不需要真值,监督来源完全是外部奖励模型对候选的打分。

测试时适应 × 强化学习: 测试时适应负责在无真值转写时仍按当前语音做 1 次在线修正,强化学习负责把离散转写的好坏变成可优化的期望奖励目标,二者搭配的原因是测试时没有可微的词错误率监督,只能把 CLAP 打分当奖励、用策略梯度同时推提示向量和模型参数,使高奖励候选的对数概率上升。

下图把上述 2 阶段画得很具体,左侧是测试时适应,右侧是推理,中间用奖励星级把打分与更新连起来,初学者可把它当作复述提纲:基线解码、带提示多温度采样、打分、策略梯度更新、再解码。

看图路径: 1. 先沿左侧输入语音到编码器再到解码器的主路径看信息流向;2. 再看绿色候选采样框如何展开为多个文本候选并送入 CLAP 表盘;3. 最后看底部虚线策略梯度如何同时指回可学习提示与 Whisper 参数

原论文 Figure 4:Test-time self-adaptation for Whisper.

论文图 4。原论文 Figure 4:“Test-time self-adaptation for Whisper.”。

该图左侧显示输入语音进入编码器后与可学习提示拼接再进入解码器,解码器经不同温度采样出多个文本候选,CLAP 表盘对所有候选打分并回传音频文本相似度奖励,虚线策略梯度同时指向提示与模型参数,右侧显示适应后的模型与提示直接给出最终转写,左右分界线强调适应与推理是先后发生的两个步骤。

提示、采样与打分各自算什么?

第一个组件是提示注入。白话说就是在解码器词嵌入序列最前面拼接几个可训练向量,论文实验用长度为四的提示,解码器嵌入维度为 384,因此新增参数很少。英文称为 learnable decoder prompt 或 soft prompt。因为提示在每一步注意力中都可见,它能直接塑造隐状态并影响后续全部词。由于作者把它当作外部设定的因果干预,形式上记为对提示做干预而不从观测输入推断它,这意味着探索新假设时不改音频,只改生成条件。

第二个组件是反事实采样与奖励评价。白话说就是固定音频和提示,用大于零的温度参数把词分布变平坦后重复采样,温度越高多样性越强,温度趋近于零则接近贪心解码,每次采样得到的一条完整转写就是一个候选假设。然后用 CLAP 对每条假设打分,计算音频嵌入与文本嵌入的余弦相似度,分数作为标量奖励。消融中还试过大语言模型打分作为补充,但主流程默认只用 CLAP 以控制延迟。

第 3 个组件是参数更新,把带提示的 Whisper 看作输出序列上的随机策略,目标是最大化奖励期望,再用带基线的经典策略梯度估计梯度。

可学习解码器提示 × 因果干预: 可学习解码器提示分工是在解码器输入前拼接一段可更新向量以逐词影响注意力与隐状态,因果干预分工是把该向量看作外部设定的 do 操作而不改动声学输入,搭配理由是在同一段音频下主动扰动生成动力学以探索反事实转写,组合意义是得到一条轻量且专用于编码器解码器结构的适应通路。

解码器在无提示时的条件分布只依赖历史词与声学隐表示,公式符号含义是当前词、以往已生成词、编码器输出,计算目标是下一步词的概率分布,实现上由解码器网络给出。

\[P(yt | y\lt t, h) = Dec(y\lt t, h),\]

加入提示并视为干预后,当前词的生成同时依赖声学隐表示、历史词与外部设定的提示向量,符号中干预记号表示提示是外部给定而非从输入推断,计算目标仍是下一步词分布,但生成动力学已被提示扰动。

\[yt = Dec(h, y\lt t, do(p)),\]

每个候选假设的奖励记为奖励函数作用于该转写的结果,符号中上标表示第几个候选,计算目标是给出无需真值的语义对齐分数,实现上主要由 CLAP 音频文本相似度提供。

\[r(i) = R(ˆy(i)).\]

温度采样 × CLAP 奖励: 温度采样负责把词分布压平以产生多个不同转写假设,CLAP 奖励负责计算输入语音嵌入与每个候选文本嵌入的余弦相似度以评价语义对齐,搭配理由是多样性若无外部打分则无法区分好坏、外部打分若无多样性则无从选择,组合后形成无需真值的序列级反馈。

没有离线训练时,测试时刻到底在优化什么?

本研究没有传统意义上的离线训练阶段,没有在训练集上从头训练声学模型,也没有用标注数据微调 CLAP 或大语言模型。实际发生的计算全部在测试时刻针对单条语音进行,可复述为算法循环。第一步用温度为零做确定性解码得到基线输出并算 1 次奖励,第二步插入随机初始化的提示,接着循环若干次,每次从均匀分布中抽一个温度,用带提示的模型生成一条输出并算奖励。论文实验默认温度在 0.4 到 0.6 之间均匀采样,共生成 4 个候选并可并行执行。

然后把所有奖励取平均作为基线,用每条奖励减去平均得到优势,再按优势加权对数概率构成策略梯度损失,优势为正的候选会被增强,优势为负的会被抑制。梯度同时流向模型参数与提示参数,但二者学习率不同,提示学习率比模型大 100 倍,模型学习率按数据复杂度在十的负 6 次方到十的负 5 次方范围内取值。更新后用适应后的模型与提示再解码 1 次作为返回结果,随后立即恢复原始参数,保证样本之间不累积。

需要指出的缺项是,原文未报告优化器种类、动量、梯度裁剪与更新步数是否大于一,因此复现时只能按单步策略梯度理解,不应自行假设用了多步迭代。

基线奖励是同批所有候选奖励的平均,符号含义是候选数与每条奖励,计算目标是为方差缩减提供中心,原文明确用它做优势的减项。

\[¯r = 1\]

策略梯度方向是对每条候选的对数概率求梯度再按优势加权平均,符号含义是模型参数、提示参数与优势项,计算目标是让高奖励轨迹更可能、低奖励轨迹更不可能,原文未给出超出该式的 2 阶或截断细节。

\[↔ε,pL = ↗1 ↔ε,p log P(ˆy(i)) · (r(i) ↗¯r),\]

在什么数据、模型与指标下比较才算公平?

实验条件必须先讲清,否则数字无法复述。主模型是 Whisper-Tiny,提示长度为四,温度均匀采样区间为 0.4 到 0.6,候选数为四,硬件为单张英伟达 RTX 6000 Ada。第一个场景是声学破坏:在 LibriSpeech 测试集另一部分上叠加来自微软可扩展噪声语音数据集的 8 种加性噪声,信噪比为 10 分贝,噪声类型包括空调、机场广播、人声嘈杂、复印机、咀嚼声、邻居说话、关门声与打字声,每条语音按每种噪声随机抽一段叠加,以模拟真实环境。

第二个场景是口音偏移:用 L2-Arctic 非母语英语语料,包含 6 种母语背景的说话人,考察未在预训练中充分见过的发音系统。第 3 个场景是高斯噪声下的消融与高置信子集分析,还引入 Whisper-Base 做模型量级对照。比较对象在噪声主实验中是未适应的基线、SUTA 与 SGEM,在口音实验中同样是这 3 个基线,运行阶段均为测试时单样本适应。指标统一用词错误率,越低越好,同时报告每条语音的平均推理延迟秒数,延迟越低越好。

论文未报告多次随机种子的方差与显著性检验,因此后文所有胜负都应理解为单次报告均值的比较,待验证其稳定性。

噪声与口音下谁变好了,谁没有?

先看噪声主结果的比较问题:在 8 种 10 分贝噪声下,相同 Whisper-Tiny 与相同测试语音下,4 种可运行策略的词错误率与延迟如何排序,指标方向都是越低越好。论文报告本方法平均词错误率与平均延迟均为最低,在机场广播与人声嘈杂等高熵噪声下优势更明显,只在邻居说话这一项上 SUTA 略优于本方法,但本方法在该项的推理速度仍显著更快。延迟上 SUTA 平均约 1.69 秒,SGEM 约 0.775 秒,本方法约 0.72 秒,说明多候选并行与轻量提示并未带来更大的时间开销。

口音结果的比较问题相同:在 6 种母语背景下平均谁最低。论文报告本方法平均最优,尤其在阿拉伯语与越南语口音等更难的组别上改善大,而在个别组别上 SGEM 或基线仍有竞争力,因此总体趋势不等于每组都赢。为理解盲目自信,再看高置信子集的柱状图,横轴是 4 种方法,纵轴是词错误率百分比,SUTA 柱最高,本方法柱最低,初学者应先确认纵轴方向再判断好坏。

看图路径: 1. 先确认纵轴为词错误率百分比且越低越好;2. 再按从左到右顺序读出四个蓝色柱顶标注的具体数值;3. 最后比较 SUTA 柱明显高于基线而 Ours 柱明显最低的相对关系

原论文 Figure 2:We evaluate WER on the top-100 high-confidence samples from LibriSpeech test-other corrupted with…

论文图 2。原论文 Figure 2:“We evaluate WER on the top-100 high-confidence samples from LibriSpeech test-other corrupted with Gaus- sian noise.”。

该柱状图显示基线约为八十多,SUTA 升到一百二十多,SGEM 回落到六十多,本方法降到四十多,柱顶数字可直接读出,像素细节表明四根蓝色柱高度单调以外的起伏对应了置信信号与外部奖励信号的差别,解释段强调该子集专门挑选模型最自信的样本,因而最能暴露内部信号的不可靠。

下表复用原文口音矩阵,行是 6 种母语背景加平均行,列是基线、SUTA、SGEM 与本方法,数值是词错误率百分比,表头单位在原表题中交代,数据格为裸值,阅读时不要逐格追加百分号之外的单位换算。

Arabic32.7435.9435.1922.92
Mandarin28.0327.6828.0325.14
Hindi14.6214.3212.6114.18
Korean13.4213.5612.1213.76
Spanish42.6441.2541.7839.44
Vietnamese61.2162.7858.6853.84
Mean32.1132.5931.4028.21

表后解释需要同时讲收益与反例:平均行显示本方法从 32.11 降到 28.21,阿拉伯语组从 32.74 降到 22.92,越南语组从 61.21 下降到 53.84,支持跨发音系统泛化更好的判断;但印地语组本方法为 14.18,不如 SGEM 的 12.61,韩语组本方法为 13.76,也不如 SGEM 的 12.12,这说明奖励引导并非在所有口音上都占优,且原文未评测 CLAP 不擅长的非英语相似度场景,这是明确的边界。

提示、微调与奖励各自贡献了多少延迟代价?

消融的比较问题是:在高斯噪声污染的 LibriSpeech 测试集另一部分上,开关提示、开关模型微调、更换奖励来源时,Whisper-Tiny 与 Whisper-Base 的词错误率与单条延迟如何变化。论文报告所有适应配置都优于未适应基线,单看提示的作用,仅微调加 CLAP 与微调加提示加 CLAP 相比,Tiny 模型从 40.49 降到 36.65,延迟只增加很少,支持提示提供了与参数更新互补的适应容量。

再看奖励的作用,只用 CLAP 就能在可忽略的延迟代价下大幅降错,加入大语言模型反馈能进一步压低词错误率,例如 Base 模型从 0.3342 降到 0.3024,但延迟变为原来的 7 到 9 倍,混合奖励取得总体最低词错误率。论文还报告 CLAP 分数与真实词错误率呈负相关,等级相关系数为 -0.431,支持把它当作语义奖励的合理性。效率方面还试过低秩适应,但发现主要耗时在自回归解码与奖励计算,低秩并未带来可观加速,因此后续不再比较。

CLAP 奖励 × 大语言模型奖励: CLAP 奖励分工是快速给出音频与文本是否对得上的跨模态分数,大语言模型奖励分工是从纯文本流畅性与语义合理性给出补充分数,搭配理由是前者便宜稳定但只懂对齐、后者更准但延迟大,组合成混合奖励时在论文消融中取得最低词错误率,但推理开销显著上升。

下表整理高置信子集 4 个可运行策略的数字,条件均为 LibriSpeech 加高斯噪声下最自信的 100 条,指标为词错误率,数值与单位完全来自原文连续句,阅读时注意词错误率可超过 100%,因为插入错误会计入分子。

条件指标基线对比方法本方法
高斯噪声下最高置信 100 条词错误率83.61%122.37%45.17%
高斯噪声下最高置信 100 条词错误率63.00%45.17%83.61%

表后解释要讲清代价与反证:本方法把 83.61 下降到 45.17,几乎减半,支持外部奖励能纠正盲目自信的判断;但 SUTA 升到 122.37,说明置信驱动在该子集上是负作用,SGEM 的 63.00 虽优于基线仍远差于本方法,说明序列级不确定性只能部分缓解问题;同时该表未给出延迟,任何关于更快或更省的结论在此子集上都待验证。

再用一张宽表整理主结果与消融的关键权衡,条件、指标、基线、对比与本方法的数字均可在后附原文连续句中找到对应,单位保留原文写法。

条件指标
8 种噪声平均,Whisper-Tiny平均词错误率
8 种噪声平均,Whisper-Tiny平均延迟
高斯噪声消融,Whisper-Tiny词错误率
高斯噪声消融,Whisper-Base词错误率

表后解释补充适用条件:噪声平均表显示精度与速度同时占优,支持奖励多样性在重扰动下更稳定的解释;消融表显示提示带来约 1/4 左右的相对下降而延迟几乎不变,混合奖励再降错但延迟膨胀,CLAP 与真实错误率的负相关为奖励有效性提供了独立证据;未胜出项是部分口音组与邻居噪声项,复现时应优先检查这些边界而非只看平均值。

哪些结论还不能下,边界在哪里?

首先区分 3 类表述。论文直接报告的是在给定噪声、口音与高斯噪声子集上的词错误率与延迟均值;有限解释是外部奖励比内部置信更可靠、提示与参数更新互补;未验证推测是把该框架推广到流式或对话语音时会自然获得上下文持续鲁棒性,这部分没有实验,应表述为可能或待验证。其次是奖励模型的固有约束:混合设置下大语言模型奖励主导推理延迟,CLAP 目前主要支持英语音频文本相似度,因此多语评估受限,论文未给出非英语下的奖励可靠性证据。

再次是适应范围只做单条语音的片段适应,每次适应后恢复参数,不跨样本累积,原文讨论部分提到未来可做跨句累积以获得类似少样本提示的监督,但这只是方向而非已验证收益。最后是统计与成本缺项:未报告随机种子方差、显著性、误判率的人工复核,以及端侧真实功耗与吞吐,训练资源与推理开销应分开讨论,不能把平均延迟最低推广为每条都最低,也不能把自动词错误率下降等同于下游对话或多模态任务一定变好。

要复现应先跑通哪几步,参数如何取?

复现的第一步是按官方仓库准备 Whisper-Tiny 与 CLAP 环境,确认代码当前可用后再跑单样本循环,不要先改模型结构。输入固定为对数梅尔频谱图,编码器输出隐表示,解码器前拼接长度为四的随机提示,嵌入维度为 384。采样时温度从 0.4 到 0.6 均匀抽取,共 4 个候选并行生成,先用温度零生成基线并打分,再对带提示输出打分。

奖励取 CLAP 音频文本相似度,优势为各自奖励减去包含基线在内的均值,损失为优势加权的对数概率求和,模型学习率取十的负 6 次方到十的负 5 次方,提示学习率取模型的 100 倍,更新后重解码 1 次即返回并恢复参数。核对时应先复现高置信 100 条的相对排序,再复现 8 种噪声平均与 6 种口音平均,最后再试混合大语言模型奖励并记录延迟膨胀。常见误解是把无离线训练理解为确定性求解,实际上温度采样与提示随机初始化都会引入随机性。

另一个误解是从冻结大部分参数推定输出确定,实际上只要温度大于零且候选打分参与加权,输出仍是随机的。若要补验证,建议补多种子方差、每种噪声的分项延迟、以及 CLAP 分数与词错误率在新噪声下的相关性。

何时值得尝试这种方法,何时不必?

当部署条件满足三点时值得尝试:模型是 Whisper 这类编码器解码器结构且允许在测试时做 1 次轻量更新,测试语音无标注但可用外部音频文本模型打分,延迟预算允许四候选并行解码加 1 次打分。当噪声以高熵、口音以未见发音为主且已观察到高置信错误时,外部奖励的价值更大。反之,若延迟预算极紧到连 1 次 CLAP 打分都加不起,或目标语言超出 CLAP 可靠范围,或需要跨句长期记忆,则不应直接套用本文配置。

教学上应记住的核心链条是:提示提供干预入口,温度提供多样性,CLAP 提供独立于置信的排序,策略梯度把排序变成参数改动,样本级恢复保证不污染后续输入。把该链条跑通后,再去讨论是否引入更贵的大语言模型奖励或流式累积,才符合论文实际验证的顺序。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总