英文题目:CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

会议身份:conference:aaai:2026:conference-paper-id:40312

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准设计 #跨语言 #多语言 #语音 #音频问答

评分:7.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Yexing Du:机构信息未能从会议 PDF 纯文本可靠映射
  • Kaiyuan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Youcheng Pan:机构信息未能从会议 PDF 纯文本可靠映射
  • Zheng Chu:机构信息未能从会议 PDF 纯文本可靠映射
  • Bo Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaocheng Feng:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yang Xiang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

跨语言与跨模态事实问答的输入是8种语言的文本或真人朗读语音问题,输出是简短事实答案,难点是同一事实在换语言或换模态时模型易给出矛盾幻觉回答。为此作者先从MKQA与MOOCCubeX筛选去歧义、去时效、去文化相关问题,再经GPT-4.1翻译与人工回译复核生成平行多语言文本,最后经母语者录音与Whisper-large-v3识别校验重录得到平行语音。配套验证模型LLM-SQA先在英语语音上学习问答结构,再以英语为枢轴用每种目标语言5条样本迁移,推理时先转写翻译为英语再用英语知识作答再译回目标语。与已有纯文本或纯英语语音基准的关键机制差异在于全平行语音文本设计使跨语言与跨模态一致性可直接度量。在语音跨语言问答上该模型平均F1达到51.4,超越GPT-4o-mini-Audio的45.7。该结论仅适用于朗读式清晰短事实问答,未验证自发对话噪声远场与视觉模态外推。原文未披露训练推理部署成本。

🔗 开源与复现资源

  • 数据相关资源:https://github.com/yxduir/ccfqa — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决什么学习问题?

这篇论文的输入是事实性问答,问题形式很短,答案唯一,例如美国最大的国家公园是哪个。目标不是考模型的表达能力,而是考它是否在不同语言和不同输入形态下给出同一个正确事实。研究者把这种要求拆成两类学习依赖:一是跨语言依赖,同一问题用英语、中文、法语、日语、韩语、俄语、西班牙语、粤语提问时,模型内部知识应当对齐;二是跨模态依赖,同一问题用文字和用人声朗读的语音提问时,模型应当给出质量相当的答案。

论文要保留的关键信息是基准的平行结构。每个问题在 8 种语言中都有对应文本和对应真人录音,文本与语音内容一致,答案在翻译后保持语义等价。只有这样,评测时观察到的分数下降才能归因于语言或模态,而不是题目本身变难。输出是 4 种任务设置下的事实准确性与一致性:单语言文本问答、跨语言文本问答、单语言语音问答、跨语言语音问答。

对刚进入语音与语言交叉方向的研究生而言,需要先建立一个动作感:先沿一个样本走完输入到输出,再谈平均分。一个英文文本问题进入大语言模型,直接生成英文答案;把同一问题换成中文文本,模型应当生成对应的中文答案;再把中文文本换成中文语音,模型需要先把声学信号映射到可理解表示,再生成答案;最后把英文语音要求用中文回答,模型同时跨越模态与语言。任何一步出错,都会在最终答案上留下痕迹。

本文的写作顺序也按学习依赖展开:先讲任务与已有路线的缺口,再讲基准全景与构造动作,接着讲所提模型的组件与训练,最后讲实验条件、结果、反例与复现要点。凡是教学举例都会标为例子,不把例子当作论文报告的数值。

附录:关键规模与配置数字总览

本节不引入新结论,只把前文分散的规模与配置数字集中为可核对的表格,方便按原文条件复述。第一个表格回答基准有多大、如何划分、评测成本多高;第二个表格回答模型有多大、如何训练;第 3 个表格回答论文报告了哪些定性主结论。所有数字的写法保留原文精度与单位,叙述数量用阿拉伯数字。

以下表格比较基准规模与划分是否满足平行评测要求,指标方向是覆盖越全、划分越明确越好,公平条件是同一套题目在 8 语言与两种模态下完全对应。

条件指标规模划分评测代价
8 语言平行问答样本总数14,40020 个类别跨语言需全组合
文本语音平行问题对总数1800800 验证,1000 测试两种模态对照
跨语言语音文本单模型请求数128,0008 进 8 出设置完整评估成本

上述规模表明该基准不是单语言小样本抽查,而是要求每个模型完成十万量级请求的系统评测。类别覆盖 20 个子领域意味着平均分背后仍有学科差异,不能只看总体均值;800 与 1000 的验证测试划分意味着调参与报告应分离,未胜出项与低资源语言的表现应与高资源语言分开看。

以下表格比较训练配置的可复现程度,重点是参数更新范围与计算预算,公平条件是按原文报告的冻结与训练安排复述,不从模型名称推定实现。

模块参数规模训练安排优化配置数据条件
语音编码器约 635M冻结与适配器分离通用声学能力
语音适配器约 80.5M全部训练80 查询,维度 768课程学习
大语言模型约 9.2B低秩适配约 8.9M峰值学习率 1×10−4,预热 1000 步英语约 3000 条合成语音
总体约 10B4 卡 A100 运行一周线性衰减目标语言 5 样本迁移

该配置的代价很明确:总量约 10B 意味着推理与微调都需要大显存,一周 4 卡是训练成本而非推理延迟。80 个查询向量与 768 维度的选择是原文明确给出的结构,不应随意更改后仍称为复现;目标语言仅 5 条样本是方法成立的关键前提,补更多样本后的提升应另行标注,不能代替原文的可部署收益。

以下表格总结论文直接报告的主结论与限制,区分报告显示与可能待验证的推测,比较对象均为原文实际可运行的基线。

任务最好表现开源较好项本方法定位限制
文本问答GPT-4o-mini 最好Qwen2.5-Omni-7B 最高少样本迁移有竞争力英语中心偏置
语音问答音频版在英语最好7B 版在中文粤语较好短中语音较稳仅语音文本模态
跨语言跨模态多数模型下降Omni 跨模态保持较好总体均衡未测延迟成本
指标分歧低 F1 高准确为指令问题高 F1 低准确为幻觉需双指标同看裁判细节在附录

该总结的支持边界是:最好表现是系统级比较,不代表单一变量胜负;未胜出项如 Phi-4 与 Qwen2-Audio 在多数语言与类别上偏低,应保留为反例;跨语言语音问答的均衡优势主要来自论文文字与雷达形状,像素不能精确读数时不硬写每类分数。

已有事实评测与语音问答各缺了哪一块?

事实性评测这条路线,论文回顾了从 TruthfulQA 到 SimpleQA 的脉络。TruthfulQA 关注人类常见误解,HaluEval 关注流畅但错误的幻觉文本,SimpleQA 用对抗收集的短事实问题考查事实回忆,中文 SimpleQA 和 KoLasSimpleQA 把这种思路扩展到中文与多语言。它们的共同输入是文本,监督是标准答案,运行阶段是文本问答。

语音问答另一条路线,论文回顾了 SD-QA、VoiceBench、SpeechIQ 等工作。SD-QA 关注方言口语,VoiceBench 关注语音助手的知识与指令跟随,SpeechIQ 引入认知层次评估。它们的输入包含语音,但论文指出它们多为单语音模态且答案多为非开放式,缺少完全平行的多语言语音文本对照。

同输入同目标的对照因此很清晰:在文本事实问答上,已有基准覆盖英语为主,缺少语音;在语音问答上,已有基准覆盖英语语音,缺少多语言平行事实问答。跨语言与跨模态幻觉检测工作被单独提及,但论文强调系统性的 8 语言平行语音文本事实基准仍然缺失。这就是 CCFQA 的定位:不做视觉模态,不做长篇生成,只做短事实问答在语言与模态两个维度上的一致性。

什么算不一致?任务如何形式化?

论文把不一致定义为操作性现象:同一个事实问题,改变输入语言或输入模态后,模型给出不等价或正确性明显不同的答案。这不是主观感受,而是可以通过平行语料直接比较的。文本问答记为输入语言与输出语言相同,跨语言文本问答要求用一种语言提问、用另一种语言回答,语音问答与跨语言语音问答把输入换成语音。

下面这张示意图是理解问题的最短路径,例子是美国最大国家公园的提问,例子中出现的错误答案仅用于说明现象,不代表基准全部题目。

前导读:请把该图看成 3 个对照实验,重点看输入框中语言词与模态词的变化,以及右侧答案框中正确与错误标记的对应关系。

看图路径: 1. 先看三组面板的输入框:语言与模态分别在何处发生变化;2. 再看右侧答案框的对错标记:同一美国国家公园问题给出几个不同答案;3. 比较面板 a 与面板 b 的箭头来源:跨语言与跨模态的对照是如何构成的;4. 注意面板 c 同时改变语言与模态:观察错误如何叠加

原论文 Figure 1:Factual Inconsistency in MLLMs.

论文图 1。原论文 Figure 1:“Factual Inconsistency in MLLMs. (a) Cross- lingual Inconsistency: inconsistent answers for the ques- tions across different languages; (b) Cross-modal Inconsis- tency:…”。

解释:面板 a 固定模态为文本,只把回答语言从英语换成中文,模型把正确答案换成死亡谷国家公园;面板 b 固定语言为中文,只把文本换成中文语音,模型把正确中文答案换成丹那利国家公园;面板 c 同时把英语语音换成中文回答,模型给出东南极国家公园。3 个面板共同说明,语言切换与模态切换各自都可能触发事实错误,同时切换时错误依然存在。研究生复述时应强调:该图是动机展示,不是基准统计结果。

跨语言一致性 × 跨模态一致性: 跨语言一致性分工是检验同一事实问题换语言后答案是否等价,跨模态一致性分工是检验同一问题换输入形态后答案质量是否保持,二者搭配的理由是只有同时固定问题才能分离语言偏差与模态偏差,组合意义在于 CCFQA 用完全平行语料把两种退化放在同一尺度下比较。

形式化后,评测问题变为:在题目、语言覆盖、模态覆盖完全固定的条件下,比较 4 种任务的性能比值。一致性高意味着跨语言与跨模态没有带来额外损失,一致性低则说明模型知识没有真正对齐,只是记住了某种语言或某种模态下的表层形式。

CCFQA 基准的全景是什么?

CCFQA 的全景可以用一句话概括:先做跨语言文本平行,再做跨模态语音平行。跨语言部分从 MKQA 与 MOOCCubeX 等文本问答数据出发,前者提供电影、音乐、体育等开放域常识,后者提供课程相关的学科问题。跨模态部分把已校验的文本全部录制成真人语音,再做增强与对齐校验,最终得到文本与语音一一对应的平行资源。

前导读:请沿该流程图从左向右看,先看绿色跨语言框内的 3 个步骤,再看蓝色跨模态框内的 3 个步骤,最后看右侧平行输出示例的中英文对应。

看图路径: 1. 沿最左侧文本问答对向右追踪:经过哪三个跨语言步骤再进入跨模态分支;2. 比较中间绿色虚线框与蓝色虚线框的输入输出:文本如何变为平行语音;3. 看最右侧平行文本与语音示例:英文与中文问题是否语义对应

原论文 Figure 2:CCFQA Dataset Construction: (a) Cross-Lingual Data Construction, (b) Cross-Modal Data Construction.

论文图 2。原论文 Figure 2:“CCFQA Dataset Construction: (a) Cross-Lingual Data Construction, (b) Cross-Modal Data Construction.”。

解释:左侧是原始文本问答对,示例为美国最大河流与英国国家区号;中间绿色框依次是数据筛选、翻译、人工复核,蓝色框依次是真人录制、语音增强、语音对齐;右侧是最终平行输出,英文问题对应英文答案密西西比河,中文问题对应中文答案。箭头方向表明语音构造依赖已完成的多语言文本,不直接从原始杂乱数据录音。

基准覆盖 4 大领域与 20 个子领域,语言为英语、中文、法语、日语、韩语、俄语、西班牙语、粤语。论文报告共收集 14400 个语音与文本问答样本,包含 1800 个平行语音文本问题对,其中 800 对用于验证,1000 对用于测试。由于跨语言设置要求每个输入语言都要向 8 种语言回答,完整评估一个模型需要 128000 次请求。这个数量级决定了后续实验必须考虑评测成本,不能只看单语言分数。

LLM-SQA 由哪些部件组成,信号如何流动?

作者提出的 LLM-SQA 由三部分组成:语音编码器、语音适配器、大语言模型。白话说,语音编码器负责听,把波形变成声学特征;语音适配器负责翻译表示,把声学特征变成大语言模型能读的向量;大语言模型负责答,基于融合后的表示生成事实答案。基座模型是 GemmaX2-9B,并增加了对粤语的支持,同时支持语音识别、语音翻译与语音问答。

前导读:请从底部语音波形向上看编码器与适配器的堆叠关系,再看右侧文本指令支路在何处汇入大语言模型,最后看顶部输出中英语与目标语言的拼接方式。

看图路径: 1. 自下而上跟随语音波形箭头:依次经过编码器、适配器到达大语言模型;2. 看右侧指令输入支路:语言标签与问答标签在何处与语音支路汇合;3. 看顶部输出序列:英语中间答案与目标语言答案是如何拼接的

原论文 Figure 4:The Architecture of LLM-SQA.

论文图 4。原论文 Figure 4:“The Architecture of LLM-SQA.”。

解释:左侧支路是语音自下而上经过冻结的编码器与可训练的适配器进入大语言模型,右侧支路是文本指令直接进入大语言模型,两路在大语言模型内汇合。顶部示例是日语问题,先给出英语中间答案 Pericles,再给出日语答案,这种显式拼接对应论文的指令设计:用语言标签与问答标签区分任务与语言。图标上的冻结与火焰标记表示训练时更新范围不同,具体冻结与更新安排见训练节。

语音编码器 × 语音适配器: 语音编码器分工是把波形转成声学表示,语音适配器分工是把声学表示映射到大语言模型可读的文本嵌入空间,二者搭配的理由是冻结编码器保留通用声学能力而只训练轻量映射,组合意义在于让大语言模型在不重训全部参数的情况下接受语音输入。

沿一个样本走完全程有助于固定指代。假设输入是一段日语语音,提问谁开创了雅典黄金时代,同时指令要求先用英语思考再用日语回答。语音先被编码器转成帧级表示,再被适配器压缩成固定数量的查询向量,与指令嵌入拼接后送入大语言模型。大语言模型先生成英语答案,再生成日语答案。输出的目标是事实正确且语言符合要求,而不是转写原文。

课程训练与 5 样本迁移具体做了什么?

训练分为预训练课程与问答微调两大阶段。课程顺序是自动语音识别、语音识别与翻译、语音问答。自动语音识别与翻译阶段使用 FLEURS 数据集,帮助模型区分任务。指令设计用特殊标记分隔语言与任务,例如英语识别、法语识别、英语到法语翻译、问答等,原文用表格展示了这些标记组合。

问答阶段采用两步策略。第一步用约 3000 条合成英语语音与对应文本做监督微调,让模型在高资源英语下学会问答结构与事实推理。第二步对目标语言只用 5 条标注样本做少样本学习,以英语为桥把已学知识迁移到日语、粤语等语言。论文强调这种做法减少了对每种目标语言大规模标注的依赖。

自动语音识别 × 语音问答: 自动语音识别分工是学会把语音转写为同语文字,语音问答分工是根据语音内容给出事实答案,二者搭配的理由是前者先建立语音到文本的对齐,后者再复用这种对齐做推理,组合意义在于课程学习把转写能力作为问答的前置脚手架。

参数与优化条件按原文交代:语音编码器约 635M 参数并冻结,语音适配器约 80.5M 参数全部训练,包含 80 个维度为 768 的查询向量与多层感知机,大语言模型约 9.2B 参数,新增的低秩适配器约 8.9M 参数,总量约 10B。实验在 4 块 80 GB 显存的 A100 上运行一周,使用 AdamW 优化器,峰值学习率为 1×10−4,预热 1000 步后线性衰减。论文未报告梯度在编码器与大语言模型全参数上的完整路径细节,复述时不应从模型名称推定未说明的冻结范围,只按原文已明确的冻结编码器与训练适配器来表述,未报告部分应记为缺项。

评测条件、基线与指标方向是什么?

评测比较 5 类多模态大模型:GPT-4o-mini 及其音频版本、Phi-4-Multimodal、Qwen2-Audio、Qwen2.5-Omni 系列,以及作者的 LLM-SQA。文本任务比较文本模型表现,语音任务比较语音输入表现,跨语言任务比较输入输出语言交叉时的表现。条件是否完全一致需要留意:各模型的训练数据、指令模板与解码设置并不相同,因此结果是系统级比较,不是控制单一变量的消融。

指标有 2 个方向,都是越高越好。F1 分数度量词重叠,大模型裁判准确率度量语义正确性。论文明确给出两者分歧的读法:低 F1 但裁判准确率高,说明模型知道事实但没有按要求简答;高 F1 但裁判准确率低,说明回答流畅相关但事实错误,属于幻觉。研究生应记住数值相同不代表同一指标,百分点差异与相对百分比也不同。

F1 分数 × 大模型裁判准确率: F1 分数分工是度量预测答案与标准答案的字面重叠,大模型裁判准确率分工是判断语义是否正确而不苛求措辞,二者搭配的理由是开放式简答既有表达差异又有事实对错,组合意义在于同时暴露指令跟随问题与幻觉问题。

语音质量检查使用 Whisper-large-v3 做转写,以词错误率与字错误率衡量录音与原文的一致性。论文报告英语与中文错误率最低,法语、俄语、粤语较高,主要原因是领域专有名词难识别,而非整体录音质量差。凡涉及专有名词的结论都应保留这一前提,不能推广为某语言整体语音质量差。

主结果显示了多大的跨语言与跨模态退化?

论文报告文本任务中 GPT-4o-mini 最好,开源模型中 Qwen2.5-Omni-7B 最高;英语、法语、西班牙语相对较高,韩语与粤语相对较低。语音任务中 GPT-4o-mini-Audio 在英语上最好,Qwen2.5-Omni-7B 在中文与粤语上较好,LLM-SQA 通过少样本迁移获得有竞争力的总体表现。跨语言与跨模态设置下多数模型都出现下降,这是支持基准有效性的核心证据。

文本问答 × 跨语言语音问答: 文本问答分工是给出单语言文本输入下的基准事实能力,跨语言语音问答分工是要求语音输入与回答语言交叉,搭配理由是前者是后者的上限参照,组合意义在于用两者之比量化跨语言与跨模态带来的退化。

前导读:请先看雷达图外圈的学科标签与四色领域背景,再比较红色 LLM-SQA 折线与蓝色 GPT 折线在不同方向上的远近,最后看中心塌陷的小折线代表哪些模型。

看图路径: 1. 先确认外圈 20 个学科标签与背景四大领域色块的对应关系;2. 比较红色 LLM-SQA 折线与其他折线在人文与自然科学段的包络大小;3. 观察中心附近的小折线:哪些模型在多数类别上明显塌陷

原论文 Figure 5:Performance Across Categories on XSQA Task.

论文图 5。原论文 Figure 5:“Performance Across Categories on XSQA Task.”。

解释:该图展示跨语言语音问答下 20 个类别的表现,背景分为应用科学、社会、人文、自然科学。LLM-SQA 在生物、化学、医学、心理、历史、教育等方向包络较大且较均衡,Qwen2.5-Omni-7B 在计算机与法律等个别方向突出但在电影、音乐、哲学等方向收缩,Phi-4-Multimodal 与 Qwen2-Audio 在多数方向靠近中心。像素不能精确读出每类具体数值,复述时只讲相对形状与原文文字结论,不硬写刻度数值。

语音时长分析显示 LLM-SQA 在 0 到 5 秒与 5 到 10 秒的短中语音上较稳,平均裁判准确率与 GPT-4o-mini-Audio 接近,高于开源基线。特殊标记设计也被讨论:Phi-4 类模板在标准语音问答可用,但在跨语言语音问答上明显下降,说明标记需要显式考虑语言支持。重提结果时新增的适用条件是:短查询与少样本迁移是 LLM-SQA 的优势区间,长语音与完全未见语言仍是待验证边界。

哪些对照说明退化来自语言与模态本身?

论文没有提供传统意义上逐个去掉模块的消融表,但提供了两类可作为反证的对照。一是跨语言一致性比值,即跨语言任务相对单语言任务的保持率;二是跨模态一致性比值,即语音任务相对文本任务的保持率。若退化仅由题目难度引起,比值应接近稳定;实际是多数模型在跨语言与跨模态上都明显下降,且 Qwen2.5-Omni-7B 的跨模态保持率相对较高,说明 Omni 类设计在模态对齐上有差异。

另一类对照是 F1 与裁判分数的背离。同一模型在同一任务上可能出现两种指标走向相反,这支持判断不能只看字面重叠。指令要求不解释直接给答案,若模型输出冗长解释,F1 会被拉低但语义可能正确;若模型输出流畅但事实错误,F1 可能不低但裁判判定错误。

类别与时长对照进一步限定结论。类别雷达显示优势不是在所有学科均匀成立,时长分析显示优势集中在短中语音。总体趋势不等于每组都成立,复述时应避免把平均最好推广为全程最好。

基准与方法的边界在哪里?

论文在局限中明确两点。第一,基准目前只覆盖语音与文本两种模态,未来可扩展到视觉等更多模态。第二,少样本方法以英语为桥,虽然提升了多语言能力,但也引入了以英语为中心的语言偏置。这意味着非英语知识可能被迫经过英语中转,涉及文化特定事实时可能失真。

伦理部分说明所有录音志愿者签署了语音授权许可,数据使用遵守隐私与数据保护规定。资源状态方面,论文给出数据集链接,当前资源状态为可用,读者可按链接获取。可用不等于可复现全部评测,因为完整评估需要大量请求与模型访问权限。

未测量的量不应承诺改善。论文未系统测量延迟、推理开销与误判率,因此不能从准确率提升推定系统更快或更便宜。训练用一周 4 卡 A100 是成本信号,但不是推理成本。

要复现需要先准备什么、按什么顺序做?

复现应先做数据与划分核对,再做评测流程核对,最后再考虑训练。数据侧先确认 1800 对平行语音文本、800 验证与 1000 测试的划分,以及 8 语言文本与语音一一对应;不要自行补充新的语言或更换录音。构造侧按筛选、翻译、人工复核、真人录制、语音增强、对齐重录的顺序理解,每一步的监督来源不同:筛选靠人工规则,翻译靠大模型加人工复核,语音质量靠自动语音识别转写与词错误率门限触发重录。

评测侧先固定 4 种任务定义与回答语言要求,再固定 F1 与裁判两个指标。论文的裁判选择细节在附录,正文未给出完整模板,复现时应标记该缺项,不要自创裁判提示词当作原文。128000 次请求的量级意味着需要写脚本批量跑并记录每次的输入语言、输出语言与模态,避免把不同条件混在同一列比较。

训练复现先准备 FLEURS 的识别与翻译课程,再准备约 3000 条英语合成语音问答,最后为每种目标语言准备 5 条样本。关键超参数保留峰值学习率、预热步数、适配器结构与冻结范围。权重与代码的可运行性应区分看待:论文给出数据集链接为可用,但模型权重与完整训练代码的公开状态需以实际仓库为准,不从论文语句推定全部可下载。

何时值得尝试这种英语为桥的思路?

当任务是短事实问答、目标语言标注极少、已有较强英语问答能力时,这种先在英语上学会问答再用极少样本迁移的思路值得尝试。它的可运行策略很具体:固定英语问答训练,再为每种新语言补 5 条样本做适配,而不是为每种语言重建大规模语音数据。

当任务涉及高度本地化知识、长语音推理或需要严格控制延迟时,则需要补验证。英语中转可能丢失本地表达,语音时长变化可能改变优势,推理开销也未在论文中量化。此时应先在目标领域小规模复测跨语言与跨模态保持率,再决定是否投入全量训练。

对初学者的收束建议是:用平行对照的思维读所有多语言语音论文。先问题目是否平行,再问比较的基线是否可运行,最后问指标分歧在说什么。CCFQA 的价值不在于给出一个最高分,而在于提供了一个能同时卡住语言与模态的尺子,让后续改进知道损失发生在哪一步。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总