英文题目:To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech
标签:#音频问答 | #检索增强 | #语音 | #基准测试 | #音频大模型
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Debajyoti Mazumder:IISER Bhopal
- Mamta:King’s College London
- Abhirama Subramanyam Penamakuri:MBZUAI
📌 核心摘要
语音事实核查要求以声学声明为输入,以支持或反驳二值 verdict 为输出,难点在于声明在语音中而证据在文本中,模型须同时完成听辨与跨模态比对。该工作构建语音探针基准VeriSpeak,其构造先做知识库富化与原子事实抽取形成可控真声明,再经类别扰动生成伪声明并经单说话人合成与自动转写形成语音输入。验证时链条分三步衔接:先用wav2vec 2.0转写待验语音得到文本查询,再以multi-e5从知识库检索文本证据并与原始语音一并送入大型音频语言模型,大型音频语言模型 Large Audio Language Models / LALMs仍以口语主张为验证对象,最后以思维链提示约束模型显式比对主张与证据并输出二值判定。与纯文本核查相比,该设置迫使模型区分待验证的口语主张与作为背景的检索文本,而非直接复述证据。在 VeriSpeak 上语音输入相对文本骨干出现大幅下降,而检索加推理的思维调优模型达到 86.1% 平均准确率,显著高于无检索语音基线。该结论限于名人传记的时序地理关系事实与合成干净语音,未验证自然口语多说话人口音噪声与开放冲突证据。原文未披露训练推理或部署成本。
🔗 开源与复现资源
数据相关资源:https://huggingface.co/datasets/abhiram4572/VeriSpeak — 暂时无法访问
第三方资源:https://reutersinstitute.politics.ox.ac.uk/digital-news-report/2025 — 链接可访问(HTTP 200)
第三方资源:https://www.wikipedia.org/ — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,哪些信息必须保留?
这篇论文研究的是语音事实核查。输入是一段说出某个 factual claim(事实性声明)的语音,例如某人何年成名、来自哪个国家、与谁结婚。输出是一个二选一判定:该语音内容在事实上是否正确,回答是或否。初学者可以把任务理解为听完一句话后做判断题。
与纯文字核查不同,这里声明是声音形式,而证据是文字形式。模型必须完成三件事:从音频中恢复声明说了什么,把该声明固定为待验证目标,再用检索到的文字证据去对照。为了能复述方法,必须保留的信息包括声明的模态、证据的模态、判定标签的含义,以及比较是否公平。论文反复强调,有效的语音辟谣不仅需要听懂,还需要把声明和证据分开并做有根据的推理。
大音频语言模型 × 文本大语言模型: 文本大语言模型负责在文字上做知识判断,大音频语言模型则是在其骨干上接入语音编码器以听懂语音,二者搭配的理由是检验同一份事实能力换了输入通道后是否还在,组合意义在于把文本核查成绩当作参照系,分离出语音接口本身带来的损失。
本文面向刚进入语音或音频方向的研究生,重点讲清楚数据如何构造、6 种对照条件如何变化、检索与推理各自起了什么作用。所有数字都以论文原文为准,不做引申评价。
这项任务与已有路线有什么不同?
事实验证的经典路线是先检索再验证。论文回顾了文字领域的 FEVER、HoVer、SciFact 等基准,它们的共同点是先找到相关证据,再判断声明被支持还是被反驳。检索增强生成也是类似的先检索再利用的思路。
多模态事实核查把问题扩展到图文,多集中在图像加文字的错误信息。语音事实核查则是另一条跨模态路线:声明是声学的,证据是文本的。模型不能把检索到的文字直接当成答案,必须保留语音声明作为验证对象。
在大音频语言模型方面,论文列举了 Qwen-Audio、Qwen2-Audio、Audio-Flamingo、Phi-4-Multimodal 等系统,说明它们能在语音上跟随指令,但这不等于能做事实验证。另一支相关工作是模态差距研究,即同样语义用不同模态输入时模型行为不同。本文的增量是把模态差距具体放到证据接地的验证任务里,考察声明理解与证据使用两个环节。
论文要回答的四个具体问题是什么?
论文把大问题拆成可对照的研究问题。第一,文本上的事实验证能力能否可靠迁移到语音。第二,文本到语音的下降到底发生在文本侧适配还是语音输入环节。第三,检索能否补偿这种差距,转录检索与音频直接检索谁更可靠。第四,显式推理在什么时候有用,尤其是有无检索时的差别。
每个问题都对应固定的条件对比。例如第一个问题比较纯文本大模型与纯语音模型的平均准确率。第二个问题把总差距拆成文本模式差与语音输入差。第 3 个问题比较无检索语音基线与两种检索变体。第 4 个问题比较无检索加推理与有检索加推理。这样的拆分让读者可以沿着同一批声明复述每一步操作。
六种验证流水线如何沿同一个样本走完?
论文用一个假声明作为贯穿例子:文字写的是 J-Ax 是 1 名韩国歌手,语音说的是同一句话,真值是否定,因为正确事实是 J-Ax 是意大利歌手。6 种流水线都从这个输入出发,只是模型接口和附加信息不同。
为理解全景,先看论文给出的 6 条流水线总览图,图中从上到下排列了从纯文本到语音加检索加推理的全部对照,绿色对勾与红色错叉标出每条的判定正误。
看图路径: 1. 先看顶部同一条英文假声明的文字与语音两种输入形式;2. 再看右侧真值框如何给出正确事实与否定标签;3. 逐行对比 C0 到 C5 六条流水线的输入与输出正误;4. 重点观察 C4 仍错而 C5 转对所说明的推理作用
论文图 1。原论文 Figure 1::“VeriSpeak probe pipelines for spoken fact verification.”。
图中可见的教学要点是:纯文本大模型能判对,换成音频语言模型处理文字或语音时仍判错,单加转录检索依然判错,只有转录检索加思维链才恢复正确。这张图把后文表格中的核心失败模式可视化了,即检索 alone 容易把声明与证据混淆,而检索加推理保住了声明与证据的区分。
声明目标 × 证据文本: 声明目标是必须被判定真假的那句语音内容,证据文本只是用来支撑或反驳的背景资料,分工上前者是判题对象后者是参考材料,搭配理由是跨模态核查要求两者不能混淆,组合意义在于论文指出的主要失败就是模型把证据当成了声明去验证,导致检索反而无效。
沿样本走一遍:在 C0 中文字声明进入文本模型,直接输出否。在 C2 中语音进入音频语言模型,模型需先听懂再判断,但论文显示它常失败。在 C4 中语音仍是待查对象,另附检索文本作为背景,但模型可能去验证背景本身。在 C5 中同样有语音和背景,但提示要求先逐字转写声明,再逐步推理,最后给出答案,从而强制比较。
转录检索流水线的组件与计算顺序是什么?
转录检索流水线由 3 个可复述的部件组成。第一是自动语音识别,论文默认用 Wav2Vec 2.0 把语音声明转写成文字查询。第二是文本检索器,默认用 multi-e5,另用 e5-large-v2 和 msmarco 做敏感性对照,把查询与知识库中的传记文本做向量相似度搜索。第三是验证器,即被测的音频语言模型,它同时收到原始语音和检索到的文本证据,并输出是或否。
下图展示了该流水线的连接方式,左侧是语音与提示进入模型,上方是模型输出,下方虚线框内是转写、编码、向量搜索的检索路径。
看图路径: 1. 先沿语音框经语音识别到文本编码再到向量库的检索路径看;2. 再看检索到的文本块如何与提示词一起进入上方的音频语言模型
论文图 3。原论文 Figure 3::“Transcript-RAG pipeline. ASR transcribed spoken claim is used to retrieve textual evidence, which is leveraged by LALM to verify the spoken claim.”。
从像素上可以读出:底部语音框引出语音识别模块,再经文本编码进入向量库做余弦相似度搜索,选出的编号文本块经检索增强通道送入上方模型。图例同时标明大音频语言模型、文本编码器与语音识别器的含义,便于初学者把每个缩写对应到真实模块。
转录检索增强 × 音频查询检索: 转录检索增强先用语音识别把语音转成文字再去查文本证据,音频查询检索则直接用语音向量去查文本,二者分工都是给模型补外部证据,搭配比较的理由是看查询通道是否影响证据质量,组合意义在于论文发现转录路线更可靠,而音频直查因召回过低而更弱。
作为对照,音频查询检索不用转写,而是用 CLAP 把音频查询与文本证据映射到共享空间直接搜索。论文报告其召回很低,因此顶层证据常不相关。
思维链提示 × 检索增强验证: 检索增强验证负责把外部文本证据摆到模型面前,思维链提示负责让模型先转写声明再逐步比较,分工上一个供料一个管比较流程,搭配理由是防止模型把证据当成待查声明,组合意义在于只有两者同在时声明与证据的区分才被保住,准确率才稳定上升。
提示词也是组件之一。非推理条件只要求回答是或否。推理条件要求先在特定标签内逐字转写声明,再逐步推理,最后在答案标签内只写是或否。若输出缺少可解析的答案标签,则按错误计分。
没有训练新模型时,数据是如何构造出来的?
本研究没有训练新的大模型,而是构造了一个探测基准并调用已有模型做评估。因此本节讲清构造计算过程。知识库起点是名人简介集合,每个实体有编号,实体名出现在记录开头。作者用该名字抓取维基百科以补全出生国家和性别,并把英国等 umbrella 条目拆成英格兰、苏格兰、威尔士、北爱尔兰,同时修复空值和历史国名。
接着按 3 类事实打标:时间事实用 4 位数年份正则,年份类;地理事实用 spaCy 命名实体识别找地理跨度;关系事实用婚姻、父母、兄弟姐妹等关键词在句子级匹配。这种分类让后文可以诊断差距是均匀的还是类别特定的。
原子事实抽取用 Llama-3.2-3B-Instruct 对每位名人生成单句、无代词、锚定在相关信号上的句子,少于 4 个词或含未消解代词的输出在后处理中丢弃。错误对照用确定性扰动生成:年份在正负十内平移非零偏移;地理把国家、城市、国籍跨度换成同类型候选,且排除名人本国;关系以等概率做关系词替换或人物组织实体替换,且不换成名人自己。无法生成有效负例的名人被丢弃,以保持标签平衡。
语音合成用 Coqui TTS 的 tacotron2-DDC 声码器,故意用单说话人模型,以防模型利用说话人身份做捷径。每条目包含音频文件、Wav2Vec 2.0 自动转写和真值标签。作者明确用自动转写而非完美文本,以反映部署条件,尽管这会增加难度。
下图是 659 位主题人物的人口分布,可用来核对构造覆盖面。
看图路径: 1. 先看横轴人数与纵轴国家排列确认美国与英格兰占主体;2. 再对比每条中蓝色与粉色段的男女比例构成
论文图 2。原论文 Figure 2::“Demographic breakdown of VeriSpeak’s 659 subject entities.”。
从像素上看,横轴是人数,纵轴是国家,美国条最长并标注 278,英格兰 79,印度 42,其余国家依次递减,尾部合并为 45 国共 97 人。每条内蓝色与粉色分别表示男性与女性,非二元与未知极少。论文文字给出总体为 60 国,男 392、女 265、非二元 1、未知 1。
下表整理基准规模与附带信息,便于复现时核对数量与字段。表前提出的问题是:基准有多大、3 类如何分布、每条包含什么、人口是否偏斜。比较条件是同一套构造流程下的计数,指标方向是数量与覆盖越清楚越好。
| 条件 | 指标 | 规模 | 构成 | 附带物 |
|---|---|---|---|---|
| VeriSpeak 全集 | 条目数 | 3879 条 | 年份 1451 条,地点 2226 条,关系 202 条 | 音频,转写,真值标签 |
| 主体覆盖 | 人数与国家 | 659 人,60 国 | 美国 278 人,英格兰 79 人 | 性别男 392 人,女 265 人 |
| 标签 | 正负平衡 | 平衡划分 | 正确与错误各约一半 | 合成假声明仅供评测 |
| 语音 | 合成方式 | 单说话人 | Coqui TTS | 自动转写含错 |
表后解释是:规模数字支持后文按类别汇报准确率,人口分布说明结果主要反映美国与英格兰主体的名人传记事实,不能推广到科学、医疗、多跳或自发噪声语音。未胜出项是关系类仅 202 条,样本最少,后文提升也最小,复现时应注意小样本波动。资源状态方面,论文正文给出 Hugging Face 数据集链接,但本次资源检查显示该链接暂时不可达,因此当前只能写本次未能确认可达,不能写已公开可用。
模型、条件与指标如何对齐才能公平比较?
评估覆盖 3 个模型家族。Qwen 家族用 Qwen-7B 作文本参照,语音侧测 Qwen-Audio-Chat 与 Qwen2-Audio-7B。Qwen2.5 家族用 Qwen2.5-7B 作参照,语音侧测 Audio-Flamingo-3,另测思考调优的 Audio-Flamingo-next-think。Phi 家族用 Phi-4-mini-instruct 作参照,语音侧测 Phi-4-multimodal。每个语音模型都与其文本骨干配对,并在文字与语音两种输入下测试,以分离文本能力与语音退化。
条件编号为 C0 到 C5。C0 是文本大模型看文字声明。C1 是音频语言模型看文字声明。C2 是音频语言模型听语音声明。C3 是 C2 加思维链但无检索。
C4 是语音加转录检索。C5 是转录检索加思维链。另有音频查询检索变体和纯文本检索上限。所有实验在三块 48 GB 显存的 A6000 上运行,结果为 3 次运行平均。
指标是每类准确率与 3 类平均准确率。论文定义了两个比较量,第一个衡量相对文本基线的差距,第二个衡量相对语音基线的提升。
\[\Delta=A(\mathbf{T}_{\mathrm{LLM}})-A(\text{setting}).\]上式中符号含义是:A 表示平均准确率,T 表示配对文本基线条件,setting 表示被评估的条件。正值表示相对文本基线下降,负值表示超过文本基线。
\[{Lift}=A(\text{setting})-A(\mathbf{S}_{\mathrm{LALM}}).\]上式中 S 表示配对语音基线,正值表示相对纯语音条件有提升。思维链条件下缺少可解析答案标签的输出按错误计分,这对理解 Phi 的低分很关键。
文本能力迁移到语音时下降了多少?
要回答迁移问题,需比较 C0 与 C2。论文报告文本骨干在文字上可靠,但同一批声明换成语音后普遍失败。Qwen 的差距最大,Audio-Flamingo 的差距相对较小,但所有家族都出现下降,说明这不是某个模型的偶然现象。
下表把文本参照与语音基线的关键数字放在同一视图,表前的问题是:在相同声明下换模态损失多少百分点。公平条件是同一批声明、同一家族配对,指标方向是平均准确率越高越好,差距越小越好。
| 条件 | 指标 | 文本参照 | 语音基线 | 差距含义 |
|---|---|---|---|---|
| Qwen-7B 家族 | 平均准确率 | 75.3% | 50.4%,49.2% | 下降 24.9,26.1 点 |
| Qwen2.5 家族 | 平均准确率 | 71.8% | 58.5% | 下降 13.3 点 |
| Phi 家族 | 平均准确率 | 68.0% | 49.2% | 下降 18.8 点 |
| 总体判断 | 是否迁移 | 文本可靠 | 语音接近随机 | 不可靠迁移 |
表后解释是:主要收益是确认了文本到语音的模态差距,代价是即使文本侧很强的模型,语音侧也可能跌到接近二分类随机水平。未胜出项是 Qwen2-Audio 在语音下全判否仍只有约一半准确,说明接近随机的分数不能都归因于固定答案行为。论文进一步把总差距拆成文本模式差与语音输入差,发现文本侧有升有降,但语音输入替换一律带来下降,其中 Qwen2-Audio 与 Phi 的语音内下降分别达 27.2 与 23.2 点,因此主要瓶颈在语音接口本身。
转写质量分析支持上述判断。论文让人转写 50 条以作可懂度参照,平均词错率约 0.105,而模型转写词错率在 0.13 到 0.23 之间。Audio-Flamingo 的词错中约 74% 涉及人名等专有名词,非名字词错仅约 3%,说明通用可懂度尚可,难在实体识别。把模型转写喂给文本模型的对照显示,识别错误带来 5.6 到 11.6 点的验证下降,但词错率不能完全决定验证成绩,因为关键实体年份地点的错误影响更大。
检索与推理各自补了多少,合在一起又如何?
检索补偿的测试比较语音基线与两种检索。转录检索用 multi-e5 对 4 个普通模型都有提升,但提升幅度小,平均仅约 2.3 点,剩余差距仍大。音频查询检索更弱,平均提升为负,原因之一是其首位召回仅约 0.3%,顶层证据常不相关。
下表聚焦检索方式对比,表前问题是:同样给证据,查询通道不同是否影响成绩。公平条件是同一语音输入与同一验证器,只换检索查询来源,指标方向是准确率越高越好。
| 条件 | 指标 | 语音基线 | 转录检索 |
|---|---|---|---|
| Qwen-Audio-Chat | 平均准确率 | 50.4% | 51.8% |
| Qwen2-Audio-7B | 平均准确率 | 49.2% | 50.9% |
| Audio-Flamingo-3 | 平均准确率 | 58.5% | 60.0% |
| Phi-4-multimodal | 平均准确率 | 49.2% | 53.9% |
表后解释是:转录检索普遍略好,音频直查在 Audio-Flamingo 上还明显倒退约 4.9 点,说明证据可用性不是唯一瓶颈。论文用 50 条错误样本做诊断,让模型抽取出它认为要查的声明,结果仅 31% 与原声明一致,65% 与检索证据一致,说明模型常把证据本身当成待查对象并回答是,这解释了检索增益有限。
推理的对照更有区分度。无检索时加思维链对普通模型一律变差,Qwen 2 模型各降约 5 点,Phi 因格式失败跌到 16.7%,其中仅 29.8% 输出含可解析答案。有检索时加思维链则 4 个模型全部变好,平均提高约 4.9 点。
下表把无检索推理与有检索推理放在一起,表前问题是:推理在有无证据时效果是否相反。公平条件是同一模型、同一语音输入,只改变是否给证据与是否给推理,指标方向相同。
| 条件 | 指标 | 语音无推理 | 语音加推理 | 检索无推理 | 检索加推理 |
|---|---|---|---|---|---|
| Qwen-Audio-Chat | 平均准确率 | 50.4% | 44.9% | 51.8% | 52.8% |
| Qwen2-Audio-7B | 平均准确率 | 49.2% | 44.4% | 50.9% | 57.0% |
| Audio-Flamingo-3 | 平均准确率 | 58.5% | 57.0% | 60.0% | 65.5% |
| Phi-4-multimodal | 平均准确率 | 49.2% | 16.7% | 53.9% | 60.7% |
| 总体模式 | 推理作用 | 无证据时有害 | 格式也可能崩 | 有证据时有益 | 比较环节被激活 |
表后解释是:主要收益在有证据时出现,代价是无证据推理可能 destabilize 判定,Phi 的极低分部分是格式不合规而非纯事实错误。未评测边界是提示词固定,若换提示或放宽解析,数字可能变化,但论文的严格计分让比较保持一致。
模态差距 × 思考调优: 模态差距指同样语义用文字能判对、用语音就判错的现象,思考调优指在训练阶段就强化逐步推理能力的模型版本,分工上一个描述问题一个提供能力,搭配理由是检验推理能力是否能缩小差距,组合意义在于思考调优模型在检索加推理下提升幅度远大于普通模型。
思考调优模型的对比显示更大差异。普通 Audio-Flamingo 从语音基线到检索加推理提升 7.0 点,而思考调优版本从 66.4% 经 71.8% 到 81.4% 再到 86.1%,提升 19.7 点,且超过无检索文本基线 14.3 点,但仍低于纯文本检索上限 6.3 点。
下表汇总最强证据与剩余差距,表前问题是:推理能力是否改变检索的利用效率。公平条件是同一家族参照与同一 4 种语音条件,指标方向相同。
| 条件 | 指标 | 普通模型 | 思考调优模型 | 上限参照 |
|---|---|---|---|---|
| 语音基线 C2 | 平均准确率 | 58.5% | 66.4% | 文本 71.8% |
| 转录检索 C4 | 平均准确率 | 60.0% | 81.4% | 差距 11.0 点 |
| 检索加推理 C5 | 平均准确率 | 65.5% | 86.1% | 差距 6.3 点 |
| 声明证据混淆 | 诊断比例 | 65% match 证据 | 区分更好 | 待验证 |
表后解释是:思考调优不仅让无检索推理从负转正,还让检索增益放大,最终在语音上超过无检索文本基线。代价是与全文本检索上限仍有 6.3 点差距,说明语音文本对齐尚未完全闭合。论文还报告类别差异:时间类平均提升最大,关系类提升最小且最难,因为需要保留角色方向与主谓宾结构。
哪些结论不能推广,哪些数字不能混读?
论文明确把 VeriSpeak 定位为受控探测基准。事实域只覆盖名人传记中的时间、地理、关系 3 类,未覆盖科学、医疗、数值、因果、多跳声明。语音是单说话人合成,不含自发语音、背景噪声、口音方言、多语。检索在固定证据集合上进行,不是开放世界的噪声、冲突或时效证据。因此高分不能直接理解为开放部署的辟谣能力。
指标解读也需小心。平均准确率是 3 类平均,百分点差与相对百分比不同,不同指标的差值不能混放。自动转写词错率低不等于验证一定好,关键实体错误权重更大。Phi 在无检索推理下的极低分部分来自答案格式缺失,给证据后可解析率从 29.8% 回升到 82.4%,因此不能只按事实能力解读。
人口切片显示检索加推理对男性主体提升略大于女性,但文本基线在男性上也更高,所以剩余差距反而更大。国家切片中美国闭合最好,英格兰与印度终值高但剩余差距大,德国终值与提升都最低。这些都说明总体趋势不等于每组都成立,复现时应按类别、性别、国家分别汇报。
要复现这套对照,先做什么,需要什么信息条件?
复现先从数据与代码可得性入手。论文给出数据集链接,但本次检查显示该链接暂时不可达,应写本次未能确认可达,不宜写已公开可用。模型侧需准备各家族的文本骨干与语音版本,以及 Wav2Vec 2.0 转写、multi-e5 检索、CLAP 音频检索的实现。硬件参照是三块大显存 GPU,结果取 3 次平均。
其次固定提示与计分。非推理提示只要求回答是或否,推理提示要求先转写再推理最后在答案标签内作答,缺标签按错计分。检索时把转写作为查询,取回的文本块拼成背景信息,与语音一起送入模型。音频查询分支则用音频直接检索。
再按 C0 到 C5 顺序跑通同一批声明,分别记录年份、地点、关系 3 类准确率与平均值,再算相对文本基线的差距与相对语音基线的提升。建议同时记录可解析率与固定答案比例,以区分格式失败与事实失败。最后补转写词错率与转写对照条件,以估计识别误差的贡献。
还需补的验证包括多说话人、自然噪声、方言口音、多语声明,以及开放检索下的冲突证据处理。论文未来工作也指向这些方向,并强调理想目标是无检索时语音与文字同样可靠,检索只用于时效或开放知识,而不是补偿语音侧的知识不可达。
何时值得尝试检索加推理,何时应先补基础?
当任务是语音声明配文本证据,且模型能听懂但判不准时,值得尝试转录检索加显式推理。操作要点是保留语音为待查对象,用转写做检索查询,用结构化提示强制先转写再比较,最后做严格解析。思考调优模型更可能从中受益,普通模型也有一致但较小的提升。
当语音转写中人名地名错误多、或模型频繁输出无答案格式时,应先补基础:改进实体识别、放宽或修复解析、检查提示跟随,而不是只加更多证据。音频直接检索在当前召回下不值得作为首选。
总体上,论文显示的证据是:模态差距真实存在且主要来自语音接口,检索 alone 只能部分补偿且可能被误用,检索加推理改善声明与证据比较,思考调优进一步放大收益但仍未达到纯文本检索上限。这些判断都有具体对照支撑,超出证据的延迟、成本与误判率改善则属于待验证,不应承诺。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
