英文题目:PIVOT: Physics-Grounded Verification for AI-Generated Audio-Video Detection

标签:#音频深度伪造检测 | #基准设计 | #音视频 | #基准测试

评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Bo Zheng:机构信息未在 arXiv HTML 中可靠披露
  • Kangran Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Xiaoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Weinan Guan:机构信息未在 arXiv HTML 中可靠披露
  • Zhiheng Li:机构信息未在 arXiv HTML 中可靠披露
  • Yize Chen:机构信息未在 arXiv HTML 中可靠披露
  • Haizhou Li:机构信息未在 arXiv HTML 中可靠披露
  • Qingshan Liu:机构信息未在 arXiv HTML 中可靠披露
  • Siwei Lyu:机构信息未在 arXiv HTML 中可靠披露
  • Baoyuan Wu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为含同步声音的短视频片段,输出为真实或生成二分类及按物理定律与时间窗组织的证据,难点在于外观与同步感易被模仿而物理细节仍难完全自洽。方法为字幕生成、物理量估计、定律选择、一致性验证四步流水线:字幕只做事实描述而不判真伪;物理量估计从视频恢复轨迹几何并从音频恢复事件级声学量;定律选择仅凭字幕与可用字段名挑选约3条可验证定律;一致性验证对每条适用约束判支持或违反或不确定并经3次独立运行多数投票。与固定物理特征全局打分及直接用大模型看真实感不同,该框架要求先显式写出适用条件、所需字段与可检查的操作约束,再核查压缩量表。在PhysForensics-Bench测试集Real加Veo子任务上准确率为72.16%,F1为65.82%,高于Gemini 3.1 Pro直接音视频检查的57.22%和63.44%。结论限于9类短时力学与声学事件及Veo 3.1 Fast与Seedance 2.0两种生成器,对渐变变形与小目标弱观测场景失效,且未做跨新生成器纵向验证。原文未披露训练推理成本与解码参数。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,为什么不只看像不像?

本文的输入是一段同时带有画面与声音的短片段,目标是判断它是对真实物理事件的记录,还是由生成模型合成的音视频。输出不只是一个真或假标签,还要求给出支持证据,记录每条适用定律的验证结果、相关时间窗和所用物理量。必须保留的信息包括估计出的结构化物理量、选出的定律及其可操作约束,以及每个定律时间窗的判定状态。论文的起点是生成模型的外观真实感已经很强,直接让大模型看整体印象容易被同步的声画、合理的轨迹和逼真的背景瑕疵说服。作者因此把问题改写为物理接地验证:被描绘事件是否满足由物理定律导出的可测量约束。

伪影线索 × 物理一致性验证: 伪影线索负责从外观、频率或帧间不一致中找生成器留下的痕迹,分工是看媒体自身;物理一致性验证负责检验画面中事件是否满足可测量的物理约束,分工是看被描绘事件的行为;二者搭配的原因是生成器升级可能抹掉前者而仍难复现后者,组合意义是把判决依据从整体真实感印象转到按定律和时间窗组织的证据记录。

下面用一个弹跳球的例子说明这种改写如何工作,该例子是教学示意而非新增实验。假设一段球在桌面反复弹跳的片段,画面看起来每次撞击都有声音。如果只看像不像,可能会判为真实。但若把每次反弹最高点换算成高度,把每次撞击声的起始时刻差换算成声间隔,就可能发现后段高度不降反升、声间隔不缩反长,这与被动弹跳耗散能量的预期矛盾。论文正是要求检测器先把这类量测出来,再把它们与能量衰减和弹跳间隔等约束对照,而不是停留在同步与否的整体感觉上。

导读这张动机图时,先不要直接接受左右两栏的文字结论,而是把上方面板当作 1 次测量练习。图中用彩色叠加轨迹展示球从左向右多次弹跳,用粉色波形展示对应的撞击声,橙色框分别圈出视频后段与音频后段需要比较的区间。这种把视觉高度趋势与听觉间隔趋势并排呈现的版式,就是后文标题加估计加选择加验证流程想要机械化的检查动作。

看图路径: 1. 先看上方面板中球轨迹随时间从左向右的高度变化,注意橙色箭头标出的后段升高;2. 再看中间音频波形上方标注的 533 ms、561 ms 到 631 ms 的间隔变长趋势;3. 最后对比下方左右两栏,左侧强调同步与外观真实,右侧给出反弹高度与声间隔的具体数值与违反的衰减预期

原论文 Fig. 1:From artifact cues to physics-grounded verification.

论文图 1。原论文 Fig. 1::“From artifact cues to physics-grounded verification.”。

这张图的可执行信息在于两处被放大的反常趋势。视频侧的橙色箭头指向第四到第六次反弹高度的上升,音频侧用 3 个括号标出声间隔从五百多毫秒向六百多毫秒的拉长。下方左侧的大模型目检强调同步完美与阴影合理,给出真实判断;右侧方法则把高度与间隔的具体数值与能量衰减和间隔衰减的预期并置,给出生成判断。初学者复述时应抓住这 1 对比:前者依据整体印象,后者依据可回查的时间窗与数量,本文后续所有组件都是为了让后者可以被稳定地算出来。

已有检测路线与本文的对照点在哪里?

已有工作提供了 3 类有价值的信号。第一类是通用生成视频检测,例如学习帧间一致性、空时不一致或大规模跨生成器评测,其优势是覆盖面广,但所用线索可能随生成器演进而变弱。第二类是面向人脸与口唇的音视频伪造检测,例如学习视听对应、细粒度空时不一致或唇音错位,其优势是在人脸场景下定位精确,但本文关注的是球、气球、硬币、斜坡小车等一般物理事件,不是身份与口型。第 3 类是生成视频的物理常识评测,例如围绕显式物理定律组织评估或评价动作类物理合理性,其优势是提出了物理视角,但多用于评价生成质量而非返回逐定律真假证据。

与上述路线相比,本文的对照点是明确的。论文特别讨论了两种与物理相关的视频检测器:一种用牛顿力学启发的 2 阶时间特征的标准差作为分数,另一种从概率流守恒导出归一化空时梯度并与真实参考比较。作者认为这些方法把固定的物理启发公式直接用于所有输入,而本文要求先判断哪些定律与当前事件相关、又能被现有数量字段验证,再实例化约束并逐条检验。换句话说,前者是统一公式打分,后者是按事件选择可验证的检查项。

在音视频联合方面,论文也区分了伪造检测与生成内容检测。面向人脸的多模态伪造检测处理的是局部篡改与唇音同步,本文的基准则强调轨迹连续、能量衰减与撞击同步等事件级约束。另有工作从声学测量出发做生成评估或音频物理敏感性测试,本文则把类似思想推进到真假检测,并要求输出按定律与时间窗组织的核查记录。初学者容易误以为用了物理名词就属于同一任务,复述时应按输入是否含音频、目标是评价生成质量还是判断真假、监督是否来自真假标签这 3 个维度对照,才能避免把类别差异当成同条件胜负。

物理接地验证把检测形式化成什么可检验问题?

论文把音视频生成内容检测形式化为检验被描绘事件是否满足可测量约束。给定片段,先恢复视频与音频中的物理量,再选出与该事件相关且能被现有量验证的定律,把每条定律写成一个或多个可操作约束,最后用估计量支持或反驳这些约束。框架原则上可以扩展到更多定律,前提是所需物理量能够被可靠估计;当前实现聚焦于可从物体运动、接触动力学、场景几何与相关声学事件中获得证据的事件中心片段。

这个形式化包含两个缺一不可的条件。相关性要求定律与标题描述的事件语义对应,例如弹跳场景才谈反弹能量,释放场景才谈释放同步。可验证性要求定律所需的字段已经暴露在物理量接口中,例如需要声起始时刻就必须有声事件表,需要速度反向就必须有轨迹与速度字段。若只满足相关而不满足可验证,检验就无法落地;若只满足可验证而不满足相关,就会做大量无关检查。

验证在这里的含义需要准确理解。论文明确指出,验证表示以公式为指导、基于估计物理量的一致性评估,而不是精确物理仿真或完整系统辨识。当前多数约束是定性或序关系的检查,例如后 1 次反弹高度是否不高于前 1 次,而不是要求从单目几何中精确还原重力加速度并与标准值比对。这种选择与单目深度、掩膜传播与声事件定位的精度现状有关,后文的限制小节会继续说明其代价。

标题加估计加选择加验证如何走完一个样本?

论文提出的方法名为 PIVOT,全称是面向物理接地的验证器。它的推理流水线分为 4 步。第一步是标题生成,只做事实描述,不做真假判断。第二步是物理量估计,从视频与音频流中抽取带时间索引的结构化数量。第三步是物理定律选择,根据标题与可用字段选出适用定律并实例化约束。

第 4 步是物理一致性验证,对照数量评估约束,给出真假判决与按定律和时间窗组织的证据。不适用的定律时间窗对直接省略,不进入报告。

标题生成 × 物理量估计: 标题生成负责用简洁事实段落说明物体、表面、交互和时间阶段,为选定律提供语义上下文但不做真假判断;物理量估计负责把视频和音频转成带时间戳的结构化记录,供后续检查使用;二者搭配的原因是只有同时知道发生了什么和能测到什么,才能提出可验证的约束,组合意义是形成标题加估计加选择加验证的显式决策链。

沿一个弹跳球样本走一遍有助于建立整体依赖。输入进入后,标题生成器写出球在桌面从左向右弹跳等事实;视频估计器给出球与桌面的轨迹、速度、距离等帧级记录,音频估计器给出每次撞击的起始时刻、峰值分贝与谱特征等事件级记录;选择器据此提出撞击同步与能量衰减等检查;验证器比较声起始与可见接触的时刻差,比较前后反弹高度与响度的变化方向,最后输出判决与证据。这种分解把观测、物理预期与验证结果分开,使更强的估计器可以通过同一数量接口替换进来。

在进入组件细节前,先用流程图固定输入输出与分支汇合位置。该图把标题生成放在左下,把视频与音频估计放在中上,把定律选择放在中下,把验证与报告放在右侧,有助于理解标题与数量如何共同决定检查项,以及验证结果如何同时产生定律级状态与样本级标签。

看图路径: 1. 沿左下步骤一标题生成指向步骤三选择器的箭头,确认语义如何进入选定律环节;2. 沿中间步骤二视频与音频估计器指向右侧验证器的两条量输入线,确认结构化数量的流向;3. 观察右上定律级结果中同一片段同时出现支持与违反两种状态,再看右下报告如何综合成最终判决

原论文 Fig. 2:PIVOT inference pipeline. Step 1: Captioning generates clip captions without making a detection…

论文图 2。原论文 Fig. 2::“PIVOT inference pipeline. Step 1: Captioning generates clip captions without making a detection decision.”。

结合像素可以读出 3 个关键动作。第一,标题文本与可用数量共同进入选择器,选出的撞击同步与能量衰减约束以不等式与排序形式写出。第二,视频位置速度距离与音频事件响度起始时刻共同进入验证器,验证器对每条定律输出支持或违反。第三,示例中撞击时刻对齐得到支持,但响度下降而反弹高度上升导致能量衰减检查被判违反,最终报告据此给出生成结论。复述时应强调同一片段可以部分支持、部分违反,判决依据的是具体违反项而非单一分数。

物理量接口、压缩与定律选择如何实现?

物理量估计在本文中是外部可替换模块,框架只要求它们暴露命名明确、对时对齐的物理量。视频侧用帧级记录,音频侧用事件级记录,数量字段保留时间戳,并在适用时保留单位与坐标约定。下游组件只消费这些结构化记录,不依赖估计器内部隐特征。论文用图示给出两条视频示例分支:基本视觉属性分支通过物体分割得到标签与掩膜范围,可导出可见面积;运动学分支通过 3 维物体跟踪恢复公共坐标系下的轨迹,可导出位置、速度与加速度。其他估计器可以替换或扩展这些路径,以提供物体对关系或其他物理量。

\[B_{i}=\mathcal{B}_{\theta}(\mathbf{x}_{i}).\]\[M_{i}=(A_{i},V_{i}).\]

上面两条公式分别固定了标题与数量的符号。第一条表示第 i 个片段的标题由标题映射生成;第二条表示该片段的完整数量由音频事件级记录与视频帧级记录组成。初学者应先记住符号的输入输出:标题的输入是原始音视频,数量的输入也是原始音视频,但二者的输出形态不同,前者是自然语言段落,后者是可供查表的结构化字段。

音频侧的设计需要单独说明,因为它直接影响时间锚点的可靠性。估计器并行使用两条互补线索:低频带语义检测找出可识别的声音区域,高频带瞬态检测找回短促的谱变化。两类区间在融合前被放到共享时间轴上,融合规则是重叠或边界间隙在 80 毫秒以内则合并为同一事件窗口。若有语义标签则保留为主标签,同时记录事件由哪类检测器提出;纯谱事件保留为物理瞬态候选,不编造语义类别。每个事件可包含起始时刻、包络边界、持续时间、峰值分贝、均方根电平、基频、谐噪比与谱描述子。

语义声音事件检测 × 高频瞬态检测: 语义声音事件检测负责在低频带找出可命名的大块声音区域,分工是覆盖敲击等可识别事件;高频瞬态检测负责在原始采样率下用短时傅里叶带新颖度找回短促、微弱或高频的物理撞击,分工是补齐语义模型漏掉的时间锚点;二者搭配的原因是被动弹跳等过程的声学证据既需要语义也需要精确时刻,组合意义是融合后的事件区间在同一时间轴上同时保留标签与谱测量。

由于完整帧级数量序列对提示推理过长,论文在定律选择与验证前做 1 次标题条件压缩。压缩器从固定目录中选择采样策略,包括关系极值、运动学极值、运动关系稀疏组合、面积变化极值、时间均匀覆盖,以及结合关系、运动与面积候选的混合事件稀疏策略。被选策略确定性地抽取视觉核心帧并保留两侧邻帧,再把视觉与音频记录转成紧凑表格,连同采样元数据一起交给后续阶段。元数据会告诉验证器稀疏行是事件中心抽样,而非缺失观测。

\[\tilde{M}_{i}=\operatorname{Compress}(M_{i};B_{i}).\]

物理定律选择器接收标题与压缩数量的可用字段,但不直接分类真假。它的任务是选出 compact 的定律集合,并按结构化模式写出每条定律的名称、相对优先级、物理依据、所需音频与视频字段、判定依据、适用条件与失败条件。判定依据写明要检查的等式、不等式、排序、趋势或时间关系;若某模态不需要,其字段表可为空。论文举例说明,在弹跳或碰撞场景中可能产生撞击同步检查,要求声起始与附近可见接触、释放、反弹、关系距离极值、速度反向或加速度峰值在时间上一致,并要求验证器考虑低帧率、遮挡、漏检与合并包络等因素。

\[L_{i}=\mathcal{P}_{\theta}\!\left(B_{i},\operatorname{Fields}(\tilde{M}_{i})\right).\]

上面的公式把选择过程写成标题与可用字段到定律集合的映射。复述时要强调选择器在看到完整数值表之前工作,因此每条判定依据必须能从可用字段求值,这是可测量性约束的计算含义。

验证阶段接收已选定律、标题与压缩数量,对每条定律评估约束并记录支持、违反或不确定,同时保留所用数量观测与文字解释。

\[\left(\hat{y}_{i}^{(r)},R_{i}^{(r)}\right)=\mathcal{V}_{\theta}\!\left(L_{i},B_{i},\tilde{M}_{i}\right),\qquad r\in\{1,2,3\}.\]

该式表示每次独立验证运行返回一个二分类标签与一份结构化报告,运行索引取 1 到 3。最终样本标签是 3 次运行标签的多数投票,三份报告全部保留,置信度不参与加权。定律权重只向验证器传达相对优先级,不作为确定性分类器的系数,加权支持率与违反率只作为报告诊断,不决定运行级或最终标签。

事件相关性 × 可测量性约束: 事件相关性负责判断某条物理定律是否与当前片段描绘的碰撞、释放或反弹等过程有关;可测量性约束负责判断该定律所需的音频与视频字段是否已在压缩物理量表中出现;二者搭配的原因是物理定律空间很大,不加限制会产生不可检验的空断言,组合意义是物理定律选择器只实例化既相关又能用现有字段检验的约束。

逐定律验证 × 多数投票: 逐定律验证负责对每条已选定律在适用时间窗内给出支持、违反或不确定,并记录所用数量与解释;多数投票负责把 3 次独立验证运行的二分类标签合并为样本级判决,置信度不参与加权;二者搭配的原因是单次大模型推理存在随机失败,需要把可检查的证据与最终判决分离,组合意义是保留三份完整报告的同时用投票降低偶发错误。

导读估计器结构图时,应把左右两大块分开阅读。左侧视频部分从输入视频经物体分割与 3 维跟踪汇入数量抽取,输出标签、3 维位置、面积与速度等对象级数量;右侧音频部分从输入音频经事件检测切出事件片段再做数量抽取,输出标签、峰值分贝、起始时刻与基频等事件级数量。右下还放大了一个单事件的抽取示例,标出起始线、峰值分贝箭头、持续时间跨度与基频示意。

看图路径: 1. 先看左侧视频分支从分割掩膜到三维轨迹再到数量抽取的下行路径;2. 再看右侧音频分支从事件检测切出事件片段再到量抽取的上行路径;3. 注意右下放大的单事件示例中起始时刻、峰值分贝、持续时间与基频各自标注的位置

原论文 Fig. 3:Illustrative implementations of the tool-agnostic physical quantity interface.

论文图 3。原论文 Fig. 3::“Illustrative implementations of the tool-agnostic physical quantity interface.”。

这张图的教学价值在于明确框架与具体工具的边界。上下游之间只有结构化数量表,替换分割、跟踪或声事件主干不会改变选择与验证的接口。视频示例中的掩膜与轨迹叠加只是说明一种实现路径,不是固定分解;音频示例中的事件切片与单事件放大只是说明如何从波形得到可引用的时刻与能量特征。复述时不要把示例分支当成唯一实现,而应说清接口要求的是对象身份一致、时间戳一致、字段定义与坐标约定一致。

本研究训练了什么,冻结了什么,校准了什么?

本研究没有用基准的真假标签训练检测器参数,这是理解实验条件的关键。标题生成调用已有的大模型,定律选择与验证调用大模型做结构化推理,视频与音频的感知主干多为预训练或冻结模型。论文明确指出,完整方法不使用基准标签做检测器适配或工作点校准;训练切分留给有监督基线训练,验证切分留给需要选检查点或调阈值的外部方法。

真实发生的参数拟合在视频几何校准环节。视频估计器结合冻结的物体理解路径与仿真校准的几何路径:文本驱动的检测器给出物体框,分割模型双向传播掩膜,冻结的相机与深度模型估计内参与相机运动及稠密近似度量深度,再用轻量岭回归适配器校准内参,用残差卷积适配器预测对数深度修正。这些适配器只在 Unity 仿真校准集上拟合或训练,不用基准的真假标签。仿真集由已知相机参数、位姿、物体身份、掩膜与深度的抛球仿真构成,每个物理回合从 4 个固定相机导出单目运行,按回合划分训练、验证与测试,避免同一轨迹经不同视角泄漏。

音频侧的计算过程同样不是真假监督训练。语义路径用预训练声音事件框架处理重采样波形,以概率阈值、中值滤波窗口与最小时长解码出粗事件区,再用波形起始与包络细化。谱路径在原始采样率下计算短时傅里叶带新颖度,与因果中值基线比较并经阈值、能量上升与峰值下限筛选,再做填充、长度过滤与合并。两类提议融合后再抽取能量与谱特征。

论文还报告了速度与加速度指数滑动平均系数等可复现细节,以及在 8 卡环境下运行基线特征抽取、微调与估计器预处理的硬件条件。未报告的内容应明确指出:论文没有给出大模型内部梯度路径,也没有声称冻结参数能带来确定性输出;3 次验证运行本身就承认了推理的随机性,需要用投票降低偶发失败。

基准如何构造,划分如何避免泄漏,指标如何定义?

PhysForensics-Bench 是为事件中心音视频片段设计的物理基准,强调轨迹连续、能量衰减与撞击同步等约束,而不是人脸身份或单一生成器的伪影。数据包含真实拍摄片段,以及以真实首帧为视觉参考、加文本事件描述后生成的对应片段,生成器为近期两个音视频模型。每个生成片段共享同一初始视觉上下文与高层事件描述,模型必须合成后续视觉动力学与声音。构造是成对导向但不完全平衡,因为部分生成请求被平台安全过滤拦截,例如参考帧含可见人脸或提示被拒绝,导致少数真实片段缺少全部对应生成变体。

场景覆盖 9 个家族:球弹跳、气球放气、球碰撞、篮球运球、弹射发射、硬币掉落、弹弓释放、物体沿斜坡下降,以及小车沿坡道下降。多数场景围绕受控短物理事件录制,弹射发射的真实片段例外,主要从网络收集以覆盖多样设计与视角。不同场景施加不同的物理压力:弹跳与运球强调重复撞击 timing 与衰减,气球强调可见形变与气流声,碰撞与硬币强调接触定位精度,斜坡与坡道强调连续运动推理而非孤立撞击检测。

划分在种子片段级进行,每个真实种子及其全部可用生成对应被视为一组,整体放入训练、验证或测试切分,避免共享首帧与事件描述的片段跨切分出现。指标把生成音视频当作正类,报告准确率与 F1 分数;按生成器分组时,真实加一种生成源构成一个二分类子任务。论文保留每个片段的原生容器、编码、帧率、分辨率、时长与音频编码,不做全局重编码;文件名、来源标签、容器元数据与码率不进入物理量或提示,生成片段无可见平台水印。视觉路径在解码帧上推断源帧率并用毫秒时间轴表达运动,音频路径在解码单声道波形上归一化并分别处理语义与高频瞬态。

下表是基准的数据分布,原表按场景、切分与来源报告数量。读表前要提出的问题是样本量是否足以支撑按场景诊断,以及成对结构是否平衡。公平条件是同一划分口径与同一来源定义,指标方向是数量越大表示覆盖越多,但数量多不等于难度大。

SceneTotalTestRealVEOSeed.
Ball Bounce36675122122122
Balloon Deflation15330515151
Ball Collision10821363636
Coin Drop7414262226
Object Descent on a Slope16733565556
Total1,464293513456495

该表显示总量为 1464,训练 878,验证 293,测试 293,真实 513,两种生成源分别为 456 与 495。场景层面球弹跳最多,弹射发射最少;篮球运球与硬币掉落的两种生成源数量不对称,这与安全过滤导致的缺配对有关。复述时应同时指出代价:总量与场景分布决定了按场景诊断的稳定性不同,小场景的百分比波动更大;缺配对意味着不能把每个真实片段都理解为有两个完整对应,跨生成器比较时要回到各自的真实加生成子任务口径。

主结果在什么条件下比较,谁胜出,谁未胜出?

主比较限定为未经基准适配的方法,即不用基准数据训练或微调检测器参数,但各基线的发布检查点可能已在其原始领域训练过。直接大模型行是纯提示目检,其中一个只用采样视频帧,另一个用视频加音频输入。论文用验证集真实样本的目标误报率定阈值来报告无需训练的分数方法的准确率与 F1,并强调按生成器分别报告而不是只给总分,目的是暴露生成器特异行为与预测偏置:过度预测为生成的方法可能在生成召回上很高,但一旦纳入真实样本就会在准确率与 F1 上受损。

下表整理测试集上的生成器分组结果,包含必要基线与实际可运行策略。读表前的问题是物理验证是否在两种生成源上都带来可部署的提升,公平条件是同一测试切分与同一真实加生成子任务口径,指标方向是准确率与 F1 越高越好,且二者要联合阅读以识别偏向生成的偏置。

条件指标直接大模型目检本方法比较对象
真实加第一种生成源准确率53.96%70.30%直接目检与视频分数方法
真实加第一种生成源F1 分数60.09%64.29%直接目检与视频分数方法
真实加第二种生成源准确率57.22%72.16%直接目检与视频分数方法
真实加第二种生成源F1 分数63.44%65.82%直接目检与视频分数方法

表后解释需要同时给出收益与反例。收益是本方法在 4 个生成器分组指标上均为最高,两组准确率分别达到 70.30% 与 72.16%,F1 分别达到 64.29% 与 65.82%,支持物理一致性验证可作为伪影之外的结构化证据。代价与反例同样明确:直接目检 F1 相对较高但准确率较低,显示更强的判生成偏置;已发布视频检测器与面向人脸的音视频检测器迁移效果差,论文提醒后者应作为域外参考而非同条件胜负;分数方法的阈值依赖验证集真实样本的目标误报率,复现时必须保留同一调阈口径,否则数字不可比。总体趋势不等于每个场景都成立,按场景诊断见消融与限制部分的展开。

拿掉视频增强与高频分支后,性能如何变化?

估计器消融回答的是物理量质量对验证的贡献。完整架构同时包含视频增强与高频瞬态分支,两个变体分别去掉其中之一,下游采样、选择与验证保持不变。比较问题是去掉几何校准或去掉高频声学补充后,测试集准确率与 F1 下降多少;公平条件是同一测试切分与同一真实加生成子任务;指标方向是下降幅度越大,说明该组件对当前约束越重要。

条件指标完整估计器去掉视频增强去掉高频分支
第一种生成源子任务准确率70.30%60.40%64.85%
第一种生成源子任务F1 分数64.29%54.55%60.34%
第二种生成源子任务准确率72.16%62.89%65.46%
第二种生成源子任务F1 分数65.82%57.14%59.88%

表后解释应区分两种退化的含义。去掉视频增强后两组准确率分别跌至 60.40% 与 62.89%,F1 分别跌至 54.55% 与 57.14%,支持校准后的物体几何对可靠动力学的重要性;该变体恢复默认掩膜路径并绕过内参与深度适配器,因此退化同时包含分割与几何两方面,不能只归因于单一适配器。去掉高频分支后两组准确率分别为 64.85% 与 65.46%,F1 分别为 60.34% 与 59.88%,支持高频瞬态为语义声音事件补充了物理 timing 与谱信息。未胜出项是完整方法本身在气球与部分小物体场景仍弱,说明估计器增强并未解决所有弱观测问题,这一点在按场景诊断中继续展开。

按场景诊断使用全部已完成样本的池化结果以提高场景级估计稳定性,因此不能与仅测试集的主结果直接比较。读表前的问题是验证在哪类物理过程上最强、在哪类上最弱;公平条件是同一池化口径与同一分组定义;指标方向仍是越高越好,但小样本场景的百分比需要谨慎解读。

条件指标本方法对照说明
物体沿斜坡下降加第一种生成源准确率78.57%最强且最一致的持续轨迹场景
物体沿斜坡下降加第一种生成源F1 分数72.73%最强且最一致的持续轨迹场景
物体沿斜坡下降加第二种生成源准确率80.18%最强且最一致的持续轨迹场景
物体沿斜坡下降加第二种生成源F1 分数75.00%最强且最一致的持续轨迹场景

表后解释要给出机制与边界。持续轨迹场景最强的原因是位置、速度、加速度与物体表面关系在多帧上暴露,球弹跳也因重复接触可做多次反弹动力学与撞击对齐检查。反例是气球放气在两种生成器上准确率均低于 50%,原因是渐变形变与持续气流没有尖锐定位事件,且形状变化对掩膜与几何估计敏感。硬币与弹弓的生成器差距来自生成片段暴露可观测违反的频率不同,而非对真实视频的普遍偏置;论文明确提醒不应把这些差距解读为生成器整体质量排名。计算开销方面,压缩把验证输入从平均 154.3k 降至 8.9k 输入令牌,降幅约 94%,对应数量块字符数下降约 97.1%,视觉采样平均保留约三分之 1 帧数。

条件指标压缩前压缩后
验证提示平均输入令牌数154.3k8.9k
验证提示平均输入降幅约 94%约 94%

该成本表说明压缩主要节省输入令牌与字符量,但完整推理每样本仍需 2 次标题调用、1 次采样选择、1 次定律选择与 3 次验证调用,总量与缓存命中率需按原文日志口径复现,不能直接换算成金额或延迟。

哪些事件最难验,哪些结论不能推广?

论文报告的失败条件集中在可观测性弱的事件。气球放气缺乏尖锐定位事件,硬币等小物体与短暂接触对接触定位与声事件定位精度要求高,斜坡类连续运动之外的孤立撞击也更难形成多重检查。作者因此把多数约束做成定性或序关系检查,不做绝对阈值与精确仿真;单目几何、掩膜传播与声定位精度尚不足以支撑通用绝对阈值,这是当前实现的方法边界。

另一个限制是证据质量依赖估计器。视频消融显示去掉增强后性能明显下降,高频消融显示去掉谱瞬态后也有下降,说明验证器看到的数量本身带有测量噪声。未来方向包括报告校准置信区间、观测质量与备选测量假设,并在验证时传播不确定性;对可用精确数值形式的约束,可把语义推理与可执行数值算子分离,前者决定适用定律,后者用单位感知的算子复现等式、不等式、趋势与时间关系。这些都属于待验证的改进,不是已测量的收益。

还有两处不能推广的解读。第一,按场景与按生成器的差距是在当前 9 个场景与两个生成器下测得的,不能推广为所有生成器或所有物理域的排名。第二,训练资源、推理开销、输出帧率与实际延迟是不同量,论文报告令牌消耗而不报告金额,因为价格会变;未测量误判率分布、延迟或部署成本时,不应声称这些量得到改善。缺失证据不是技术错误,相关性也不是因果,复述时应使用报告显示、结果支持、可能待验证 3 层措辞。

复现应先固定哪些信息条件与超参数?

复现先固定数据口径。按种子片段分组划分,保证同一真实种子及其生成对应同属一个切分;保留原生容器、编码、帧率、分辨率与音频编码,不做全局重编码;文件名、来源标签与码率不进入物理量或提示;指标以生成为正类,分别报告真实加每种生成源的准确率与 F1。分数基线的阈值按验证集真实样本的目标误报率确定,本方法不使用基准标签做适配或工作点校准,3 次验证取多数投票且置信度不加权。

再固定估计与推理细节。标题由两个大模型独立生成并同时保留;采样策略选择、定律选择与验证使用同一大模型配置;视觉轨迹重建的速度与加速度滑动平均系数分别取 0.3980 与 0.3305,且在仿真数据上选定而不使用基准标签。音频语义解码用概率阈值 0.2、中值滤波窗口 9 帧与最小时长 50 毫秒。

谱路径用 25 毫秒窗与 10 毫秒跳,频带取 0 到 8 千赫、8 到 16 千赫与 16 到 24 千赫并在低于奈奎斯特时跳过高带,基线为因果 120 毫秒中值,阈值要求中值新颖度加 6 倍中位绝对偏差、至少 6 分贝能量上升与负 75 分贝峰值下限,提议填充 20 毫秒、最短 30 毫秒、80 毫秒内合并;语义与谱提议重叠或边界间隙在 80 毫秒内则融合。

资源状态是正文开源声明的唯一依据。本次收到的资源状态显示未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开或当前可用。若后续需要补验证,应优先补三项:跨新生成器与新场景的匹配协议测试、估计器不确定性传播后的支持违反不确定三态校准,以及数值可执行检查与语义推理分离后的可复现性对比。每项都要保留同一划分、同一阈值口径与同一分组指标,否则无法判断提升来自方法还是来自评测口径变化。

何时值得尝试这种验证,如何收束全文?

当检测目标是短时事件中心的音视频,且怀疑生成器已能抹掉外观伪影但未必能复现能量衰减、撞击同步与轨迹连续时,值得尝试这种验证。它的适用条件是所需物理量可被可靠估计,且事件能提供重复接触或持续轨迹等多重检查;当事件是缓慢形变、小物体短接触或声源不可见时,应预期较多不确定而非强违反,并准备用更准确的几何与声学估计补齐短板。

全文收束为三句话。第一,本文把生成音视频检测改写为基于可测量约束的核查,要求输出按定律与时间窗组织的证据。第二,当前实现用标题、结构化物理量、事件相关且可测量的定律选择,以及 3 次验证投票,在基准上超过直接目检与所比基线,但优势集中在可观测性强的场景。第三,未解决的是弱观测事件的估计精度、不确定性传播与更广物理覆盖,这些需要纵向跨生成器测试与可执行数值检查来继续验证,而不是从现有数字直接推广。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-16 语音/音乐/音频论文速递