英文题目:BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards
会议身份:
conference:aaai:2026:conference-paper-id:40914
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#内容审核 #强化学习 #可解释性 #音视频 #音视频理解
评分:5.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究
👥 作者与机构
- Yiran Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaowei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Yuan:机构信息未能从会议 PDF 纯文本可靠映射
- Yukun Song:机构信息未能从会议 PDF 纯文本可靠映射
- Xiong Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Yinghao Song:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangji Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yulu Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Hai Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Shuai Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaohan Gong:机构信息未能从会议 PDF 纯文本可靠映射
- Jiefei Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理短视频商业广告的多模态合规审核,输入为视频帧与自动语音识别(Automatic Speech Recognition,ASR)转写文本,输出为是否违反平台政策的二元判定及结构化推理链,难点在于夸大宣传与跨模态不一致等隐蔽违规。方法先以风险提示锚定的关键帧与区域筛选构造视觉线索,再用冻结大模型经观察到风险筛查到因果分析到终判的三段提示合成交错模态链式思考(Interleaved-modal Chain-of-Thought,ICoT)数据并做规则锚定监督微调(Supervised Fine-Tuning,SFT)冷启动。随后以困难样本挖掘与安全感知拼接构造强化学习数据,并用规则正确性加格式合规加场景自适应评论奖励(Self-Adaptive Critique Reward,SACR,文中亦称 SCA-R)混合奖励驱动组相对策略优化(Group Relative Policy Optimization,GRPO)精修推理与决策。与通用视觉语言模型(Vision-Language Model,VLM)相比,关键差异在于将政策规则显式编码为可学习的推理先验与动态评价原则,而非仅依赖通用有害内容判断,从而提升对政策漂移的适应性与可解释性。在自建短视频广告基准 BLM-Guard-Bench 上,严格准确率(Strict Accuracy,s-Acc.)达 0.914,显著高于最强基线 Qwen2.5-VL-32B 的 0.682,同时推理一致性达 0.845。结论仅适用于中文短视频商业广告及所定义的七类风险场景,对未见政策类别与纯视觉欺诈的泛化尚未充分验证,跨平台与多语言外推受限。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
本文解读的对象是短视频商业广告的多模态审核任务。输入是一段时长 5 到 45 秒的广告视频,包含视觉帧序列与语音转写文本,论文明确说明只用语音转写而不用光学字符识别,因为短视频叠加文字噪声大,语音转写更稳定。目标是在给定平台政策集合条件下,对每条政策判断是否违规,并输出一条可解释的推理链。
必须保留的信息包括 3 级标签体系、2 阶段训练流程、混合奖励构成、基线对比条件与一致性评估方式。输出形式是结构化的思考与答案,其中思考部分走场景识别到违规类型再到规则匹配最后到决策的固定路径,答案部分给出违规场景与违规类型。
对于刚进入语音与音频方向的研究生,需要先建立一个基本判断:这不是通用社区安全过滤。通用过滤关注暴力与裸露等粗粒度风险,而广告审核关注细粒度商业合规,例如收入夸大、隐私泄露、封建迷信、免费高配手机与零成本等话术。违规常常是伪装的,单看画面可能合规,听话术才有问题,或者字幕与音频互相漂移。
因此只把音频丢给语音识别再做文本分类是不够的,必须显式建模模态内部操纵与模态之间不一致,并让推理过程能被政策条文检查。本文后续按学习依赖展开,先讲任务与相关路线,再讲方法全景与组件计算,然后讲训练构造与实验条件,最后讲结果、反证与复现。
已有路线解决了什么,还缺什么?
论文把相关工作分成 3 条线。第一条是视觉语言模型护栏,从文本与图像安全的早期护栏扩展到视频与法律对齐,但论文指出它们难以捕捉误导性视觉或夸大主张这类细微广告违规。第二条是思维链与强化学习对齐,包括树搜索式推理、护栏智能体、基于偏好的强化学习等,论文认为这些工作提供了可解释推理与偏好优化的基础,但缺少面向政策漂移的动态原则。
第 3 条是规则引导的数据与交错思维链,包括自指令与政策接地的多模态对齐,论文认为它们降低了标注成本,但没有针对多模态广告场景设计自适应关键帧采样与结构化推理。对初学者而言,同输入同目标的对照才有意义。如果输入都是短视频加语音转写,目标都是按政策判违规,那么比较的公平条件应包括统一的帧采样与转写拼接方式。
论文在基线部分明确对所有模型采用均匀帧采样与语音转写拼接的视频审核适配,这一点是后文比较能否成立的前提。不同输入或不同目标的类别差异,例如只做图像安全分类或只做暴力检测,不能直接当成同条件胜负,只能当作泛化参考。论文还提到用公开的暴力、异常与虚假信息数据集做泛化评估,这部分与主基准的目标并不完全一致,解读时要分开。
三级风险标签如何定义一次可复述的判断?
论文把任务形式化为策略对齐的商业短视频审核。给定视频与政策集合,审核模型输出每条政策的二值判断与推理链。推理链的固定顺序是场景识别、违规类型、规则匹配、决策。这个顺序不是装饰,它直接决定了后文奖励函数可以分别检查场景与类型,也决定了有监督微调时可以用关键词构造规则先验。
标签体系分为 3 级。第一级是严重度,分为高、中、低,反映法律、声誉或用户体验风险。第二级是场景,例如非法内容、虚假营销、误导运营等。第 3 级是违规类型,例如收入夸大、隐私泄露、封建迷信等。另设无风险类别以平衡分布。数据来源包括专家审核广告、规则触发广告与高曝光合规广告 3 类,覆盖电商、健康、教育与生活方式等领域,部分样本带有结构化推理轨迹。
下图展示了该基准的分类组织方式,阅读时先把握圆环结构再看实例如何落到节点上,重点是理解每个判断都要落到政策条文。
看图路径: 1. 先看中央圆环七个大场景分区与内圈细分子类型的层级关系;2. 再看左右两侧八个图文实例的文字说明如何指向圆环节点;3. 对比左下合规实例与右下灰色地带实例的措辞差异;4. 确认每个节点关联高中低三档严重度与无风险类别
论文图 1。原论文 Figure 1:“BLM-Guard Benchmark Taxonomy. Our benchmark organizes commercial short-video ads into a hierarchical risk taxonomy with seven core violation scenarios and fine-grained subtypes.”。
从像素可见,中央是一个多层圆环,中心标有审核框架名称,外圈是大场景分区,内圈是细分子类型。左右两侧各有 4 个图文实例,每个实例上方是视频帧缩略图,下方是一句英文说明。右侧实例包括免费高端手机与零成本夸大、用剧本对话模拟现实纠纷、暗示欺骗行为、通过调情语言推广可疑应用。左侧实例包括含肾虚等暗示词、草本茶成分准确描述、无验证的全年龄适用宣称、传播迷信并含跪下认错式保证。
颜色上高风险区域偏红,监管与体验区域偏蓝紫,合规区域单独占一块。这种可视化对应的教学动作是:拿到一条新广告,先判严重度,再落到场景,最后落到类型,每一步都要能在政策条文中找到依据。
两阶段流水线先学什么,后炼什么?
论文提出的方法是渐进式 2 阶段流水线。第一阶段是规则引导的有监督微调冷启动,通过关键帧选择与多步提示合成结构化视觉语言思维链数据,再做规则锚定的因果监督。第二阶段是自适应分组相对策略优化强化学习,通过安全感知的数据整理与自适应评论奖励动态评估推理输出,再用改进的分组优化算法更新策略。
设计理由在正文中写得很直接:单阶段微调在政策覆盖与可解释性上受限,因此先让模型学会结构化合规推理,再用奖励去适应演变的风险模式。沿一个样本走完流程有助于复述。输入是一段广告视频与对应的语音转写。表示阶段先均匀采样帧并计算与风险提示的相似度,再选出关键帧与关键区域。组件阶段用冻结的大型视觉语言模型分 4 步生成观察、风险筛查、因果分析与最终裁决,形成视觉关键帧、推理链与合规标签三元组。
目标阶段先用交叉熵学习答案准确性,再用散度约束让思考分布靠近规则先验。输出是带有思考标签与答案标签的结构化文本,答案中包含违规场景与违规类型字段。下图是 2 阶段流水线的总览,重点看数据构造与训练优化如何衔接,箭头方向即复述顺序。
看图路径: 1. 沿上半部分从安全政策与均匀采样到关键帧与关键区域的箭头看主路径;2. 看下半部分左侧规则锚定微调的思考与答案标签格式;3. 看下半部分右侧策略模型与评论模型如何汇合计算组内奖励
论文图 2。原论文 Figure 2:“Our method adopts a progressive two-stage pipeline for policy-controllable content moderation.”。
从像素可见,该图分为上下两栏。上栏是数据整理,左侧 4 个虚线框是广告实例与标红的风险话术,中间是安全政策、均匀采样、关键帧与注意力区域选择,右侧列出 3 个关键帧编号、区域坐标与打分,底部是视觉音频观察、风险筛查、深度分析与最终判断 4 步提示。下栏左侧是第一阶段规则锚定微调,展示思考与答案标签嵌套与一个虚假营销与夸大的示例输出。
下栏右侧是第二阶段自一致强化学习,展示策略模型输出多组场景与类型判断,再与评论模型的准确性、完整性、保守性等多组权重打分汇合做组内计算得到优势。阅读后应能复述:先合成可学习的推理数据,再用混合奖励精炼行为。
关键帧与关键区域是如何算出来的?
冷启动的第一步是关键帧与区域选择,目的是在长视频中找出高风险线索。操作分为 3 步。第一步用对比语言图像预训练模型的视觉编码器计算每帧与预设风险提示的最大余弦相似度。论文设定从 16 个均匀采样帧中计算,对 7 个预设风险提示取最大相似度。这里白话解释是:预设提示就是政策关心的短语,例如虚假营销与非法内容,模型先看哪 1 帧最像哪类风险。
符号与输入的解释如下:视觉嵌入与提示嵌入分别记为向量,相似度是归一化点积,输出是每帧的风险得分向量。计算目标是为后续分箱与全局补充分帧提供排序依据。
\[si = max\]第二步是自适应关键帧选择,采用分箱加全局补充的混合策略。视频被均匀分成与目标数量相同的时序箱,每箱选得分最高的 1 帧,保证时间覆盖。若数量不足,再从全局按得分从高到低补充,保证语义显著帧不丢失。论文设定目标数量为 3。第 3 步是块级区域提取,对每帧用视觉编码器提取块特征并计算二范数,选得分最高的块作为视觉关键区域。最终形成关键帧与区域的集合。
交错模态思维链 × 规则锚定监督: 交错模态思维链负责把视觉关键帧、语音转写文本与跨模态一致性判断组织成观察、风险筛查、因果分析与最终裁决 4 步;规则锚定监督负责把平台违规场景与类型关键词做成软目标分布去约束思考过程,二者搭配的理由是前者提供可检查的推理结构、后者提供政策先验,组合后新增的作用是让冷启动模型既会分步说理又不偏离政策词汇。
第二步的聚合公式把分箱选择与全局补充写成集合并操作,输入是分箱索引集合与全局排序,输出是最终关键帧集合。
\[Kfinal = Kbin ∪{Top-(m −|Kbin|)}\]对初学者而言,关键是理解为何要分箱:如果只取全局最高分,3 帧可能都挤在同一秒,漏掉前后文;分箱保证时间分散,全局补充保证显著性兜底。
模内操纵建模 × 跨模态失配建模: 模内操纵建模负责捕捉单一模态内部的夸大或伪造,例如夸张图像与绝对化用语;跨模态失配建模负责比较视觉、语音与字幕之间是否矛盾,例如画面真实但话术欺骗或字幕与音频漂移,二者搭配的理由是广告违规常把一个模态做合规伪装而在另一模态或对齐关系上露馅,组合后新增的作用是多任务联合提升对伪装与错位两类风险的鲁棒性。
上述两个组合机制分别对应数据侧与模型侧的多任务思想:数据侧用交错提示把视觉定位、区域定位与因果推理交错生成,模型侧联合建模模内夸大与跨模态错位。论文用教学例子说明,例如视频显示手机与标语而音频宣称顶配等夸张短语,思考部分应分别写观察、风险与原因,答案部分写出虚假营销场景与夸大类型,该例子仅用于理解形态。
监督与强化各更新什么,奖励如何相加?
规则锚定有监督微调的训练目标由两项组成。主要损失是对答案标记的交叉熵,鼓励合规标签预测准确。辅助项是思考分布与规则先验之间的散度,规则先验由目标违规场景与类型分词后的关键词集合归一化成软目标分布。论文未报告该散度项的权重系数的具体数值与冻结细节,只说明主损失学标签、辅助项引导因果推理。梯度路径与参数冻结范围在证据中没有完整交代,复现时应把此记为缺项,不从骨干模型名称推定实现。
强化学习阶段包含数据整理、奖励设计与策略优化三部分。数据整理用高温采样做 4 轮拒绝采样,收集模型持续失败的困难样本,再做安全感知拼接,把语义相关的提示或风险语音片段拼接以模拟更复杂的决策上下文。奖励是三项相加:规则奖励、格式奖励与自一致自适应奖励。规则奖励按场景与类型匹配给 1.0、0.5 或 0.0。格式奖励检查输出是否同时含思考与答案标签,满足给 1,否则给 0。自适应评论奖励让指导模型接收思考轨迹、真值标签与审核指南,动态构造带权重的评分原则并按 0、0.5、1 打分后加权求和。
自适应评论奖励 × 规则正确奖励: 规则正确奖励负责核对预测的违规场景与类型是否与标注完全或部分一致并给出离散分值;自适应评论奖励负责让指导模型针对每条思考链动态构造因果清晰度与风险归因等评分原则并加权打分,二者搭配的理由是离散奖励保事实正确、评论奖励保推理质量与政策漂移下的对齐,组合后新增的作用是在场景自适应地评价思考质量。
格式奖励的符号解释是:指示函数判断预测文本是否同时包含两种标签,计算目标是保证结构化输出可解析。
\[rformat = I[`\lt think\gt ` ∈ˆy ∧`\lt answer\gt ` ∈ˆy]\]策略优化采用分组相对策略优化并做三处修改:标记级归一化以缓解输出长度带来的奖励偏差;组内优势用组均值与标准差做标准化;裁剪因子随训练步数退火;当一组奖励方差为零时跳过该批。算法流程是每步对每个输入生成一组回答,分别算三项奖励并求和,算均值方差得优势,再算策略比与裁剪损失后更新参数并同步旧策略。
分组相对策略优化 × 动态采样: 分组相对策略优化负责对同一输入采样一组回答并用组内均值方差计算相对优势再做裁剪更新;动态采样负责当一组奖励方差为零时跳过该批并继续采样直到出现差异,二者搭配的理由是前者需要组内对比才有学习信号、后者保证对比信号非零,组合后新增的作用是避免梯度坍缩并提升样本效率。
需要提醒的是,论文未报告组大小、总步数、学习率、裁剪初值与硬件预算,这些是复现缺项。训练资源与推理开销要分开讨论,不能从趋势推定每步都稳定。
在什么数据、基线与指标下比较?
基线包括护栏专用架构与通用基础模型。护栏类有 LlavaGuard-7B 与 QwenGuard-7B,通用类有 LLaVA-Next-Video-7B、InternVL3-8B 与作为骨干的 Qwen2.5-VL-7B-Instruct,另有使用结构化思维链的 Kimi-VL-A3B-Thinking。为公平比较,所有模型都经由均匀帧采样与语音转写拼接适配到视频审核。论文还列出更大参数的 Qwen2.5-VL-32B 与 InternVL3-14B 作为参照。数据集方面,自建基准按严重度、场景与违规类型 3 级标注,部分含推理轨迹;另在 5 个公开审核数据集上测泛化,覆盖暴力检测、异常发现与虚假信息检测,并参考安全视频护栏工作评估未见政策域。
指标分两个维度。违规识别准确率基于答案输出,报告宽松准确率与严格准确率,以及有害与无害二分类的宏平均与加权精度、召回与 F1。一致性分数评估思考部分与审核原则的对齐,用基于大模型的指导模型打分,范围 0 到 1,越高表示推理与答案越一致且可解释。指标方向都是越高越好,但自动指标不能当成人评,宽松与严格不能混为一谈。
宽松准确率 × 严格准确率: 宽松准确率负责只要违规场景或类型之一命中即算正确,衡量部分匹配能力;严格准确率负责要求场景与类型同时命中才算正确,衡量完全合规判断能力,二者搭配的理由是广告审核既要容忍粗粒度召回又要考核细粒度政策对齐,组合后新增的作用是区分模型是方向正确还是细节也正确。
论文未报告划分比例、随机种子、统计显著性与硬件预算,聚合对象在部分热力图中按场景平均,在主表中按严重度与二分类分别报告。复现时应先固定采样帧数、转写拼接方式与标签解析规则,再谈胜负。
主结果测什么,谁在什么条件下更准?
主结果要回答:在自建广告基准上,完整方法是否在严重度分类、总体准确率、二分类检测与推理一致性上同时占优,以及在公开数据集上的泛化是否成立。比较问题是:在统一帧采样与转写拼接条件下,规则引导监督加结构化推理加强化学习是否优于直接用通用视觉语言模型或专用护栏。公平条件是所有基线都做同样的视频审核适配,指标方向都是越高越好。
下图从策略对比、场景热力、外部基准与一致性直方图 4 个角度呈现趋势,读图时注意区分分布曲线与单样本标记,像素不能精确辨别的中间数值不要硬写。
看图路径: 1. 先看左列两个雷达图中橙色多边形与其他基线的包络差异;2. 再看中间两张热力图最下一行深色行的数值与其他行的亮度对比;3. 看右列两个直方图中分布峰位置的左右移动
论文图 3。原论文 Figure 3:“Comparison of model strategies and components.”。
从像素可见,左列两个雷达图各有 5 个轴,分别为严格准确率、精度、召回、F1 与一致性,最外圈橙色多边形在多数轴上包住蓝色与灰色多边形。中间上热力图按 8 个风险场景列出数值,最下一行数值在 0.930 到 0.960 之间,颜色最深;中间下热力图按 5 个外部基准列出数值,最下一行在 0.890 到 0.970 之间,同样最深。右列两个直方图显示一致性分数分布向右移动,上图从灰色峰右移到蓝色峰,下图从蓝色峰右移到橙色峰。曲线向右是分布整体右移,不等于每个样本都提升,具体胜负以表格数字为准。
下表是消融矩阵中的监督学习部分,比较问题是只学答案或只学思考是否足够,公平条件是骨干统一且指标统一为严格准确率与一致性等,指标方向越高越好。
| (rule-based | reward learning); | and (7) | +SCA-R | (Full), | our fi- |
|---|---|---|---|---|---|
| Ans-SFT | 0.648 | 0.765 | 0.702 | 0.732 | 0.412 |
| Think-SFT | 0.612 | 0.720 | 0.679 | 0.699 | 0.585 |
| Full-SFT (13k) | 0.7925 | 0.874 | 0.862 | 0.867 | 0.762 |
| Part-SFT (5k) | 0.768 | 0.780 | 0.840 | 0.809 | 0.762 |
表后解释如下。论文报告显示,仅答案监督与仅思考监督的严格准确率与一致性都较低,前者答案尚可但思考一致性明显弱,后者思考稍好但准确率不足。加入全量与部分数据对照后,全量数据的有监督微调优于部分数据,说明数据规模仍有收益。代价与反例也要同时说明:该表未包含主基准上更大参数基线的逐项对比,也未报告延迟与成本,未胜出项例如纯思考监督在一致性上虽高于纯答案监督,但在准确率上并未占优,说明只学推理形式不等于判得准。不同指标的差值不能混放,解读时只说方向与量级,不做无源的因果断言。
拿掉规则或换掉奖励会发生什么?
消融要回答两个子问题。第一是数据规模与规则锚定的作用:同样参数下,更多数据是否有益,加入规则关键词先验是否在同等数据量下额外有益。第二是奖励的作用:规则奖励与自适应评论奖励各贡献多少,一致性提升是否伴随准确率提升。比较的公平条件是骨干统一为 Qwen2.5-VL-7B,评估指标统一为严格准确率、精度、召回、F1 与一致性。
下表聚焦规则微调与奖励学习的对照,保留了部分数据规则版本以及规则强化与完整自适应奖励的实际可运行策略,表前问题是规则对齐与混合奖励是否带来额外增益。
| (rule-based | reward learning); | and (7) | +SCA-R | (Full), | our fi- |
|---|---|---|---|---|---|
| Part-SFT (5k) | 0.768 | 0.780 | 0.840 | 0.809 | 0.762 |
| Rule-SFT (5k) | 0.783 | 0.882 | 0.853 | 0.867 | 0.776 |
| + Rule-RL | 0.801 | 0.915 | 0.874 | 0.894 | 0.781 |
| + SCA-R (Full) | 0.914 | 0.976 | 0.962 | 0.969 | 0.845 |
表后解释如下。论文报告显示,在同为部分数据量的条件下,规则对齐微调在精度与一致性上高于普通部分微调,支持规则先验带来政策词汇对齐的判断。进一步加规则强化学习后指标继续上升,而加自适应评论奖励的完整版达到该矩阵内最高,支持混合奖励的互补性。反证方面,普通部分微调与规则微调的一致性差距并不大,说明仅靠有监督阶段难以大幅拉开推理质量,真正的拉开发生在强化阶段。
右列直方图也显示规则微调与自适应奖励分别推动分布右移,但论文未报告去掉格式奖励或只用自适应奖励的独立结果,因此不能断言任一奖励单独必然如何。未评测边界包括未见政策类别的细粒度表现与长视频外推,这些在热力图中只有粗粒度场景平均,需要补验证。
哪些结论尚不支持,边界在哪里?
首先是资源状态的唯一依据问题。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开或当前可用,只能说论文正文提到发布基准,但本次未能确认可达。复现只能依赖论文文字描述的参数,例如 16 帧均匀采样、7 个风险提示、3 个关键帧、4 轮拒绝采样,以及奖励相加与分组优化的算法步骤,缺失学习率、组大小、总步数与硬件预算。
其次是评估效度。一致性分数由大模型指导模型给出,本质是自动评价,不是人工审核,不能把自动指标当成人评。公开数据集上的泛化数值反映的是暴力、异常与虚假信息等邻近任务的表现,不能直接等同于广告政策合规能力的因果证明。论文报告在虚假信息场景优势更明显,论文将其解释为与检测欺骗内容和跨模态不一致的内部能力一致,这属于有限解释,可记为支持而非证实。
最后是成本与风险。论文未测量误判率分布、延迟、推理开销与输出帧率,也未报告高曝光合规广告引入后对召回与误伤的权衡。总体趋势不等于每组每步都成立,退火裁剪与动态采样虽在设计上提升稳定性,但没有每步曲线证据。相关不等于因果,缺失证据不是技术错误,后续需要补上人工一致性评价、延迟成本与未见政策域的细粒度测试。
若要复现,先做什么,再补什么?
复现的第一步是固定信息条件。按论文收集 5 到 45 秒商业广告,保留视觉帧与语音转写,明确不使用光学字符识别。标注时按严重度、场景与违规类型 3 级执行,并保留无风险类别以平衡分布。数据划分要同时记录专家审核、规则触发与高曝光合规 3 类来源的比例,否则无法判断泛化结论的适用条件。
第二步是重建冷启动。用对比语言图像预训练模型算 16 帧与 7 个风险提示的最大相似度,按分箱加全局补充选 3 个关键帧,再用视觉编码器按块范数选关键区域。接着用冻结的大型视觉语言模型按观察、风险筛查加因果分析、最终裁决 3 段提示生成三元组,再做答案交叉熵加思考散度的有监督微调。散度权重、冻结层与优化器设置在原文未给出,应先设为待验证超参数并做小规模网格搜索,而不是从模型名称推定。
第 3 步是重建强化学习。先做 4 轮高温拒绝采样收集困难样本,再做安全感知拼接增加风险密度。奖励按规则、格式与自适应评论三项相加实现,指导模型需输入思考轨迹、真值标签与审核指南并动态构造带权原则。策略优化实现标记级归一化、组内标准化优势、退火裁剪与零方差跳过。何时值得尝试是:当违规以夸大话术与跨模态错位为主,且需要输出可检查的政策依据时。
若只有单模态文本分类需求,则不必引入该重型流程。还需补的验证是人工一致性、误伤率、延迟与未见政策域表现,并明确区分代码开源、权重下载与系统可运行三件事。
一句话收束:何时用它,何时不用?
综合全文,值得复述的方法判断是:先用规则与结构化推理把政策知识注入模型,再用混合奖励把推理质量与标签正确性联合推高,这条路线在论文报告的自建基准与消融矩阵中同时提升了严格准确率与推理一致性。适用条件是短视频广告这类多模态伪装与政策漂移并存的场景,且评估允许用结构化答案解析与大模型辅助的一致性打分。
不适用或需谨慎的情形是:需要严格人工可审计结论、需要低延迟在线拦截、或只能拿到单模态数据时,本文证据尚不足以承诺误判率、延迟与成本的改善。对初学者的可执行建议是:先沿一个样本手写一遍观察到风险再到原因最后到场景与类型的 4 步链,再对照奖励三项逐项打分,最后用宽松与严格两档准确率分别验收方向正确与细节正确。
教学例子应明确标为例子,例如免费手机话术与剧本纠纷对话仅用于理解夸大与欺骗的形态,不添加无源的效果数值。保留关键超参数与信息条件,缺项如实记录为待验证,这才是可核对的技术解读。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


