英文题目:SafeLens: Segment-Level Hate Speech Detection in Online Videos

会议身份:conference:aaai:2026:conference-paper-id:42390

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#内容审核 #LoRA #多模态学习 #音视频 #音视频理解

评分:5.9/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Zhuoran Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Dylan Raharja:机构信息未能从会议 PDF 纯文本可靠映射
  • Yujia Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Roy Ka-Wei Lee:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

在线短视频仇恨治理的输入是融合语音、屏幕文字与画面的完整上传视频,输出是可执行的时刻级判定,难点在于讽刺、代码混合与快速场景切换使有害片段与良性上下文交织,整视频单标签会引入时序标签噪声而难以支撑分流与申诉。SafeLens以四阶段链路处理该任务:时序切分先将Whisper词级转写合并为句并结合ViT帧相似度切分静音长片段,产出语义连贯的待判片段。多模态证据抽取对每片段并行获取带时间戳语音转写、EasyOCR屏幕文字与Qwen2.5-VL客观帧描述,融合后形成结构化提示输入下一步。在HateClipSeg上经LoRA指令微调的Llama3-8B策略智能体据此推理并输出有害二值标签、0-1置信度、适用有害类别与一句话理据,再由网页端呈现可跳转时间线与同步转写以供审核。与整视频分类相比,该链路以片段为决策单元并强制输出类别、置信度与模态归因的结构化可审计JSON,使结果可直接用于快速定位、申诉与创作者反馈。在显性与隐性演示场景下,00:06–00:24片段的置信度分数为93%,高于03:06–03:12片段的置信度分数73%。当前结论的适用边界受限于两段策展短片的显性与隐性场景演示,尚未验证长视频、多语言与真实分布下的泛化与失败条件。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

这篇解读的输入是会议论文正文给出的 SafeLens 系统描述和两张官方原图,目标是让刚进入语音与音频方向的研究生复述从视频输入到片段结论的完整动作。保留的信息包括切分依据、3 个证据流的工具与采样设置、融合决策模型的名称与训练数据、结构化输出的 4 个字段,以及演示中 3 个片段的具体窗口与置信度。输出是一份按学习依赖展开的方法说明,性能表述严格限定在原文给出的范围之内。

SafeLens 处理的输入是在线短视频文件,其中交织说话声、背景声、画面变化和屏幕叠加文字。输出是一张按时间排列的片段清单,每个片段给出是否仇恨的布尔标签、0 到 1 之间的置信度、一句话解释, harmful 片段还给出适用的伤害类别。通俗理解,系统先把长视频剪成一段段可单独判断的小段,再对每小段回答有害与否、确定程度、理由归属、类别归属。

置信度和理由需要全程保留。原文把结构化预测定位为服务于分诊、申诉和下游执行,审核员依据分数排序优先复核,创作者申诉时查看一句话依据,执行管道直接消费类别字段。整片二分类只给一个标签,片段级清单支持跳到具体秒数复核。后续所有组件围绕这 4 个字段组织证据,每个字段都在流水线中有明确生产位置。

已有路线为什么还是按整片打标签?

在 SafeLens 之前,审核研究和工具主要围绕文本和图像展开,短视频常被当作整片样本处理。原文指出,现成的视觉语言模型在区分仇恨内容与附近良性上下文、讽刺或快速场景切换方面存在困难,多数公开基准只给整个视频一个标签。这种做法带来时间标签噪声,举例说,整片几分钟文件里可能只有十几秒有害,标签却落在整个文件上,训练和评估都难以对准时刻。

同输入同目标的对照是 MultiHateClip 和 ImpliHateVid,它们开始提供视频级多模态资源,并记录了模型在仇恨与冒犯类别之间容易混淆的现象。原文把 HateClipSeg 定位为第一个提供全面片段级标注的数据集,共 11,714 segments 并带有细粒度冒犯类型和目标。这条线说明,SafeLens 建立在片段级监督首次可用的基础上,把决策粒度从整片下沉到时刻。

运行阶段的差异也需要分清。视频级资源适合做离线打分比较,片段级系统适合做线上按时刻处置。原文强调平台处置的是时刻,审核员需要精确的跳转证据、检测置信度和紧凑理由来快速决策。这解释了 SafeLens 采用 4 阶段流水线的设计思路,每个阶段对应审核动作中的一个环节。

平台真正要判的是哪几秒?

把任务形式化一下。设输入视频时长为连续时间轴,系统先产生一组按语义衔接的片段,每个片段有起止时间。通俗说,切分就是决定在哪里下剪刀。对每个片段,系统收集 3 类观测,语音转写带词级时间戳、屏幕文字带识别置信度、画面描述按固定间隔采样,然后输出上述四元组。

举一个教学例子帮助理解,例子取自通用课堂假设。假设一段 40 秒视频在 6 秒到 24 秒出现针对特定群体的贬低言论,其余时间为正常讨论,整片标签若记为仇恨,训练时会把 6 秒前和 24 秒后的正常语音也当作仇恨信号。片段级任务则要求只有 6 到 24 秒判为有害,其余判为正常,并给出置信度和理由。这与原文演示中 00:06–00:24 被单独标记的思路一致。

这个任务的要点在三处。第一是边界,句子切分和静音场景切换共同决定片段起止,切分位置决定有害和正常是否落在同一单元。第二是隐式表达,讽刺和混合语的目标需要结合屏幕文字和上下文理解。第三是政策对齐,仇恨与冒犯的界限需要按统一提示和微调来稳定,保证同一证据在同一模型下说法一致。

四阶段流水线如何从上传走到可点击的报告?

SafeLens 的方法全景是 4 阶段流水线。第一阶段做时间切分,第二阶段对每个片段抽 3 路证据,第 3 阶段把证据拼成结构化提示交给政策大模型做融合推理,第 4 阶段通过网页界面交付可交互报告。原文配的系统工作流图把这四块画成了左上切分、中上证据抽取、右下融合推理、左下网页的回路,上传的视频先进切分,证据汇入决策,决策再回到展示。

先沿一个样本走完全程。输入一段待审视频,先用语音识别得到词级转写并按句子合并,遇到长静音再用画面相似度补刀切分,得到若干片段。对每个片段,分别拿到语音文字、屏幕文字和画面描述,三者拼成提示,送入在 HateClipSeg 上指令微调过的 Llama3-8B,模型返回一个 JSON 对象,包含布尔标签、置信度、一句话解释和伤害类别。网页把这些 JSON 按时间排成表,点一行就跳到对应秒数并同步滚动转写。

下面这张原文图 1 给出了从左上切分到中上证据抽取再到右下推理与左下展示的完整回路,阅读时建议先锁定主路径的箭头走向,再看 3 路分支的汇合位置。

看图路径: 1. 先从左下视频输入沿箭头向上找到词级转写再到句子切分再到视频片段的纵向主路;2. 再看中部对每个片段分出的转写证据、视觉上下文、屏幕文字三路横向分支如何汇入多模态证据;3. 最后看右下微调后模型如何分出有害判断一路和解释分数一路并回送到网页展示

原论文 Figure 1:A diagram illustrating the system workflow.

论文图 1。原论文 Figure 1:“A diagram illustrating the system workflow.”。

这张图左侧纵向是 Word Level Transcription 向上经 Sentence Segmentation 得到 Video Clips,中间横向是对每个 For Each Clip 分出的 Transcription Evidence、Visual Context Extraction 和 On Screen Text Extraction 3 路,右侧是 3 路汇入 Multimodal Evidence,右下是 Finetuned LLaMa3-8B 分出 Harmful Content Decision 与 Explanations and Scores 并送往 Results Display。图中还画出了 Video Input 与 Results Display 的回路,说明切分与展示共享同一时间轴,这为悬停警告跳转到片段开头提供了结构基础。模块化体现在语音、文本、视觉后端和策略模型都可替换,原文还提到用可复现的 JSON 日志和参数记录来支持审计。

切分与三路证据各负责什么计算?

时间切分的具体动作分两步。第一步用 Whisper 生成词级转写,再用自然语言工具包中的 Punkt 分句器合并成句子,通俗说就是先听清每个词在何时出现,再按标点和语义拼成整句,保持一句话的完整性。第二步处理长静音,当静音达到或超过 20 s 时,计算视觉变换器得到的帧嵌入之间的余弦相似度,当相似度低于阈值就切一刀。这样有声时依靠语言边界切分,长静音段依靠画面变化切分。

时间切分 × 片段级监督: 时间切分负责把连续视频切成语义相对完整的待判单元,片段级监督负责给每个单元独立的是否仇恨标签和类别, SafeLens 把二者搭配的原因是平台处置和申诉都落在具体时刻而非整个上传,前者提供对齐到起止时间的输入边界,后者提供落在该边界内的学习目标和评判单位,组合后系统输出的每条结论都能跳转到时间轴上复核。

3 路证据抽取各有明确分工。语音路继续用 Whisper 保留带时间戳的词级转写,这是判断显性辱骂的主信号。屏幕文字路用 EasyOCR 按每 3 到 5 秒采样识别,保留置信度例如达到 0.6 的结果,并做简单的时间去重以压制重复叠加字幕,这是捕捉讽刺和混合语线索的关键。视觉路用 Qwen2.5-VL 按固定 5 秒间隔在中性指令和确定性解码下生成客观帧描述,温度设为 0 以减少随机发挥,这是提供场景上下文的辅助信号。

多模态证据抽取 × 证据融合: 多模态证据抽取分 3 路分别把语音转成带时间戳文字、把屏幕叠加文字识别为文本、把画面转成客观描述,证据融合负责把 3 路文本拼成一个结构化提示交给策略大模型,搭配理由是单看语音会漏掉讽刺和屏幕文字,单看画面又难以判定目标,组合后模型能同时看到说了什么、写了什么和出现了什么,并给出模态归因。

下表把 3 路工具、采样间隔与过滤条件的组合关系收拢在一处,阅读时先对照工具与采样是否匹配,再看过滤条件如何塑造输出形态。

证据流工具或模型采样与处理过滤与解码设置在后续判断中的作用
语音转写Whisper 词级转写按词时间戳合并为句子Punkt 分句器合并提供显性辱骂主信号
屏幕文字EasyOCR 识别每 3 到 5 秒采样并时间去重置信度例如达到 0.6捕捉叠加字幕与讽刺线索
视觉上下文Qwen2.5-VL 描述固定 5 秒间隔取帧中性提示加温度为 0提供客观场景上下文

上表把原文分散在两段的采样与阈值收拢到一处,主要收益是 3 路互补,语音覆盖说了什么,屏幕文字覆盖写了什么,视觉覆盖出现了什么。采样越密计算量越大,去重和置信度过滤越严格,输出量越精简,一闪而过的叠加文字更容易被过滤。原文给出当前采样的具体取值,阈值扫描结果放在代码仓库页面,正文复现时按原样记录这组取值。长静音下依靠画面相似度切分,快速剪辑处的切分行为与阈值取值相关,原文说明使用余弦相似度和阈值 τ,复现时需要记录该参数。

融合提示与结构化输出如何对齐审核动作?

证据融合的动作是把 3 路文本拼成一个结构化提示,再交给政策大模型做最终推理。通俗说,先把听到的、看到的字和看到的景都转成文字,再让语言模型按统一格式判定。输出限定为 JSON,字段包括布尔有害标签、0 到 1 置信度、一句话解释,harmful 时还有伤害类别列表。这种限定让下游管道直接解析,也让界面按字段渲染。

为选择后端,原文说明在统一提示和协议下评估了多种先进策略大模型和视觉语言模型,完整评估结果放在代码仓库页面。正文给出该对比的组织方式,统一协议覆盖提示格式与评测流程。实际部署用的是 Llama3-8B,指令微调后承担决策,界面还暴露了策略模型选择器用于比较不同后端。

网页交付的动作同样具体。用户注册后上传视频,收到交互报告,报告按模块展示有害片段及其解释、类别和置信度,并配有与播放同步的转写。原文提到状态条会报告各阶段处理时间和模型版本用于审计,所有演示片段都经过匿名化,所有上传按短期保留处理。这些信息条件在复现时需要一并记录,模型、日志与保留策略构成完整交付形态。

微调了什么,冻结了什么,监督从哪里来?

训练部分先说清参数更新范围。原文明确的是用 LoRA 适配器在 HateClipSeg 数据集上对 Llama3-8B 做指令微调,通俗说就是大模型主体保持原样,训练外挂的小适配器去学习片段政策和输出格式。原文给出的训练信息集中在适配器类型、基座型号和数据集名称,视觉编码器和语音识别的训练状态在正文中有各自的描述位置。

策略大模型 × LoRA 微调: 策略大模型指承担最终是否仇恨判断的 Llama3-8B,其分工是理解融合后的证据并按政策输出结构化 JSON,LoRA 微调的分工是在不全量更新大模型的前提下用 HateClipSeg 的片段标注教会它仇恨与冒犯的边界和输出格式,搭配原因是中型模型便于替换和部署而参数高效微调保留了可插拔性,组合后得到一个懂片段政策的轻量决策器。

监督来源是 HateClipSeg 的片段级标注,输入是融合后的多模态证据文本,目标是上述 JSON 四元组。推理时对每个片段独立调用 1 次微调后的模型,得到标签、分数、理由和类别。原文把置信度记为预测置信度,取值区间为 0-1,教学中按原文名称引用即可。

复现边界需要明确写出。正文给出的超参数信息限于 LoRA 适配器这一项,数据划分与采样比例、微调前后的对照数字、类别不平衡处理都指向代码仓库核对。按当前正文可完整复现推理链路,训练复现需要到代码仓库核对脚本与参数记录。

演示了哪两类片段,运行条件如何保持可比?

原文实验条件的呈现方式是演示设计。演示用两段短而精的片段,场景一是显性仇恨,辱骂直接出现在语音中,场景二是隐式与混合语,目标通过讽刺和屏幕文字传达。这种按显性与隐式分开的设计便于检验单看语音是否足够,教学上保留这个对照思想。

视频级摘要 × 片段事件表: 视频级摘要负责一句话说明整片是否含仇恨、属于哪类以及共发现多少事件,片段事件表负责按时间顺序列出每个有害片段的起止、时长、类别和置信度,前者解决要不要整体拦截和如何向创作者解释,后者解决跳到哪几秒取证,组合后形成先看摘要定性再按表跳转取证的工作闭环。

运行条件的可比性依靠三处固定。第一是统一提示与协议用于后端选型,第二是视觉描述固定中性指令与温度为 0 以保证确定性解码,第三是屏幕文字固定采样间隔与置信度过滤。指标方向在演示层面是置信度越高越值得优先查看,类别越具体越便于执行,原文演示数字用于说明排序与展示逻辑。

下表把原文演示中 3 个已标记窗口的起止、时长、类别与置信度放在同一视图,阅读时先看窗口长度与类别的对应,再看置信度如何支持优先排序。

窗口时长预测类别置信度主导证据与说明
00:06–00:2418 sHate speech / Anti-Semitism / Religious discrimination93%语音为主,视觉与屏幕文字非决定性
00:42–02:43长窗口聚合多事件Hate speech / Anti-Semitismmax 93%, avg 84%多事件聚合,取最大与平均置信度
03:06–03:12短窗口有害片段73%列表中第 3 个已标记窗口

上表 3 个窗口都来自原文有害片段列表,第一个窗口的解释还说明了模态归因写法,语音为主,视觉与屏幕文字为辅助。第二个窗口的写法是聚合多事件并同时报告最大与平均置信度。第 3 个窗口展示了短窗口的标记形态。硬件预算、推理开销和总体延迟在正文中的记录位置是首页状态条,复现时可以自己计时并记录 3 阶段耗时,凡涉及 11,714 之外的数字都回到数据集论文或代码核对。

同一视频内不同片段的结论有何差异?

结果部分按问题组织。测的是系统能否在同一视频内给出按时刻区分的结论,与谁比在正文没有可运行基线的数字,只能看系统内部不同片段之间的对照,条件是同一视频、同一流水线、同一策略模型。指标是片段窗口、时长、类别和置信度,置信度方向是越高越优先复核。置信度负责排序与优先复核,模态归因负责说明判定主要来自语音还是视觉与屏幕文字,两者组合才能既定位时刻又解释依据,避免只看分数而不知证据来源。

置信度 × 模态归因: 置信度是模型对当前片段判断把握的 0 到 1 数值,用于分诊时排序先看哪一段,模态归因是指出这次判断主要依赖语音、屏幕文字、视觉还是多路共同支撑,分工上前者回答有多确定,后者回答凭什么这么定,搭配后审核员既能按 93% 与 73% 排优先级,又能点开看到主要证据来自语音而视觉和屏幕文字并非决定性,从而快速决定是直接处置还是再听一遍原声。

下图是原文图 2 的端到端界面,阅读时先定位播放器与列表的对应,再核对摘要与详情是否一致。

看图路径: 1. 先看上方播放器和绿色框时间轴上红色有害区间与悬浮提示的位置;2. 再对比左下有害片段列表中三段起止与右侧黄色框事件详情的对应关系;3. 最后核对右上粉框摘要中的事件总数与右中蓝框转写文字的同步内容

原论文 Figure 2:End-to-end SafeLens UI with color-boxed re- gions: player and timeline with in-place warnings…

论文图 2。原论文 Figure 2:“End-to-end SafeLens UI with color-boxed re- gions: player and timeline with in-place warnings (green); time-ordered list of harmful segments (purple); video-level summary (pink);…”。

这张像素图左上是播放器与绿色框时间轴,红色区间为有害跨度并带有悬浮提示,左下深蓝框是按时间排序的有害片段表,右上粉框是视频级摘要,右中蓝框是随播放滚动的转写,右下黄框是选中行的事件详情。可见的 3 个片段在左下与右下互相印证,摘要中提到全片共 13 个有害事件,说明列表支持展开查看聚合窗口内的多个事件。

下表把正文明确给出的 3 个窗口收拢为可跳转的清单,表前的问题是同一流水线下显性片段与后续片段的置信度是否拉开差距。

片段窗口时长预测类别置信度主导证据与说明
00:06–00:2418 sHate speech、Anti-Semitism、Religious discrimination93%主要来自语音,视觉与屏幕文字并非决定性
00:42–02:43聚合多事件窗口多类别聚合max 93%, avg 84%聚合多个事件的最大与平均置信度
03:06–03:12短窗口有害片段73%置信度明显低于前两段,需优先复核

上表显示的支持判断是系统能输出时刻级差异而非整片一刀切,00:06 到 00:24 以 93% 标出显性段,00:42 到 02:43 用 max 93%, avg 84% 刻画聚合窗口的内部起伏,03:06 到 03:12 以 73% 标出把握较低的短段。具体代价或反例是 73% 段恰恰说明并非所有输出都高置信,不能只看高分段就推广到全片。未胜出项是原文未报告无害段是否被误 flag,也未给出隐式场景二的独立数字,因此不能断言隐式场景同样达到 93% 水平。

如果拿掉一路证据会发生什么,原文讲了什么没讲什么?

严格的消融需要固定其他条件、逐次去掉语音、屏幕文字或视觉中的一路,再比较同一指标的变化。原文没有给出这种数字消融表,只在事件详情层面给出模态归因的定性说明,例如 00:06 到 00:24 的解释把决定主要归于语音,并注明视觉与屏幕文字线索并非决定性。这能说明系统具备按片段指出主导来源的能力,但不能当作拿掉某路后性能必然下降的证据。

从机制上可以理解 3 路的互补边界。显性辱骂主要靠语音,隐式与混合语更依赖屏幕文字,快速场景切换需要视觉描述来避免把 benign 上下文误判。但原文未测量单模态与多模态的差值,也未报告不同采样密度下的变化,因此复现时若要补消融,应固定切分与提示,只切换证据子集并记录每段标签与置信度的变化,同时保留阈值与温度设置。

另一个可做的对照是策略后端替换。原文提到界面暴露了政策大模型选择器用于比较审核性能,但正文未给出比较数字。补做时应保持同一证据文本与同一输出解析,只换后端模型,并分别记录标签一致性与置信度分布,而不是混用不同提示去比。

哪些边界没有被测量,不能承诺什么?

缺失证据不是技术错误,但要明确不能承诺的范围。原文未报告检出率、误判率、延迟、成本和输出帧率,也未给出训练资源与推理开销的量化,因此不能写系统更快更准或更便宜。置信度只是模型自报的 0 到 1 分数,未说明校准方法,不能当作真实正确概率。

适用条件也要收窄。切分依赖语音句子与画面相似度阈值,对无声长段和快速剪辑可能敏感,但阈值取值与误切率未报告。屏幕文字依赖采样与置信度过滤,对一闪而过的叠加可能漏检。视觉描述依赖固定间隔与中性提示,对讽刺的理解仍需靠语言侧证据。相关性不等于因果,看到语音主导的例子不能推出所有仇恨都靠语音判定。

数据与评估边界同样存在。HateClipSeg 提供 11714 个片段的细粒度标注,但正文未交代划分、采样与聚合口径,不同指标的差值不能混放,自动指标不能当人工审核结论。若原文表头、图注或算术出现冲突应标注冲突,本次正文数字内部一致,3 个演示窗口的时长与置信度可以互相对上,没有发现需要标注的冲突。

要复现这套流程,先跑什么再补什么?

先核对可运行资源。代码资源状态为可用,当前可用,已公开,地址为代码仓库,屏幕文字依赖的第三方识别库同样当前可用。复现时应先按仓库说明装好语音、识别与视觉后端,再跑通从上传到报告的最小闭环,而不是先调模型。

可重放的最小步骤按原文顺序是先用 Whisper 得到词级转写并用 Punkt 拼句,遇到不低于 20 秒的静音再算帧嵌入余弦相似度补切分。对每个片段按每 3 到 5 秒做屏幕文字识别并保留不低于 0.6 的结果去重,按固定 5 秒间隔用中性提示与温度为 0 生成画面描述,三者拼成提示送入微调后的 Llama3-8B,解析 JSON 四字段后按时间渲染。关键超参数与信息条件要原样保留,包括采样间隔、置信度阈值、温度设置和起止时间。

还需补的验证至少三项。一是记录分阶段耗时与模型版本以对齐审计条,二是补做证据子集消融与后端替换对照,三是统计误判与漏检而不仅看 flag 段。若仓库缺少训练脚本或参数记录,应明确写出缺项再跑推理复现,不能从模型名称推定训练实现。

何时值得尝试这套按时刻取证的思路?

当审核动作必须落到具体秒数时,这套思路值得尝试。整片标签适合做离线排序,片段级结构化输出适合做跳转取证、分诊排序和申诉解释。如果业务只需要判断整片是否违规,就不必引入切分与 3 路融合的复杂度。如果需要告诉审核员先看哪一段、凭什么判、属于哪类,再支持点行跳转与转写同步,那么按时刻切分加融合推理加 JSON 输出的组合是直接对应的。

论文特有的误解需要澄清。第一,高置信度不等于高准确率,93% 与 73% 只是同一系统内的相对把握,没有校准与误判率就不能当概率用。第二,有模态归因不等于做了消融,详情里写主要来自语音只是单次解释,不是拿掉视觉后必然变差的证明。第三,代码可用不等于开箱可运行,还需核对权重下载、后端版本与短期保留等治理条件。

收束时回到可核对的事实。系统用句子与画面相似度切分,用 3 路文本融合后由微调模型输出标签、置信度、理由和类别,并在界面实现播放器警告、片段表、摘要、同步转写与事件详情五窗联动。复现先跑通切分与 3 路抽取,再对齐 JSON 解析与跳转,最后补上耗时、误判与后端对照,这样才能把演示还原为可维护的审核工具。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总