每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 212 分钟 · 106059 字 阅读 →
论文解读

跨模态一致反而更难查:RAVM 用多智能体伪造现实感视频谣言并以证据图检测

针对生成式视频谣言跨模态语义一致导致旧数据集失真的问题,该研究构建含声明、视频、音频与跨模态四类操纵的 9049 对 RAVM 数据集并提出证据图检测模型 IEEG,以 75.99% 准确率取得最优但仍显示通用大模型的脆弱性,代价是生成与评测流程复杂且数据集链接当前不可用。

 · 更新于 2026-09-25 · 约 18 分钟 · 8720 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
论文解读

低资源多口音下毒性语音为何失效:冻结音频大模型加三段软提示的解法

针对级联转写在低资源语言和口音下丢失声学线索且误差传播的问题,论文用冻结 MiMo-Audio-7B 加任务加共享加语言残差三段软提示做端到端二分类,在 PolySpeechTox 上报告微平均 ROC-AUC 为 98.07%,代价是只验证了单一骨干且依赖语言口音标签做训练路由。

 · 更新于 2026-09-25 · 约 18 分钟 · 8674 字 阅读 →
论文解读

长片先切准场景再判好笑:视觉加字幕与笑声加文本的幽默片段流水线

该工作把长片搞笑片段抽取拆成镜头检测、视觉加文本的场景合并、笑声加长文本幽默判断加不当内容过滤与排序四步,用 MovieNet-SSeg 指导的三元组预训练和 10 句 ColBERT 在 OVSD 上提升 18.3% 的 AP、在 MHD 上达到 0.834 的 F1,代价是预告片快切下场景结尾准确率下降与文本分支目前只支持英文。

 · 更新于 2026-09-25 · 约 22 分钟 · 10562 字 阅读 →
论文解读

内容无毒不等于语音无毒:用来源与类型双头拆分副语言毒性

针对纯文本审核漏掉语气、情绪与语速等副语言毒性的问题,该研究构建带毒性来源标注的 ToxiAlert-Bench 并采用双头加多阶段训练的 ToxiAlert 模型,最强证据是在自建基准上相对最强基线 Macro-F1 相对提升 21.1%、准确率相对提升 13.0%,代价是合成数据依赖 TTS 表现力与细粒度类别仍存在明显短板。

 · 更新于 2026-09-25 · 约 20 分钟 · 9976 字 阅读 →
论文解读

广告审核为何需要跨模态因果链:BLM-Guard 的两阶段策略

针对短视频广告中夸大表述与跨模态错位带来的细粒度政策违规,BLM-Guard 采用规则锚定的交错模态推理冷启动加自适应评论奖励的分组优化实现可解释审核,在自建基准与消融矩阵中报告严格准确率与一致性提升,但资源本次未能确认可达且一致性依赖大模型打分。

 · 更新于 2026-09-25 · 约 20 分钟 · 9863 字 阅读 →
论文解读

看不清字、听得出音:MMBERT 用三路专家对付中文伪装仇恨言论

针对同音替换、字形拆解、缩写与中英混写等伪装使纯文本失效的问题,MMBERT 把文本、合成语音与字形图像经对齐器送入共享自注意力加混合专家结构,并用三阶段渐进训练稳定优化,在 ToxiCloakCN 上报告 F1 为 95.2,代价是依赖合成多模态输入与较重的分阶段调参。

 · 更新于 2026-09-25 · 约 21 分钟 · 10267 字 阅读 →
论文解读

按时刻定点而不是按整片贴标签:SafeLens 如何把语音、字幕和画面拼成可申诉的审核证据

SafeLens 针对短视频中仇恨内容只在少数时刻出现而整片标签会引入时间噪声的问题,用先切分语义片段再融合语音转写、屏幕文字和画面描述并由微调策略大模型输出标签加置信度加一句话理由加伤害类别的结构化判断,演示证据显示其能在同一视频内区分出 93% 与 73% 等不同置信度的多个片段,但原文未报告可复算的检出率与对照基线所以只能作为工作流演示而非性能结论。

 · 更新于 2026-09-25 · 约 18 分钟 · 8965 字 阅读 →
论文解读

先分清状态,再决定能不能说话:Anian 如何把生成关进安全笼子

语音交互 | 5.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8236 字 阅读 →
论文解读

有害不在一处:当声音与画面由多模态共同拼出

音视频生成 | 7.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7570 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 87 分钟 · 43538 字 阅读 →
论文解读

ARENA: Automated Red-Teaming for Large Audio Language Models

音频理解 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7088 字 阅读 →
论文解读

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

音视频理解 | 7.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8197 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 129 分钟 · 64264 字 阅读 →
论文解读

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

语音交互 | 8.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7266 字 阅读 →
论文解读

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

音频理解 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6409 字 阅读 →
论文解读

Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues

音频分类 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7338 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-18

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 48 分钟 · 23894 字 阅读 →