FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content

📄 FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content #可解释性 #基准测试 #多模态模型 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.1/10 | 前50% | #可解释性 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Yifeng Gao(复旦大学) 通讯作者:Xingjun Ma(复旦大学) 作者列表:Yifeng Gao(复旦大学)、Yifan Ding(复旦大学,阿里巴巴集团)、Li Wang(复旦大学)、Feida Huang(复旦大学)、Ye Sun(复旦大学)、Yixu Wang(复旦大学)、Xin Wang(复旦大学)、Yutao Wu(迪肯大学)、Hanxun Huang(墨尔本大学)、Yunhao Feng(复旦大学,阿里巴巴集团)、Yingshui Tan(阿里巴巴集团)、Xingjun Ma(复旦大学)、Yu-Gang Jiang(复旦大学) 💡 毒舌点评 论文将一个极具野心的“媒体真伪”与“内容虚实”交叉评估理念推向了全模态,构建了一个高保真的混合欺骗场景,其问题定义令人眼前一亮。然而,在解决方案上却显得有点“虎头蛇尾”。核心的OmniCheck框架将检测重任押注于一个基于Qwen2.5-Omni-3B的LoRA微调小模型,这好比用精巧的锁扣去守护一扇纸糊的门。诚然,模型小、跑得快,但与它要评估的那些动辄上百亿参数的前沿大模型相比,其检测能力的理论上限令人存疑,且全文对数据、代码与模型的开源情况讳莫如深,对于一篇以Benchmark为核心贡献的论文而言,这无疑是一个显著的减分项。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 230 words

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

📄 FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors #语音伪造检测 #大语言模型 #语音合成 #提示学习 #模型评估 6.8/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | #语音伪造检测 | #大语言模型 | #语音合成 #提示学习 | arxiv 👥 作者与机构 第一作者:Sepehr Dehdashtian(Michigan State University) 通讯作者:Sepehr Dehdashtian(Michigan State University) 作者列表:Sepehr Dehdashtian(Michigan State University)、Jacob H. Seidman(Reality Defender)、Vishnu Naresh Boddeti(Michigan State University)、Gaurav Bharaj(Reality Defender) 💡 毒舌点评 本文首次将LLM的上下文学习用于音频深度伪造检测器的黑盒自动化红队,多样性反馈机制设计巧妙,显著提升了攻击多样性与成功率。然而,方法对超参数敏感且未在真实商业检测器上验证,开源代码缺失严重削弱了其实用说服力与可复现性。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 544 words

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

📄 From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping #扩散模型 #多模态模型 7.6/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | #扩散模型 | #扩散模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Xu He(清华大学深圳国际研究生院) 通讯作者:Zhiyong Wu(清华大学深圳国际研究生院, 香港中文大学) 作者列表:Xu He(清华大学深圳国际研究生院)、Haoxian Zhang(快手Kling团队)、Hejia Chen(快手Kling团队)、Changyuan Zheng(清华大学深圳国际研究生院)、Liyang Chen(清华大学深圳国际研究生院)、Songlin Tang(快手Kling团队)、Jiehui Huang(香港科技大学)、Xiaoqiang Liu(快手Kling团队)、Pengfei Wan(快手Kling团队)、Zhiyong Wu(清华大学深圳国际研究生院 / 香港中文大学) 💡 毒舌点评 亮点:论文提出了一种极具洞察力的“生成式自举”范式,从根本上解决了视觉配音领域因掩码修复带来的唇形泄露、身份漂移等顽疾,实现了无掩码、高保真的视觉配音。时间步自适应多阶段学习策略巧妙解耦了编辑任务中的多目标冲突,模型在复杂场景下的鲁棒性令人印象深刻。短板:技术方案对预训练 DiT 和 Whisper 等强大先验的依赖程度过高,自身基础方法的创新有限,且未能提供对基底模型更换后的鲁棒性分析。提出的 X-DubBench 数据集和模型权重均未公开,仅有的推理代码严重限制了社区复现与公平对比。 ...

2026-07-04 · 更新于 2026-07-28 · 4 min · 746 words

From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection

📄 From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection 6.9/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.9/10 | 前50% | #音视频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Ke Liu(电子科技大学 计算机科学与工程学院 未来媒体研究中心) 通讯作者:Jiwei Wei(电子科技大学 计算机科学与工程学院 未来媒体研究中心,mathematic6@gmail.com) 作者列表:Ke Liu、Jiwei Wei、Wenyu Zhang、Shuchang Zhou、Ruikun Chai、Yutao Dai、Chaoning Zhang、Yang Yang。所有作者均隶属于电子科技大学计算机科学与工程学院未来媒体研究中心。 💡 毒舌点评 论文敏锐地抓住了“说话→唱歌”的域迁移痛点,并构建了首个唱歌头深度伪造数据集SHDF,为社区填补了重要的评估空白。然而,方法论层面新意有限,其面部语义对比学习与差分权重融合的架构本质上是Alpha-CLIP与预训练唇读模型的组合,且手工设定的调制向量显得过于工程化,依赖人工调参,缺少自适应的优雅性。此外,开源信息极为模糊,仅有项目页面但代码、模型权重、数据集下载链接均未明确提供,严重影响了工作的实用参考价值与可复现性。 📌 核心摘要 本论文针对现有音视频深度伪造检测方法在“唱歌”场景下性能大幅退化的问题,首次将检测场景从“说话”扩展到“唱歌”。为填补基准空白,作者构建了Singing Head DeepFake(SHDF)数据集,包含2600段真实唱歌视频和3000段由节奏感知生成模型合成的伪造视频。方法上,提出Text-guided Audio-Visual Forgery Detection(T-AVFD)框架,核心是利用Alpha-CLIP与多粒度文本描述进行对比学习,提取泛化的面部真实性模式(FAPL),并通过多模态差分权重学习(MMDWL)动态融合面部语义模式与预训练唇读模型提取的音视频对齐特征。实验在三个说话数据集(AVLips、FKAV、THB)及新提出的SHDF上大幅领先无监督基线,尤其在SHDF上AUC从接近50%的随机水平提升至80.2%,并在多种图像扰动下保持鲁棒性。该工作为音视频伪造检测提供了更具挑战性的评测基准和一种可行的跨场景泛化策略。主要局限性在于检测仍为二分类,缺乏伪造溯源能力,且数据集规模和生成器多样性仍可进一步扩充。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 404 words

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

📄 FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs #音视频问答 #指令微调 8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 1.1/1.5 | 开源 1.1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8/10 | 前25% | #音视频问答 | #指令微调 | arxiv 👥 作者与机构 第一作者:Qian Chen(复旦大学,上海) 通讯作者:Jinlan Fu(复旦大学,上海) 作者列表:Qian Chen(复旦大学,上海)、Jinlan Fu(复旦大学,上海)、Changsong Li(复旦大学,上海;上海创新研究院)、Min Zhang(哈尔滨工业大学,深圳)、See-Kiong Ng(新加坡国立大学)、Xipeng Qiu(复旦大学,上海;上海创新研究院) 💡 毒舌点评 FutureOmni 精准地抓住了当前多模态 LLM 评估中“回顾性理解”泛滥而“前瞻性预测”缺失的真实痛处,尤其是首次将音频拉入未来预测评估的核心,这使得它天生比纯视觉的未来预测基准高出一个段位。然而,OFF 训练策略本质是标准指令微调加上因果推理数据,在方法论上缺乏令人惊喜的架构创新,更像是一次精心设计的数据集和评估框架贡献,而非全新的建模范式。 📌 核心摘要 要解决的问题:现有多模态大语言模型(MLLM)评估主要聚焦于回顾性理解,忽视了从音视频联合上下文中预测未来事件的能力,尤其是音频模态在预测中的关键作用长期未被系统性地评估。 方法核心:构建了首个面向 Omni-modal 未来预测的基准测试 FutureOmni(含 919 个视频、1,034 条多选 QA),并提出 OFF (Omni-Modal Future Forecasting) 训练策略。该策略基于 7, 761 条指令微调数据,训练模型基于历史音视频片段进行因果推理和预测。 与已有方法的不同:区别于纯视觉(VLEP、IntentQA)或纯文本的未来预测基准,FutureOmni 首次将音频模态作为预测的核心信息来源。引入了四种对抗性干扰项(仅视觉、仅音频、延迟、逆因果),迫使模型进行真正的跨模态因果推理。 主要实验结果:在 20 个模型上进行了评估,表现最佳的商用模型 Gemini 3 Flash 准确率仅为 64.8%,而最强开源 Omni 模型 Qwen3-Omni 为 53.05%。OFF 训练策略使得 Qwen2.5-Omni 在语音密集型场景中提升了近 10%(37.83% → 47.75%) ,video-SALMONN 2 提升了 3.87%。此外,OFF训练还展现了对通用音视频基准的泛化能力提升。 模型 Cartoon Edu Emerg Surv Daily Movie Game Doc Avg AVicuna 7B 31.62 39.00 26.09 35.21 32.81 28.19 33.73 20.83 30.37 VideoLLaMA2 7B 43.59 47.00 29.35 53.52 40.62 32.60 57.83 31.94 40.75 Qwen2.5-Omni 3B 37.61 51.00 29.35 57.75 35.94 32.16 51.81 25.00 38.91 video-SALMONN 2 7B 43.59 55.00 39.13 57.04 48.44 40.97 57.83 34.72 46.03 Qwen3-Omni 30B 52.94 68.00 32.88 62.71 59.05 45.60 62.65 49.25 53.05 Gemini 3 Flash 62.71 75.00 58.70 80.28 68.75 59.03 65.06 53.47 64.80 GPT-4o (video-only) 44.06 65.00 34.78 57.74 52.34 50.22 51.80 36.11 49.70 实际意义:为多模态 LLM 的预测推理能力提供了标准化的评估框架,有望推动自动驾驶、人机交互等需要前瞻性感知的应用场景研究。 主要局限性:数据集规模相对较小(919个视频),视频时长分布不均,中长视频样本不足导致分析结论可能不稳定。OFF 训练策略创新性有限。评估仅限选择题形式,缺乏开放式生成评估,可能无法完整反映模型的预测能力。 🔗 开源详情 代码:提供了 GitHub 链接:https://github.com/OpenMOSS/FutureOmni 模型权重:未提供 OFF 微调后的模型检查点。 数据集:FutureOmni 评测基准和 FutureOmni-7K 指令微调数据集可通过上述 GitHub 仓库获取。 Demo:未提及。 复现材料:训练和推理配置见附录,代码仓库提供了实现脚本。论文本身未提供可直接运行的完整训练配置文件或详细的数据预处理脚本。 🏗️ 方法概述和架构 FutureOmni 的核心方法包括基准构建流水线、评估框架设计和 OFF 训练策略三大部分。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 632 words

Group Cognition Learning: Making Everything Better Through Controlled Two-Stage Agents Collaboration

📄 Group Cognition Learning: Making Everything Better Through Controlled Two-Stage Agents Collaboration #音视频理解 #多模态模型 7.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.3/10 | 前50% | #音视频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Chunlei Meng(复旦大学智能机器人研究院与先进制造技术学院) 通讯作者:Chun Ouyang(复旦大学智能机器人研究院与先进制造技术学院) 作者列表:Chunlei Meng(复旦大学)、Pengbin Feng(南加州大学)、Rong Fu(澳门大学)、Hoi Leong Lee(玻璃市马来西亚大学)、Xiaojing Du(阿德莱德大学)、Zhaolu Kang(北京大学)、Zeyu Zhang(澳大利亚国立大学)、Weilin Zhou(新疆大学)、Chun Ouyang(复旦大学)、Zhongxue Gan(复旦大学) 💡 毒舌点评 本文用“治理化协作”这一概念为多模态融合引入了清晰的控制流,选择性交互和共识形成两个阶段的设计相当完整,消融实验也很扎实。但整篇像是多个精巧loss拼凑成的代理系统,四类代理各司其职却也让方法过于臃肿,超参数敏感性实验只覆盖了少数关键项,且没有公开代码,复现难度较高。 📌 核心摘要 要解决的问题:多模态学习中常见的模态支配(梯度集中于最强模态)和伪模态耦合(过拟合偶然共现),导致模型脆弱且可解释性差。 方法核心:提出“群体认知学习 (GCL)”,用两阶段治理化协议取代隐式融合。阶段一(选择性交互)由路由代理提议有向交互路径,审计代理基于边际预测增益动态控制信息传递;阶段二(共识形成)由公共因子代理提取共享语义,聚合代理依据贡献感知的权重形成最终预测。 与已有方法的区别:不同于简单加权融合、事后解耦或基于梯度的优化干预,GCL 首次将交互过程显式地建模为可审计、可门控的代理系统协议,在样本级别根据预测增益直接决定是否进行跨模态通信,并显式惩罚冗余耦合。 主要实验结果:在 CMU-MOSI (MAE 0.685, Acc-7 49.06), CMU-MOSEI (MAE 0.520, Acc-7 55.36) 和 MIntRec (Acc 72.74) 上达到 SOTA,消融表明去掉选择性交互或共识模块都导致性能显著下降,在噪声和置换压力测试及跨任务/跨模态组合泛化实验中鲁棒性明显优于基线。 实际意义:为多模态情感分析和意图识别提供了一种可解释、抗噪声的融合范式,有望迁移到其他需要审计交叉模态贡献的领域(如健康监测、法庭证据合成)。 主要局限性:代理结构复杂、超参数较多,训练需要额外的教师增益信号,且论文未公开代码,工业落地前需更多验证。同时,所有实验基于预提取特征,缺少端到端训练验证。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:论文使用了 CMU-MOSI、CMU-MOSEI、MIntRec、CREMA-D、UCF101、AVE、Food101 等公开数据集,但未提供直接下载链接 Demo:论文中未提及 复现材料:论文中给出了部分实验环境与超参数(PyTorch、Adam、batch size 128、weight decay \(1\times 10^{-4}\)、A100 32GB、早停 patience 6),含附录 A/B,但未提供代码、检查点或配置文件 论文中引用的开源项目:未提及(论文仅以参考文献形式引用各方方法,未给出代码仓库或项目链接) 🏗️ 方法概述和架构 GCL 是一个两阶段治理化多模态学习框架。输入为三种模态的语言 (l)、声学 (a)、视觉 (v) 经过模态特定编码器得到的独立特征,输出为最终预测。整个流程由四个功能显式定义、协同工作的代理执行,不依赖隐式融合。 ...

2026-07-04 · 更新于 2026-07-28 · 3 min · 626 words

Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks

📄 Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks #语音识别 #音频生成 7.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | #语音识别 | #音频生成 | arxiv 👥 作者与机构 第一作者:Tianyi Xu(中国科学院信息工程研究所,中国科学院大学网络空间安全学院) 通讯作者:Yue Zhao(中国科学院信息工程研究所),Kai Chen(中国科学院信息工程研究所) 作者列表:Tianyi Xu、Cheng’an Wei、Yue Zhao、Kai Chen(均来自中国科学院信息工程研究所 / 中国科学院大学网络空间安全学院) 💡 毒舌点评 本文巧妙利用“听觉不留意”的心理声学现象,将其建模为可优化的注意力稀释损失,在对抗音频隐蔽性上迈出了关键一步。200人用户研究中55.6%的不可察觉率远超前人,攻击成本仅0.43美元,成果说服力强。然而,方法深度依赖人工精选的42首音乐载体库和经典MPEG-1掩蔽模型,对长命令和稀疏音乐的泛化能力明显不足;防御实验仅测试了两种基础信号处理手段,面对现实世界中可能存在的说话人验证、音频取证等主动防御系统时,其攻击效力仍存疑,这削弱了其宣称的现实威胁等级。 📌 核心摘要 论文要解决的问题:在真实物理世界中对商用黑盒自动语音识别(ASR)系统发起隐蔽对抗攻击。现有方法仅关注压缩扰动幅度,忽视了人类选择性注意力机制,导致生成的对抗音频仍易被察觉(如Occam仅10.78%用户认为正常,Kenku有46%用户能识别嵌入的指令)。 方法核心是提出HWN(Hearing Without Noticing)框架,包含两个关键设计:基于心理声学掩蔽效应的注意力兼容载体选择算法(从候选音乐库中选出最能掩蔽目标命令的音乐片段)和基于结构-残差分解的注意力稀释损失函数(抑制频谱中易捕获注意力的突变成分)。 与已有方法相比,HWN的新颖之处在于显式建模“注意力”而非仅最小化信噪比,通过载体选择与频谱纹理平滑双重机制提升感知隐蔽性,将攻击从“小声”推向“不被注意”的层次。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 367 words

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

📄 Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio #音频水印 #自回归模型 #鲁棒性 #无监督学习 #理论分析 7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.8/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7/10 | 前50% | #音频水印 | #自回归模型 | #鲁棒性 #无监督学习 | arxiv 👥 作者与机构 第一作者:Georgios Milis(马里兰大学帕克分校计算机科学系) 通讯作者:Heng Huang(马里兰大学帕克分校计算机科学系,heng@umd.edu) 作者列表:Georgios Milis、Yubin Qin、Yihan Wu、Heng Huang(均来自马里兰大学帕克分校计算机科学系) 💡 毒舌点评 用图社区发现来减轻重标记化误差的思路确实精简,将水印检测提升了好几个数量级,且全程无需梯度,黑盒友好。但对时间篡改(裁剪、变速)几乎束手无策,且音乐生成任务下 FAD 明显劣于无扰动基线;实验缺少与主流后置水印的直接对标,使“SOTA”声明缺少横向参照。 ...

2026-07-04 · 更新于 2026-07-28 · 6 min · 1087 words

HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection

📄 HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection #音频伪造检测 #自监督学习 #图神经网络 7.9/10 | 创新 1.1/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.4/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 7.9/10 | 前25% | #音频伪造检测 | #自监督学习 | #图神经网络 | arxiv 👥 作者与机构 第一作者:Qing Wen(浙江大学区块链与数据安全全国重点实验室,浙江大学上海高等研究院) 通讯作者:Zhongjie Ba(浙江大学,杭州高新技术产业开发区(滨江)区块链与数据安全研究院),Peng Cheng(浙江大学,杭州高新技术产业开发区(滨江)区块链与数据安全研究院) 作者列表:Qing Wen(同上),Haohao Li(浙江大学),Zhongjie Ba(浙江大学),Peng Cheng(浙江大学),Miao He(浙江大学),Li Lu(浙江大学),Kui Ren(浙江大学) 💡 毒舌点评 本文利用O-信息理论优雅地诊断了音频深伪检测中的高阶交互缺失问题,并祭出超图与原型学习这对组合拳,立意颇有新意,实验覆盖也堪称广博。然而,方法本质上仍是Wav2Vec2-AASIST的“嫁接增强版”,原型引导与关系放大的协同缺乏深层理论论证,更像依赖工程直觉的拼装。更致命的是,在强压缩场景下性能反而开倒车,作者对何时该用高阶、何时该信冗余仍语焉不详,让整个框架的“协同”假设显得脆弱而不可控。 📌 核心摘要 要解决的问题:现有音频深伪检测方法依赖局部或成对关系,忽视了由多个频谱-时间分量联合涌现的高阶协同交互(HOIs)。论文旨在显式建模HOIs,以捕获更具泛化性的伪造痕迹。 方法核心:提出HyperPotter框架,以超图(hypergraph)代替传统成对图。利用由类感知原型库引导的模糊C均值(FCM)聚类构建软超边捕获高阶关系,并设计了关系伪影放大模块以增强微弱伪造线索。 与已有方法相比的新在哪里:首次引入O-信息量化音频深伪检测中的冗余-协同模式,为高阶关系建模提供理论动机。将对称成对的图学习扩展为非成对的超图学习,并创新性地引入跨批次原型记忆机制,为FCM超边构建注入长期结构先验。 主要实验结果:在仅用ASVspoof2019 LA训练的条件下,HyperPotter在13个测试集上相比Wav2Vec2-AASIST基线,平均相对EER降低12.68%,在性能改善的11个集上,该降幅高达22.15%。具体而言,In‑the‑Wild EER从7.58%降至5.72%,FoR从4.24%降至3.89%,LibriVoc EER从6.96%降至2.55%。但在重度编解码场景ASVspoof2021 LA(2.48%→3.94%)和ASVspoof5(13.38%→16.04%)上性能出现明显退化。 实际意义:证明了高阶关系建模能有效捕获可迁移的伪造痕迹,作为一种“协同专家”,它可在多专家系统中与“冗余专家”互补,提升复杂场景下的整体检测鲁棒性。 主要局限性:强编解码/信道失真会“掩盖”高阶依赖,导致该方法退化成噪声源;模型在参数量近乎不变的情况下,训练和推理开销显著增加,部署友好度差。 🔗 开源详情 代码:https://github.com/HyperPotter/HyperPotter 模型权重:论文及GitHub仓库声明提供了预训练模型,位于上述仓库中。 数据集:论文使用多个公开数据集(ASVspoof 2019 LA, 2021 LA/DF, 2024/5, In-the-Wild, FoR, Codecfake, ADD 2022/2023 系列, LibriVoc, SONAR 等),需遵循各数据集官方协议获取。 复现材料:GitHub仓库提供代码、预训练模型及详细附录(超参、增强策略),复现可行性高。 关键依赖项目: Wav2Vec2-AASIST (基线): https://github.com/TakHemlata/Wav2Vec2-AASIST XLS-R: https://github.com/facebookresearch/fairseq/tree/main/examples/wav2vec RawNet2: https://github.com/asvspoof-challenge/2021/tree/main/LA/Baseline-RawNet2 RawBoost: https://github.com/TakHemlata/RawBoost MUSAN: https://www.openslr.org/17/ 🏗️ 方法概述和架构 HyperPotter将音频深伪检测形式化为图级分类任务。 ...

2026-07-04 · 更新于 2026-07-28 · 2 min · 336 words

INFER: Learning Implicit Neural Frequency Response Fields for Confined Acoustic Environments

📄 INFER: Learning Implicit Neural Frequency Response Fields for Confined Acoustic Environments #空间音频 6.4/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.4/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.4/10 | 前50% | #空间音频 | #空间音频 | arxiv 👥 作者与机构 第一作者:Harshvardhan C. Takawale(马里兰大学帕克分校计算机系;工作完成于Dolby Laboratories, Inc.) 通讯作者:Harshvardhan C. Takawale(htakawal@umd.edu) 作者列表:Harshvardhan C. Takawale(马里兰大学帕克分校计算机系 / Dolby Laboratories, Inc.)、Nirupam Roy(马里兰大学帕克分校计算机系)、C. Phillip Brown(Dolby Laboratories, Inc.) 💡 毒舌点评 这篇文章以“frequency-first”为旗号,构建了一个工程上相当完备的频域神经声场建模管道。将Kramers-Kronig因果关系约束引入神经声场渲染,确实为黑箱模型注入了一丝物理可解释性,这值得肯定。然而,论文最大的争议点在于:它猛烈抨击时域方法“难以捕获频率选择性行为”,但其自身在关键的时域混响指标T60上却遭遇了灾难性滑坡(Buck数据集上T60误差高达9.8,而AVR仅为3.2)。作者将这一退化轻描淡写地归因于“感知频率加权”,但并未从原理上令人信服地论证为何频域建模必然导致时域包络的崩溃。这在某种程度上是“在频域考场上用频域模型吊打时域学生”,其宣称的39%幅度提升和51%相位提升,其比较基准的公平性值得读者深思。 ...

2026-07-04 · 更新于 2026-07-28 · 1 min · 161 words