论文解读

FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content

可解释性 | 6.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4956 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

语音伪造检测 | 6.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6644 字 阅读 →
论文解读

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

扩散模型 | 7.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7387 字 阅读 →
论文解读

From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection

音视频理解 | 6.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6307 字 阅读 →
论文解读

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

音视频问答 | 8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5975 字 阅读 →
论文解读

Group Cognition Learning: Making Everything Better Through Controlled Two-Stage Agents Collaboration

音视频理解 | 7.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6246 字 阅读 →
论文解读

Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6579 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

音频水印 | 7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6164 字 阅读 →
论文解读

HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection

音频伪造检测 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5063 字 阅读 →
论文解读

INFER: Learning Implicit Neural Frequency Response Fields for Confined Acoustic Environments

空间音频 | 6.4/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2761 字 阅读 →
论文解读

IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by \(\textit{IChing}\)

音频编码 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7794 字 阅读 →
论文解读

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

声源定位 | 8.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8152 字 阅读 →
论文解读

Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits

语音识别 | 9.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6415 字 阅读 →
论文解读

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

语音交互 | 8.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7266 字 阅读 →
论文解读

Language Model Augmented Semi-Supervised Statistical Inference

语音属性识别 | 5.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6984 字 阅读 →
论文解读

Learning Tight Rejection Boundaries without Negatives for Strict One-Class Audio Deepfake Detection

语音伪造检测 | 9.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7104 字 阅读 →
论文解读

LightAVSeg: Lightweight Audio-Visual Segmentation

模型压缩 | 6.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8803 字 阅读 →
论文解读

Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking

音频修复 | 7.4/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8704 字 阅读 →
论文解读

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

音频理解 | 9.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6965 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8593 字 阅读 →