论文解读

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

语音属性识别 | 8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6346 字 阅读 →
论文解读

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

音视频生成 | 8/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9827 字 阅读 →
论文解读

Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy

语音增强 | 8.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5900 字 阅读 →
论文解读

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

音视频问答 | 6.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8438 字 阅读 →
论文解读

EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

音视频理解 | 6.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6514 字 阅读 →
论文解读

Efficient Distributed MLLM Training with Cornstarch

音视频理解 | 7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5041 字 阅读 →
论文解读

Efficient Multi-modal Dataset Distillation via Analytic Parameter Matching

对比学习 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6217 字 阅读 →
论文解读

Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion

音乐检索 | 4.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7918 字 阅读 →
论文解读

Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability

语音合成 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6527 字 阅读 →
论文解读

FakeWorld 1.0: An Omni-modal Benchmark for Fake Media and Content

可解释性 | 6.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4956 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

语音伪造检测 | 6.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6644 字 阅读 →
论文解读

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

扩散模型 | 7.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7387 字 阅读 →
论文解读

From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection

音视频理解 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6307 字 阅读 →
论文解读

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

音视频问答 | 8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5975 字 阅读 →
论文解读

Group Cognition Learning: Making Everything Better Through Controlled Two-Stage Agents Collaboration

音视频理解 | 7.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6246 字 阅读 →
论文解读

Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks

语音识别 | 7.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6579 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

音频水印 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6164 字 阅读 →
论文解读

HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection

音频伪造检测 | 7.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5063 字 阅读 →
论文解读

INFER: Learning Implicit Neural Frequency Response Fields for Confined Acoustic Environments

空间音频 | 6.4/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2761 字 阅读 →
论文解读

IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by \(\textit{IChing}\)

音频编码 | 8.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7794 字 阅读 →