论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5530 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4936 字 阅读 →
论文解读

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5357 字 阅读 →
论文解读

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4542 字 阅读 →
论文解读

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6017 字 阅读 →
论文解读

Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4906 字 阅读 →
论文解读

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

多模态推理 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3952 字 阅读 →
论文解读

Data-Centric Lessons To Improve Speech-Language Pretraining

语音问答 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

End-to-end Listen, Look, Speak and Act

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6653 字 阅读 →
论文解读

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

音视频 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4449 字 阅读 →
论文解读

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6079 字 阅读 →
论文解读

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4689 字 阅读 →
论文解读

Human Behavior Atlas: Benchmarking Unified Psychological And Social Behavior Understanding

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5900 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

数字人生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4161 字 阅读 →
论文解读

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

视频生成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4843 字 阅读 →
论文解读

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5342 字 阅读 →
论文解读

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

音频安全 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5487 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5924 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6841 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4979 字 阅读 →