论文解读

End-to-end Listen, Look, Speak and Act

语音对话系统 | 8.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6653 字 阅读 →
论文解读

Entropy-Monitored Kernelized Token Distillation for Audio-Visual Compression

音视频 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4449 字 阅读 →
论文解读

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6079 字 阅读 →
论文解读

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4689 字 阅读 →
论文解读

Human Behavior Atlas: Benchmarking Unified Psychological And Social Behavior Understanding

多模态模型 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5900 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

数字人生成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4161 字 阅读 →
论文解读

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

视频生成 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4843 字 阅读 →
论文解读

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

基准测试 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5342 字 阅读 →
论文解读

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

音频安全 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5487 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5924 字 阅读 →
论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6841 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

基准测试 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4979 字 阅读 →
论文解读

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

音乐理解 | 8.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6721 字 阅读 →
论文解读

Learning multimodal dictionary decompositions with group-sparse autoencoders

跨模态 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4031 字 阅读 →
论文解读

LLM2Fx-Tools: Tool Calling for Music Post-Production

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4397 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

物种分布建模 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5324 字 阅读 →
论文解读

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

音频检索 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5061 字 阅读 →
论文解读

MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction

语音对话系统 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5987 字 阅读 →
论文解读

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

多模态模型 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5125 字 阅读 →