论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6841 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

基准测试 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4979 字 阅读 →
论文解读

Knowing When to Quit: Probabilistic Early Exits for Speech Separation Networks

语音分离 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5074 字 阅读 →
论文解读

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

音乐理解 | 8.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6721 字 阅读 →
论文解读

Latent Fourier Transform

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4291 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音大模型 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5696 字 阅读 →
论文解读

LayerSync: Self-aligning Intermediate Layers

生成模型 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4835 字 阅读 →
论文解读

Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4089 字 阅读 →
论文解读

Learning multimodal dictionary decompositions with group-sparse autoencoders

跨模态 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4031 字 阅读 →
论文解读

LLM2Fx-Tools: Tool Calling for Music Post-Production

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4397 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音克隆 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4919 字 阅读 →
论文解读

MAPSS: Manifold-based Assessment of Perceptual Source Separation

语音分离 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4535 字 阅读 →
论文解读

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5682 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3963 字 阅读 →
论文解读

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

物种分布建模 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5324 字 阅读 →
论文解读

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

音频检索 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5061 字 阅读 →
论文解读

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

语音问答 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4249 字 阅读 →
论文解读

Music Flamingo: Scaling Music Understanding in Audio Language Models

音乐理解 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6053 字 阅读 →
论文解读

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

多模态模型 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5125 字 阅读 →