论文解读

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

音视频 | 9.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4810 字 阅读 →
论文解读

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

音视频联合推理 | 7.0/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4251 字 阅读 →
论文解读

Knowing When to Quit: Probabilistic Early Exits for Speech Separation Networks

语音分离 | 7.0/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6033 字 阅读 →
论文解读

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

音乐理解 | 8.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5557 字 阅读 →
论文解读

LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation

说话人验证 | 8.5/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7232 字 阅读 →
论文解读

Latent Fourier Transform

音乐生成 | 8.5/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4922 字 阅读 →
论文解读

Latent Speech-Text Transformer

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5615 字 阅读 →
论文解读

LayerSync: Self-aligning Intermediate Layers

音频生成 | 7.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4057 字 阅读 →
论文解读

Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5399 字 阅读 →
论文解读

Learning multimodal dictionary decompositions with group-sparse autoencoders

跨模态检索 | 7.5/10

 · 更新于 2026-09-10 · 约 8 分钟 · 3971 字 阅读 →
论文解读

LLM2Fx-Tools: Tool Calling for Music Post-Production

音乐信息检索 | 7.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4633 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音合成 | 6.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4034 字 阅读 →
论文解读

MAPSS: Manifold-based Assessment of Perceptual Source Separation

模型评估 | 8.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4083 字 阅读 →
论文解读

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

语音分离 | 7.5/10

 · 更新于 2026-09-10 · 约 25 分钟 · 12209 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4323 字 阅读 →
论文解读

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4699 字 阅读 →
论文解读

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

生态计算 | 8.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5623 字 阅读 →
论文解读

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

音频分类 | 9.0/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9208 字 阅读 →
论文解读

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

音频生成 | 7.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5854 字 阅读 →
论文解读

MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation

语音增强 | 6.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5552 字 阅读 →