论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7893 字 阅读 →
论文解读

Vidu S1: A Real-Time Interactive Video Generation Model

音视频生成 | 6.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7039 字 阅读 →
论文解读

Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9935 字 阅读 →
论文解读

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

音视频理解 | 4.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6505 字 阅读 →
论文解读

Efficient Multi-modal Dataset Distillation via Analytic Parameter Matching

对比学习 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6217 字 阅读 →
论文解读

LightAVSeg: Lightweight Audio-Visual Segmentation

模型压缩 | 6.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8803 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 5.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6370 字 阅读 →
论文解读

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

音视频理解 | 6.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8099 字 阅读 →
论文解读

Quaternion Self-Attention with Shared Scores

语音增强 | 6.3/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10452 字 阅读 →
论文解读

SONAR: Spectral‑Contrastive Audio Residuals for Generalizable Deepfake Detection

语音伪造检测 | 7.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7289 字 阅读 →
论文解读

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5997 字 阅读 →
论文解读

MiniMax Sparse Attention

高效推理 | 7.7/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11126 字 阅读 →
论文解读

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

高效推理 | 8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5135 字 阅读 →
论文解读

Toward Native Multimodal Modeling: A Roadmap

多模态模型 | 10/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4994 字 阅读 →
论文解读

Fast Multichannel NMF with Block-Diagonal Spatial Covariance Matrices for Efficient Blind Source Separation Using Distributed Microphone Arrays

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7935 字 阅读 →
论文解读

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

多模态模型 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8274 字 阅读 →
论文解读

Fast Multichannel NMF with Block-Diagonal Spatial Covariance Matrices for Efficient Blind Source Separation Using Distributed Microphone Arrays

语音分离 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6659 字 阅读 →
论文解读

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

医学图像重建 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8537 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11116 字 阅读 →
论文解读

Real-time Speech Restoration using Data Prediction Mean Flows

音频修复 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7597 字 阅读 →