论文解读

DAVSS: Distilled Audio-Visual State Space Models

音视频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5722 字 阅读 →
论文解读

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

音视频语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7543 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6303 字 阅读 →
论文解读

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

音视频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7021 字 阅读 →
论文解读

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

音视频生成 | 7.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6701 字 阅读 →
论文解读

On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2303 字 阅读 →
论文解读

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

语音增强 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6600 字 阅读 →
论文解读

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

音视频生成 | 7.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7019 字 阅读 →
论文解读

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

音频分类 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7322 字 阅读 →
论文解读

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →
论文解读

ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure

语音编码 | 7.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9038 字 阅读 →
论文解读

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

语音增强 | 6.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5920 字 阅读 →
论文解读

Equivariant Music Transformer

音乐生成 | 8.6/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9835 字 阅读 →
论文解读

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7802 字 阅读 →
论文解读

StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7515 字 阅读 →
论文解读

Anomalous Sound Detection Meets Noise-Aware Self-Supervised Learning

音频事件检测 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6649 字 阅读 →
论文解读

Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR

语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6440 字 阅读 →
论文解读

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8468 字 阅读 →
论文解读

AMRD: Adaptive Multi-Teacher Relational Distillation for Lightweight Speech Emotion Recognition

语音情感识别 | 5.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5579 字 阅读 →
论文解读

Parallel Decoding Distillation for Fast Image and Video Generation

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9236 字 阅读 →