论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5426 字 阅读 →
论文解读

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7540 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

音视频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6714 字 阅读 →
论文解读

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5802 字 阅读 →
论文解读

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6668 字 阅读 →
论文解读

ZONOS2 Technical Report

语音合成 | 10/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7161 字 阅读 →
论文解读

A Generalized Formalism of Auto-Regressive Decoding for Speech Processing

自回归模型 | 4.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4512 字 阅读 →
论文解读

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7085 字 阅读 →
论文解读

Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5591 字 阅读 →
论文解读

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

语音合成 | 9.3/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5638 字 阅读 →
论文解读

Towards Robust Generative Speech Enhancement Using Vector Quantisation-Based Neural Audio Codec

语音增强 | 5.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8860 字 阅读 →
论文解读

BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM

语音合成 | 9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5563 字 阅读 →
论文解读

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5771 字 阅读 →
论文解读

ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling

语音质量评估 | 8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4995 字 阅读 →
论文解读

Overcoming Decoder Inconsistencies in Whisper for Dravidian and Low-Resource Languages

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6234 字 阅读 →
论文解读

TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6310 字 阅读 →
论文解读

dots.tts Technical Report

语音合成 | 9/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3032 字 阅读 →
论文解读

Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

语音识别 | 8.6/10

 · 更新于 2026-09-24 · 约 3 分钟 · 1214 字 阅读 →
论文解读

LiveBand: Live Accompaniment Generation in the Audio Domain

音乐生成 | 8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6832 字 阅读 →
论文解读

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

多模态模型 | 7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7267 字 阅读 →