论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Simultaneous Speech-to-Speech Translation Without Aligned Data

语音翻译 | 8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5628 字 阅读 →
论文解读

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

流式处理 | 7.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9066 字 阅读 →
论文解读

The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning

知识蒸馏 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6068 字 阅读 →
论文解读

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

音视频生成 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6714 字 阅读 →
论文解读

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

音视频问答 | 7.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9623 字 阅读 →
论文解读

Latency-Configurable Streaming Speech Enhancement via Asymmetric Temporal Padding

语音增强 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5381 字 阅读 →
论文解读

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

语音合成 | 5.7/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization

语音转换 | 6.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5580 字 阅读 →
论文解读

Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5858 字 阅读 →
论文解读

Efficiency-Performance Trade-offs in Neural Speaker Diarization via Structured Pruning and Low-Bit Quantization

说话人日志 | 5.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6022 字 阅读 →
论文解读

Adaptive Turn-Taking for Real-time Multi-Party Voice Agents

数据增强 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5916 字 阅读 →
论文解读

Endpoint Anticipation for Low-Latency Spoken Dialogue

多任务学习 | 8.2/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4326 字 阅读 →
论文解读

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5771 字 阅读 →
论文解读

ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling

语音质量评估 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4995 字 阅读 →
论文解读

FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4750 字 阅读 →
论文解读

MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

语音转换 | 6.9/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11480 字 阅读 →
论文解读

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2562 字 阅读 →
论文解读

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

多模态模型 | 6.4/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3789 字 阅读 →
论文解读

Audio Interaction Model

流式处理 | 9.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5688 字 阅读 →