论文解读

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

音视频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9455 字 阅读 →
论文解读

PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response Simulation

空间音频 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6462 字 阅读 →
论文解读

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6369 字 阅读 →
论文解读

TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation

语音分离 | 6.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5695 字 阅读 →
论文解读

VibeVoice-ASR-BitNet Technical Report

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6193 字 阅读 →
论文解读

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

语音交互 | 7.6/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8635 字 阅读 →
论文解读

StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7788 字 阅读 →
论文解读

Ultra-Compact CNN Architectures for Tropical Bird Audio Detection on Microcontrollers

音频事件检测 | 9.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7444 字 阅读 →
论文解读

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

音视频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7604 字 阅读 →
论文解读

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

语音合成 | 6.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6532 字 阅读 →
论文解读

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

音频编码 | 9.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6824 字 阅读 →
论文解读

Efficient Text-to-Audio Generation via Pruning

音频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5635 字 阅读 →
论文解读

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6817 字 阅读 →
论文解读

ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching

语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7717 字 阅读 →
论文解读

CoFi-Lite: Pushing the Limits of Ultra-Lightweight Speech Enhancement

语音增强 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6153 字 阅读 →
论文解读

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

音频生成 | 8.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8443 字 阅读 →
论文解读

LightMem-Ego: Your AI Memory for Everyday Life

流式处理 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5925 字 阅读 →
论文解读

Qwen-Audio-VAE Technical Report

音频编码 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8347 字 阅读 →
论文解读

WaveNet-Style Guitar Amplifier Model Pruning for Real-Time iOS Deployment

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5705 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9782 字 阅读 →