论文解读

TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

语音识别 | 9.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5444 字 阅读 →
论文解读

X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4444 字 阅读 →
论文解读

DNN-Based Frequency-Dependent Estimation of Speech, Music, and Noise Power in Acoustic Mixtures for Hearing-Aid Scene Analysis

音频分离 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4890 字 阅读 →
论文解读

Target Speaker Identification: A Low-Latency Streaming Pipeline

说话人验证 | 5.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5075 字 阅读 →
论文解读

StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Supervised Streaming Speech Recognition

语音识别 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5783 字 阅读 →
论文解读

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7721 字 阅读 →
论文解读

Luna-TTS Family Technical Report

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7839 字 阅读 →
论文解读

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

语音增强 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6600 字 阅读 →
论文解读

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

音视频生成 | 7.4/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4241 字 阅读 →
论文解读

Homebot: A Personal AI Agent for Conversational Home Assistance and Automation

语音交互 | 3.8/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4457 字 阅读 →
论文解读

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8468 字 阅读 →
论文解读

WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction

语音分离 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7245 字 阅读 →
论文解读

faster-enhancer.c: A Dependency-Free int8 Runtime for Streaming Speech Enhancement on Commodity CPUs

语音增强 | 8.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7387 字 阅读 →
论文解读

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

语音交互 | 6.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5166 字 阅读 →
论文解读

CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

音频理解 | 8.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6774 字 阅读 →
论文解读

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6369 字 阅读 →
论文解读

Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4430 字 阅读 →
论文解读

CAPS: A Cascaded Reconstruction Model to Power Saving in Hearables Using Sub-Nyquist Sampling with Bandwidth Extension

语音增强 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7493 字 阅读 →
论文解读

Cumsum-Composable Phase Transport for Low-Cost Streaming Keyword Spotting

语音唤醒 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6381 字 阅读 →
论文解读

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

语音翻译 | 7.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7236 字 阅读 →