论文解读

RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9074 字 阅读 →
论文解读

AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9598 字 阅读 →
论文解读

ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog Synthesis via Latent Flow Matching

语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7717 字 阅读 →
论文解读

Data Augmentation for L2 English Speaking Assessment using TTS

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7246 字 阅读 →
论文解读

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

语音合成 | 5.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4932 字 阅读 →
论文解读

FreyaTTS Technical Report

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8785 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9782 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音质量评估 | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6832 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9056 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8468 字 阅读 →
论文解读

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6017 字 阅读 →
论文解读

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5163 字 阅读 →
论文解读

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7351 字 阅读 →
论文解读

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7847 字 阅读 →
论文解读

Doppelganger: Sound Effects and Their Synthetic Twins

音频检索 | 9.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6213 字 阅读 →
论文解读

Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

语音伪造检测 | 1.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5404 字 阅读 →
论文解读

NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

语音转换 | 5.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2033 字 阅读 →
论文解读

ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6226 字 阅读 →
论文解读

Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

语音合成 | 4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6353 字 阅读 →
论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3294 字 阅读 →