论文解读

一句里装不下两种心情:HybridEmo 如何让 TTS 先走完轨迹再调好混合

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12777 字 阅读 →
论文解读

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4765 字 阅读 →
论文解读

Does Listening Matter? Backchanneling and Nodding in AI Clone

语音交互 | 5.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5992 字 阅读 →
论文解读

Aslema at NADI 2026: Augmentation through Fewshot for SLU

语音交互 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4468 字 阅读 →
论文解读

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

语音合成 | 9.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4189 字 阅读 →
论文解读

A survey of AI-generated voices and their detection

语音伪造检测 | 6.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4920 字 阅读 →
论文解读

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

语音克隆 | 6.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7652 字 阅读 →
论文解读

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9642 字 阅读 →
论文解读

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5681 字 阅读 →
论文解读

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

语音合成 | 6.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6735 字 阅读 →
论文解读

CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

语音合成 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7332 字 阅读 →
论文解读

Extracting Voice Styles from Frozen TTS Models via Gradient-Based Inverse Optimization

语音克隆 | 7.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5923 字 阅读 →
论文解读

Synthetic Speech, Real Signal: Paralinguistic Preservation and Cross-Lingual Augmentation via Voice Cloning

语音情感识别 | 6.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6667 字 阅读 →
论文解读

X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System

语音翻译 | 7.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7793 字 阅读 →
论文解读

A Geometry-Limited Identification Floor and Its Consequences for Voice-Clone Attribution in Professional Voice Actors

说话人验证 | 8.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8183 字 阅读 →
论文解读

Traceback Translators Against Forgetting in Continual Fake Speech Detection

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7695 字 阅读 →
论文解读

Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction

语音克隆 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6792 字 阅读 →
论文解读

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

语音合成 | 5.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4932 字 阅读 →
论文解读

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

语音合成 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8042 字 阅读 →
论文解读

VoxCPM2 Technical Report

语音合成 | 9.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7125 字 阅读 →