论文解读

Erasing Your Voice Before it’s Heard: Training-Free Speaker Unlearning for Zero-Shot Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5260 字 阅读 →
论文解读

FED-PISA: Federated Voice Cloning Via Personalized Identity-Style Adaptation

语音克隆 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5699 字 阅读 →
论文解读

Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 4005 字 阅读 →
论文解读

From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4405 字 阅读 →
论文解读

Gelina: Unified Speech and Gesture Synthesis Via Interleaved Token Prediction

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5600 字 阅读 →
论文解读

GLA-GRAD++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4319 字 阅读 →
论文解读

Group Relative Policy Optimization for Text-to-Speech with Large Language Models

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →
论文解读

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-Based TTS

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4633 字 阅读 →
论文解读

Hierarchical Discrete Flow Matching For Multi-Codebook Codec-Based Text-To-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3910 字 阅读 →
论文解读

How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4091 字 阅读 →
论文解读

IBPCodec : A Low-Bitrate Lightweight Speech Codec With Inter-Band Prediction

语音编码 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3768 字 阅读 →
会议任务专题

ICASSP 2026 - 语音合成

共 63 篇 ICASSP 2026 语音合成 方向论文

 · 更新于 2026-09-25 · 约 207 分钟 · 103446 字 阅读 →
论文解读

InstructAudio: Unified Speech and Music Generation with Natural Language Instruction

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9232 字 阅读 →
论文解读

Int-MeanFlow: Few-Step Speech Generation with Integral Velocity Distillation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5048 字 阅读 →
论文解读

Learning Vocal-Tract Area And Radiation With A Physics-Informed Webster Model

歌唱语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5653 字 阅读 →
论文解读

Leveraging Text-to-Speech and Voice Conversion as Data Augmentation for Alzheimer's Disease Detection from Spontaneous Speech

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5134 字 阅读 →
论文解读

LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3037 字 阅读 →
论文解读

Marco-Voice: A Unified Framework for Expressive Speech Synthesis with Voice Cloning

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

Measuring Prosody Diversity in Zero-Shot TTS: A New Metric, Benchmark, and Exploration

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4416 字 阅读 →
论文解读

MELA-TTS: Joint Transformer-Diffusion Model with Representation Alignment for Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5124 字 阅读 →