论文解读

克隆与匿名本是一体两面:把 27k 小时的 TTS 直接当成隐私滤镜

语音转换 | 8.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8455 字 阅读 →
论文解读

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

语音编码 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6303 字 阅读 →
论文解读

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6892 字 阅读 →
论文解读

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

语音伪造检测 | 8.4/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11604 字 阅读 →
论文解读

Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil

语音伪造检测 | 7.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7303 字 阅读 →
论文解读

Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion

语音转换 | 7.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5983 字 阅读 →
论文解读

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

语音转换 | 6.9/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7105 字 阅读 →
论文解读

Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion

语音转换 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8922 字 阅读 →
论文解读

Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats

语音转换 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6152 字 阅读 →
论文解读

NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

语音转换 | 5.9/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2033 字 阅读 →
论文解读

OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7900 字 阅读 →
论文解读

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

语音转换 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5546 字 阅读 →
论文解读

RIVET: Robust Idempotent Voice Attribute Editing

语音转换 | 8/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4451 字 阅读 →
论文解读

Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization

语音转换 | 6.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5580 字 阅读 →
论文解读

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

语音转换 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9064 字 阅读 →
论文解读

SSL-GMMVC: Interpretable Voice Conversion via Locally Linear GMM Transforms in Self-Supervised Representation Space

语音转换 | 6.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5852 字 阅读 →
论文解读

TargetSEC: Plug-and-Play In-the-Wild Speech Emotion Conversion via Arousal-Conditioned Latent Style Diffusion

语音转换 | 6.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5649 字 阅读 →
论文解读

SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue

语音合成 | 8.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8091 字 阅读 →
论文解读

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

语音合成 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7971 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6556 字 阅读 →