论文解读

Marco-Voice: A Unified Framework for Expressive Speech Synthesis with Voice Cloning

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

Meanflow-Accelerated Multimodal Video-to-Audio Synthesis Via One-Step Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4951 字 阅读 →
论文解读

MeanFlowSE: One-Step Generative Speech Enhancement via Conditional Mean Flow

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3795 字 阅读 →
论文解读

MeanSE: Efficient Generative Speech Enhancement with Mean Flows

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3917 字 阅读 →
论文解读

MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5574 字 阅读 →
论文解读

MeanVoiceFlow: One-Step Nonparallel Voice Conversion with Mean Flows

语音转换 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4492 字 阅读 →
论文解读

Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation

说话人日志 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4023 字 阅读 →
论文解读

MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4749 字 阅读 →
论文解读

MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5357 字 阅读 →
论文解读

Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5404 字 阅读 →
论文解读

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5908 字 阅读 →
论文解读

NCF-TTS: Enhancing Flow Matching Based Text-To-Speech with Neighborhood Consistency Flow

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4168 字 阅读 →
论文解读

PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6124 字 阅读 →
论文解读

Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling

歌唱语音转换 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4949 字 阅读 →
论文解读

QE-XVC: Zero-Shot Cross-Lingual Voice Conversion via Query-Enhancement and Conditional Flow Matching

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4561 字 阅读 →
论文解读

RAP: Real-Time Audio-Driven Portrait Animation with Video Diffusion Transformer

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5050 字 阅读 →
论文解读

Real-Time Streaming MEL Vocoding with Generative Flow Matching

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4120 字 阅读 →
论文解读

Refgen: Reference-Guided Synthetic Data Generation for Anomalous Sound Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3682 字 阅读 →
论文解读

RFM-Editing: Rectified Flow Matching for Text-Guided Audio Editing

音频编辑 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4151 字 阅读 →
论文解读

S2Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5290 字 阅读 →