论文解读

MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation

语音分离 | 8.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5695 字 阅读 →
论文解读

Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development

音乐生成 | 4.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7818 字 阅读 →
论文解读

SB-RF: Schrödinger Bridge Rectified Flow for One-Step Robust Speech Enhancement

语音增强 | 7.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5309 字 阅读 →
论文解读

Flow-HOA: Generative Joint Optimization for Ambisonics Encoding via Flow Matching

空间音频 | 7.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6364 字 阅读 →
论文解读

SURF: Separation via Unsupervised Remixing Flow

无监督学习 | 6.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5166 字 阅读 →
论文解读

A Comparison of Generative and Discriminative Methods for Speech Enhancement: Robustness, Complexity, and Hallucination

语音增强 | 8.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 7008 字 阅读 →
论文解读

C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification

音频分类 | 7.3/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2877 字 阅读 →
论文解读

Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

语音合成 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5364 字 阅读 →
论文解读

SegTune: Structured and Fine-Grained Control for Song Generation

音乐生成 | 8.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6788 字 阅读 →
论文解读

Local Diagnostics of Continuous Normalizing Flow for Out-of-Distribution Detection

语音合成 | 8.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5709 字 阅读 →
论文解读

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

语音合成 | 8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4782 字 阅读 →
论文解读

From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6488 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

音频水印 | 6.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6460 字 阅读 →
论文解读

Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction

语音编码 | 9.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8226 字 阅读 →
论文解读

Diffusion Domain Expansion: Learning to Coordinate Pre-trained Diffusion Models

扩散模型 | 7.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5697 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 8.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7201 字 阅读 →
论文解读

Music of Changing Lines: Toward a Culturally Situated Approach to the I-Ching

音乐生成 | 5.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6040 字 阅读 →
论文解读

Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model

音乐生成 | 5.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8324 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 6.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8197 字 阅读 →
论文解读

Bridging the Gap: Converting Read Text to Conversational Dialogue

语音转换 | 3.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5452 字 阅读 →