论文解读

Alethia: a Foundational Encoder for Voice Deepfakes

语音伪造检测 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6803 字 阅读 →
论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7734 字 阅读 →
论文解读

SAM Audio: Segment Anything in Audio

音频分离 | 9.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6829 字 阅读 →
论文解读

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

音视频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6404 字 阅读 →
论文解读

SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering

音频修复 | 8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8353 字 阅读 →
论文解读

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

生成模型 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8817 字 阅读 →
论文解读

VeRe-Flow: Guiding Flow Matching toward Clean Speech via Velocity Contrastive Regularization and Representation Alignment for Noise-Robust Bandwidth Expansion

语音增强 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4813 字 阅读 →
论文解读

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7085 字 阅读 →
论文解读

Improving Text-to-Music Generation with Human Preference Rewards

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6462 字 阅读 →
论文解读

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

语音转换 | 6.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5546 字 阅读 →
论文解读

Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4932 字 阅读 →
论文解读

How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5246 字 阅读 →
论文解读

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

Transformer | 7.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow

语音增强 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5796 字 阅读 →
论文解读

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

语音合成 | 9.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5638 字 阅读 →
论文解读

PhASE-Flow: Phonetic-Conditioned Acoustic Flow Matching in SSL Representation Domain for Speech Enhancement

语音增强 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6160 字 阅读 →
论文解读

AUDEDIT: Inversion-Free Text-Guided Editing with Pretrained Audio Flow Models

生成模型 | 7.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5877 字 阅读 →
论文解读

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

语音生成 | 6.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5373 字 阅读 →
论文解读

PianoKontext: Expressive Performance Rendering from Deadpan Context

音乐生成 | 9.1/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4271 字 阅读 →
论文解读

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6269 字 阅读 →