论文解读

PG-SE: Predictive Acceleration and Correction for Generative Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5158 字 阅读 →
论文解读

PICOAUDIO2: Temporal Controllable Text-to-Audio Generation with Natural Language Description

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4651 字 阅读 →
论文解读

PRoADS: Provably Secure And Robust Audio Diffusion Steganography With Latent Optimization And Backward Euler Inversion

音频安全 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3627 字 阅读 →
论文解读

PromptSep: Generative Audio Separation Via Multimodal Prompting

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3891 字 阅读 →
论文解读

RAP: Real-Time Audio-Driven Portrait Animation with Video Diffusion Transformer

音视频 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5050 字 阅读 →
论文解读

RFM-Editing: Rectified Flow Matching for Text-Guided Audio Editing

音频编辑 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4151 字 阅读 →
论文解读

S-PRESSO: Ultra Low Bitrate Sound Effect Compression with Diffusion Autoencoders and Offline Quantization

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5113 字 阅读 →
论文解读

SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution

音频增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4383 字 阅读 →
论文解读

Savgbench: Benchmarking Spatially Aligned Audio-Video Generation

基准测试 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4030 字 阅读 →
论文解读

Scalable Evaluation for Audio Identification Via Synthetic Latent Fingerprint Generation

音频检索 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3896 字 阅读 →
论文解读

Shortcut Flow Matching for Speech Enhancement: Step-Invariant Flows via Single Stage Training

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4631 字 阅读 →
论文解读

SIRUP: A Diffusion-Based Virtual Upmixer of Steering Vectors for Highly-Directive Spatialization with First-Order Ambisonics

声源定位 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4466 字 阅读 →
论文解读

Sounds that Shape: Audio-Driven 3D Mesh Generation with Attribute-Decoupled Score Distillation Sampling

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3847 字 阅读 →
论文解读

Staged Diffusion with Hybrid Mixture-of-Experts (MOE) for Multimodal Sentiment Analysis

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4137 字 阅读 →
论文解读

Stemphonic: All-At-Once Flexible Multi-Stem Music Generation

音乐生成 | 7.7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4942 字 阅读 →
论文解读

StereoFoley: Object-Aware Stereo Audio Generation from Video

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3564 字 阅读 →
论文解读

Str-DiffSep: Streamable Diffusion Model for Speech Separation

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4807 字 阅读 →
论文解读

Structure-Aware Diffusion Schrödinger Bridge

数据集对齐 | 7.7/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4076 字 阅读 →
论文解读

StyHarmo: Efficient Style-Specific Video Generation with Music Synchronization

视频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5066 字 阅读 →
论文解读

Style-Disentangled Diffusion for Controllable and Identity-Generalized Speech-Driven Body Motion Generation

语音驱动动作生成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4058 字 阅读 →