论文解读

S-PRESSO: Ultra Low Bitrate Sound Effect Compression with Diffusion Autoencoders and Offline Quantization

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5113 字 阅读 →
论文解读

Sounds that Shape: Audio-Driven 3D Mesh Generation with Attribute-Decoupled Score Distillation Sampling

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3847 字 阅读 →
论文解读

Spring Reverb Emulation with Hybrid Gated Convolutional Networks and State Space Models

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5227 字 阅读 →
论文解读

StereoFoley: Object-Aware Stereo Audio Generation from Video

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3564 字 阅读 →
论文解读

StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks

歌唱语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5251 字 阅读 →
论文解读

Subsequence SDTW: Differentiable Alignment with Flexible Boundary Conditions

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4127 字 阅读 →
论文解读

Sunac: Source-Aware Unified Neural Audio Codec

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4495 字 阅读 →
论文解读

SwitchCodec: Adaptive Residual-Expert Sparse Quantization for High-Fidelity Neural Audio Coding

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5387 字 阅读 →
论文解读

Synthcloner: Synthesizer-Style Audio Transfer via Factorized Codec with ADSR Envelope Control

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5185 字 阅读 →
论文解读

TAG: Structured Temporal Audio Generation via LLM-Guided Manual Scription and Control

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4086 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

Text2Move: Text-To-Moving Sound Generation via Trajectory Prediction and Temporal Alignment

空间音频 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Training-Free Multimodal Guidance for Video to Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4470 字 阅读 →
论文解读

Universr: Unified and Versatile Audio Super-Resolution Via Vocoder-Free Flow Matching

音频超分辨率 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4168 字 阅读 →
论文解读

Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4896 字 阅读 →
论文解读

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5972 字 阅读 →
论文解读

Materialistic RIR: Material Conditioned Realistic RIR Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5449 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

本文针对符号音乐生成中主流的事件序列(event-based)tokenization方法隐含处理时间规律、导致模型需额外学习时间网格的问题,提出了一种名为**BEAT**的新型网格化tokenization框架。其核心思想是将音乐在时间上均匀离散化为“拍”(beat)作为基本单位,将每拍内每个音高

 · 更新于 2026-09-25 · 约 10 分钟 · 4791 字 阅读 →
论文解读

Latent Fourier Transform

这篇论文旨在解决现有音乐生成模型难以对**任意时间尺度**上的音乐模式进行精确控制的问题。作者提出了**潜在傅里叶变换(LatentFT)** 框架,其核心是将离散傅里叶变换应用于由扩散自编码器编码得到的**潜在向量序列**,从而得到“潜在频谱”。通过在训练过程中对潜在频谱进行随机频率掩码,迫使解码

 · 更新于 2026-09-25 · 约 10 分钟 · 4514 字 阅读 →
论文解读

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

本文提出了ControlFoley,一个统一且可控的视频到音频生成框架,旨在解决现有方法在跨模态冲突下文本控制力弱、以及参考音频控制中音色与时间信息纠缠的问题。其核心贡献包括:1)提出联合视觉编码范式

 · 更新于 2026-09-25 · 约 13 分钟 · 6198 字 阅读 →