论文解读
S-PRESSO: Ultra Low Bitrate Sound Effect Compression with Diffusion Autoencoders and Offline Quantization
音频生成 | 7.5/10
音频生成 | 7.5/10
音频生成 | 7.0/10
音频生成 | 7.5/10
音频生成 | 7.5/10
歌唱语音合成 | 7.5/10
音乐信息检索 | 8.0/10
音频生成 | 7.5/10
音频生成 | 8.5/10
音频生成 | 8.5/10
音频生成 | 7.5/10
音频生成 | 6.5/10
空间音频 | 8.0/10
音频生成 | 8.0/10
音频超分辨率 | 8.0/10
音乐生成 | 7.5/10
音频生成 | 8.5/10
音频生成 | 7.5/10
本文针对符号音乐生成中主流的事件序列(event-based)tokenization方法隐含处理时间规律、导致模型需额外学习时间网格的问题,提出了一种名为**BEAT**的新型网格化tokenization框架。其核心思想是将音乐在时间上均匀离散化为“拍”(beat)作为基本单位,将每拍内每个音高
这篇论文旨在解决现有音乐生成模型难以对**任意时间尺度**上的音乐模式进行精确控制的问题。作者提出了**潜在傅里叶变换(LatentFT)** 框架,其核心是将离散傅里叶变换应用于由扩散自编码器编码得到的**潜在向量序列**,从而得到“潜在频谱”。通过在训练过程中对潜在频谱进行随机频率掩码,迫使解码
本文提出了ControlFoley,一个统一且可控的视频到音频生成框架,旨在解决现有方法在跨模态冲突下文本控制力弱、以及参考音频控制中音色与时间信息纠缠的问题。其核心贡献包括:1)提出联合视觉编码范式