论文解读

Arbitrarily Settable Frame Rate Neural Speech Codec with Content Adaptive Variable Length Segmentation

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5159 字 阅读 →
论文解读

Assessing The Perceptual Impact of Low-Altitude Aircraft Noise in Cities: An Auralization Framework Using Gaussian Beam Tracing

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3778 字 阅读 →
论文解读

Audience-Aware Co-speech Gesture Generation in Public Speaking via Anticipation Tokens

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5224 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5499 字 阅读 →
论文解读

AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum audio synthesis

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4419 字 阅读 →
论文解读

Cardiobridge-DM: Bridging Cross-Cohort Heart Sound Synthesis via Rhythm-Aware Semi-Supervised Diffusion

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Combining Multi-Order Attention and Multi-Resolution Discriminator for High-Fidelity Neural Vocoder

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Constraint Optimized Multichannel Mixer-Limiter Design

多通道 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4564 字 阅读 →
论文解读

Diff-vs: Efficient Audio-Aware Diffusion U-Net for Vocals Separation

语音分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Diffusion Timbre Transfer via Mutual Information Guided Inpainting

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4273 字 阅读 →
论文解读

Disentangling Physiology from Fidelity: Latent-Guided Diffusion Models for Cross-Modal Cardiac Synthesis

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5351 字 阅读 →
论文解读

Diverse and Few-Step Audio Captioning via Flow Matching

音频字幕生成 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3494 字 阅读 →
论文解读

EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5305 字 阅读 →
论文解读

Feedback-Driven Retrieval-Augmented Audio Generation with Large Audio Language Models

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
论文解读

FlashFoley: Fast Interactive Sketch2audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4806 字 阅读 →
论文解读

FODGE : High-Fidelity Dance Generation via Full-Body Optimization

音频生成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4639 字 阅读 →
论文解读

FoleyBench: A Benchmark for Video-to-Audio Models

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
论文解读

FxSearcher: Gradient-Free Text-Driven Audio Transformation

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3834 字 阅读 →
论文解读

Generating Localized Audible Zones Using a Single-Channel Parametric Loudspeaker

空间音频 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3300 字 阅读 →