论文解读

Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness

音频水印 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7234 字 阅读 →
论文解读

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

音频编码 | 9.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6824 字 阅读 →
论文解读

Data-driven Video Codec with Implicit Neural Representations

音频编码 | 5.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6797 字 阅读 →
论文解读

Neural Morphing: Sequence-Optimized Token-Level Morphing in Neural Audio Codecs

音频编码 | 6.4/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9078 字 阅读 →
论文解读

PolarBM: Complex-valued Boltzmann Machine for Modeling Audio Signals in Polar and Log-polar Coordinates

语音增强 | 5.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5817 字 阅读 →
论文解读

Qwen-Audio-VAE Technical Report

音频编码 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8347 字 阅读 →
论文解读

Structural Bottlenecks on Frequency Representation in End-to-End Audio Models

音频编码 | 7.4/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8095 字 阅读 →
论文解读

IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by \(\textit{IChing}\)

音频编码 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7794 字 阅读 →
论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Perceptual Evaluation of Higher-Order Ambisonic Codecs on Both Synthetic Mixing and Native Recordings

音频编码 | 8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6403 字 阅读 →
论文解读

Probing Token Spaces under Generator Shift in AI-Generated Music Detection

音频编码 | 9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6007 字 阅读 →
论文解读

USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding

音频编码 | 9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6009 字 阅读 →
论文解读

Codec-Robust Attacks on Audio LLMs

音频安全 | 8.3/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning

音频编码 | 6.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8657 字 阅读 →
论文解读

Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning

音频编码 | 7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9569 字 阅读 →
论文解读

SAME: A Semantically-Aligned Music Autoencoder

音频编码 | 8.5/10

 · 更新于 2026-09-24 · 约 26 分钟 · 13010 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7824 字 阅读 →
论文解读

Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10175 字 阅读 →
论文解读

AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling

音频编码 | 7.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8374 字 阅读 →
论文解读

Exploring Token-Space Manipulation in Latent Audio Tokenizers

音频编码 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9238 字 阅读 →