论文解读

压住衰减曲线才能压住房间:375 bps 下的 RIR 神经压缩

论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。

 · 更新于 2026-09-24 · 约 19 分钟 · 9031 字 阅读 →
论文解读

把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵

声源定位 | 5.7/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12536 字 阅读 →
论文解读

把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向

音频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 28 分钟 · 13764 字 阅读 →
论文解读

当混响不再模仿房间:用声码器思路把噪声织成尾响

音频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9147 字 阅读 →
论文解读

把空间感调得更夸张,音乐会更清晰吗?

音乐理解 | 6.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8378 字 阅读 →
论文解读

把拾音器从琴上焊死的位置里解放出来:64 路沿弦采样如何把音色选择推迟到混音台

音乐源分离 | 7.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7164 字 阅读 →
论文解读

既要指向性,又要去混响:一次前向如何重建干净的虚拟方向麦克风

空间音频 | 5.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7955 字 阅读 →
论文解读

让声码器也理解方向:CSAVocoder 把空间线索留在最后一公里

空间音频 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

空间音频 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6054 字 阅读 →
论文解读

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

空间音频 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

空间音频 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6952 字 阅读 →
论文解读

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

空间音频 | 9.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4341 字 阅读 →
论文解读

Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance

音频交互 | 5.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5265 字 阅读 →
论文解读

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

空间音频 | 6.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8580 字 阅读 →
论文解读

Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale

声源定位 | 7.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8223 字 阅读 →
论文解读

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

音频生成 | 6.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6421 字 阅读 →
论文解读

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

音视频问答 | 6.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5213 字 阅读 →
论文解读

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

音频生成 | 7.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8583 字 阅读 →
论文解读

RIPPLE: Generating Multi-Channel Phase, Not Recovering It

音频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8301 字 阅读 →
论文解读

PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response Simulation

空间音频 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6462 字 阅读 →