论文解读

把语义骨架和声学细节分开装:MuSeC 为何能在混合音乐上同时保真与可建模

论文把音乐语义定义为可测的检索任务能力,用冻结语义单码本加声学残差量化双流在混合信号上重建,报告显示完整配置在内容保持与重建上占优而纯声学配置虽重建略高却显著更难建模。

 · 更新于 2026-09-24 · 约 18 分钟 · 8752 字 阅读 →
论文解读

各层残差变化不同速,为何还要共用同一切分:LACE 的逐层压缩

针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。

 · 更新于 2026-09-24 · 约 17 分钟 · 8057 字 阅读 →
论文解读

在时域里做混叠抵消:OLAC 如何对齐 MDCT 重叠实现无缝有损无损切换

针对无线音频需在有损与无损之间无断点切换的问题,OLAC 只做可逆时域混叠抵消加窗而不做整数 MDCT 变换,用前向线性预测与 Golomb-Rice 编码实现无损压缩,在 20 毫秒帧下平均压缩到 56.8%,代价是帧间预测被切断且随机访问需先解前一帧。

 · 更新于 2026-09-24 · 约 22 分钟 · 10600 字 阅读 →
论文解读

高阶全通 warping 下 DCT 合成滤波器为何能用凸最小二乘做到完全重建

针对高阶全通变换 DCT 分析合成滤波器组相位与混叠失真难以同时补偿的问题,论文用凸最小二乘直接求解 FIR 合成子滤波器系数,以完全重建设计实现全局最优,并以混叠受限的近完全重建设计换取更好的合成滤波器频率选择性。

 · 更新于 2026-09-24 · 约 21 分钟 · 10396 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把感知显著性压进粗结构:噪声增强自编码器如何对齐音乐表征

该文用带噪潜变量微调一致性音频自编码器加感知损失来学习由粗到细的感知层次,并用自回归整流流估计音高惊奇度,在重建保真、与 IDyOM 相关性和 EEG 预测上报告了提升,但干净重建略有损失且高噪声机制仍待验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

一套参数如何同时装下单声道、立体声和 5.1 环绕声

针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。

 · 更新于 2026-09-24 · 约 17 分钟 · 8221 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

极低码率下保住语义再重建波形:FlowTokenizer 的分层对齐与单层稠密量化

针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9967 字 阅读 →
论文解读

重构保真与可预测难以兼得:用未来预测与语义对齐重塑音频编码器

针对重构训练的编码器与自回归语言模型目标不一致导致词元难学的问题,论文用未来词元预测与语义对齐改造编码器,在 SALMon 上报告 61.6% 准确率与 35 倍困惑度下降,同时语音 Mel 距离改善 5.0%,代价是需要配对文本与额外训练开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9505 字 阅读 →
论文解读

按频带分开压缩:BSCodec 用独立编解码应对语音音乐音效的谱差异

针对语音能量集中而音乐音效需全频保真的问题,BSCodec 把频谱切成独立频带并行编码量化解码,在相同混合训练下以 2.55 kbps 和 3.83 kbps 对标 DAC 的 4.5 kbps 和 6 kbps,代价是编码器解码器数量随频带数增加且语音对切分粒度敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8964 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

不用传专家编号的量化扩容:UniStream 如何做 48 kHz 因果流式通用音频编码

UniStream 针对 48 kHz 因果流式语音、音乐与环境声共用一套残差码本容量不足的问题,用多专家残差向量量化扩大每层量化容量并靠已解码状态确定性复现路由,用训练期最优传输条件流匹配正则化量化隐空间,在 12 kbps Top-1 和 22.5 kbps Top-2 两档下以 ViSQOL、Mel 失真和消融证明多专家是主要增益来源,而流正则只带来语 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10032 字 阅读 →
论文解读

双耳相位不可丢:从 Mel 模糊到复数 VAE 的空间音频重建

为解决视觉遮挡下世界模型缺乏空间听觉的问题,BinauralVAE 对比三种 VAE 在 0.2 秒双耳片段上的重建能力,显示保留相位的复数 VAE 在低频段实现可听的空间保真,而幅值-only 与四通道实数 VAE 分别因 ITD 丢失与相位塌缩而失效。

 · 更新于 2026-09-24 · 约 23 分钟 · 11495 字 阅读 →
论文解读

在单通道约束下用稀疏相对脉冲响应重建空间:HOA 参数化编码的显式房间建模

针对三阶 HOA 在约 27 kbps 单传输通道下混响建模不足的问题,论文以波束成形参考盲估计相对空间房间脉冲响应并拆为稀疏波包与残差包络进行参数化,在未见 SRIR 上取得与 32 kbps IVAS 相当且验证集上略优的 QASTANet 分数,同时把空间参数压到约 2 kbps。

 · 更新于 2026-09-24 · 约 24 分钟 · 12011 字 阅读 →
论文解读

压住衰减曲线才能压住房间:375 bps 下的 RIR 神经压缩

论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。

 · 更新于 2026-09-24 · 约 19 分钟 · 9031 字 阅读 →
论文解读

Geometric Iterative Retrieval for Neural Audio Codec Resynthesis

音频编码 | 7.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5287 字 阅读 →
论文解读

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

音频编码 | 3.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6965 字 阅读 →
论文解读

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

音频编码 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6157 字 阅读 →
论文解读

KVAE: Family of Tokenizers for Multimodal Generative Models

音频编码 | 8.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7110 字 阅读 →