论文解读

先分对白再分音乐音效:LiteCASS 用两级子带 U-Net 做立体声实时分离

针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。

 · 更新于 2026-09-24 · 约 19 分钟 · 9469 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

发声时也在场的外激扫频:唇端阻抗分离如何同时拿下共振频率与带宽

针对发声谐波污染唇端扫频响应的问题,该研究用闭口校准加高阶小啁啾变换分离嗓音与扫频重建声道响应,在 90 赫兹到 1100 赫兹基频的/a/静态仿体上识别前四个共振并给出频率与带宽,代价是在共振一致与低基频处误差与分离难度明显增大。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →
论文解读

字幕能帮耳朵分轨吗:CineSubNet 用文本先验做电影对白音乐音效分离

针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。

 · 更新于 2026-09-24 · 约 15 分钟 · 7049 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

级联不拆相位、并行不抢状态:多级线性相位八度滤波器组的吞吐与能耗折中

该文不改滤波器设计,只把拉伸有限冲激响应级联做成块流加环形状态的串行基线,再用开放多处理任务流水线并行,在英伟达 Jetson Orin Nano 上以串行超每秒 118 万采样、6 线程加速超 4.5 倍为证据,代价是最小能耗点不在最高性能点。

 · 更新于 2026-09-24 · 约 18 分钟 · 8551 字 阅读 →
论文解读

先按声音配对再看标签对错:把分离质量和分类错误分开算的 S5 评价

针对空间语义分割同时要分离和分类而旧联合指标会把标签错配算成负分的问题,论文提出先做置换不变匹配再算分类的 CASA-SDR,并在受控交换与 DCASE 2025 系统上显示它能把差分离与标签交换区分开,代价是对删除与替换类错误不再区分。

 · 更新于 2026-09-24 · 约 18 分钟 · 8825 字 阅读 →
论文解读

推理时才给方向图:同一网络如何装下多种指向性

针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。

 · 更新于 2026-09-24 · 约 16 分钟 · 7656 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

先分离再生成:MACS 如何把混合声音拆开并对齐语义来画图

针对自然混合音频直接生成图像会丢失多源语义的问题,MACS 采用先用 UNet 分离再用解耦交叉注意力生成图像的两阶段路线,在 LLP-multi 等多任务上报告了多项指标领先,但分离数固定与文本标签依赖仍是主要代价与边界。

 · 更新于 2026-09-24 · 约 19 分钟 · 9387 字 阅读 →
论文解读

不用成对混合也能分离:扩散先验与重建引导如何分开又合上声音

该文把单通道分离写成已知加性混合的逆问题,只用单源扩散先验加迭代重建引导完成分离,并用混合加噪初始化、三重注意力骨干与混合引导强度解决梯度冲突,代价是 200 步迭代采样的计算开销与同质语音的排列不确定性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9209 字 阅读 →
论文解读

未知声源数下分离与提取如何共用一个分离器:USE 的吸引子与线索对齐

针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。

 · 更新于 2026-09-24 · 约 21 分钟 · 10192 字 阅读 →
论文解读

从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间

音频分离 | 5.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5061 字 阅读 →
论文解读

单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作

音频分离 | 6.6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12996 字 阅读 →
论文解读

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

音频分离 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4945 字 阅读 →
论文解读

DNN-Based Frequency-Dependent Estimation of Speech, Music, and Noise Power in Acoustic Mixtures for Hearing-Aid Scene Analysis

音频分离 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4890 字 阅读 →
论文解读

DRONEAUDIONET: Noise Suppression for Drone Audition-based Search and Rescue

音频分离 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Mixture-Constrained Max Pooling Improves Separation-Based Bird Species Classification

音频分类 | 5.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6284 字 阅读 →
论文解读

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

音频分离 | 9.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6048 字 阅读 →