先分对白再分音乐音效:LiteCASS 用两级子带 U-Net 做立体声实时分离
针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。
针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对发声谐波污染唇端扫频响应的问题,该研究用闭口校准加高阶小啁啾变换分离嗓音与扫频重建声道响应,在 90 赫兹到 1100 赫兹基频的/a/静态仿体上识别前四个共振并给出频率与带宽,代价是在共振一致与低基频处误差与分离难度明显增大。
针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文不改滤波器设计,只把拉伸有限冲激响应级联做成块流加环形状态的串行基线,再用开放多处理任务流水线并行,在英伟达 Jetson Orin Nano 上以串行超每秒 118 万采样、6 线程加速超 4.5 倍为证据,代价是最小能耗点不在最高性能点。
针对空间语义分割同时要分离和分类而旧联合指标会把标签错配算成负分的问题,论文提出先做置换不变匹配再算分类的 CASA-SDR,并在受控交换与 DCASE 2025 系统上显示它能把差分离与标签交换区分开,代价是对删除与替换类错误不再区分。
针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对自然混合音频直接生成图像会丢失多源语义的问题,MACS 采用先用 UNet 分离再用解耦交叉注意力生成图像的两阶段路线,在 LLP-multi 等多任务上报告了多项指标领先,但分离数固定与文本标签依赖仍是主要代价与边界。
该文把单通道分离写成已知加性混合的逆问题,只用单源扩散先验加迭代重建引导完成分离,并用混合加噪初始化、三重注意力骨干与混合引导强度解决梯度冲突,代价是 200 步迭代采样的计算开销与同质语音的排列不确定性。
针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。
音频分离 | 5.7/10
音频分离 | 6.6/10
音频分离 | 9.0/10
音频分离 | 6.5/10
音频分离 | 7.2/10
音频分类 | 5.3/10
音频分离 | 9.2/10