论文解读
先压缩时间再做全局融合:MambaVoice 的轻量视听歌声分离
针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …
针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …
针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。
针对电影混音需分离对白、音效、音乐且缺乏带干净分轨的视听电影数据问题,该工作用条件流匹配同时生成三路频谱并以面部与场景双路视觉为条件,合成数据训练后在合成与真实电影片段上获得更干净的主观与分布指标,但多步采样与预测模型在信噪比类指标上的差距仍是代价。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读