每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

不做分离而改混合:用可微合成参数与扩散先验实现分声部音乐编辑

针对和声乐器混合难以分声部精确编辑的问题,该演示系统用乐谱对齐加可微混合合成器做分析合成,再用合成参数域扩散模型约束参数轨迹,在双长笛混合上展示单声部乐器转换与乐句改写的定性例子,但未报告定量指标与可运行代码。

 · 更新于 2026-09-24 · 约 19 分钟 · 9150 字 阅读 →
论文解读

不重建人体动作:把音频当风格信号直接驱动人形机器人跳舞与演讲

论文把音乐与语音当作隐式风格控制信号,用音频-动作对齐加残差混合专家教师与内容加风格扩散学生实现免重定向的音频到关节动作映射,在 FineDance 与 BEAT2 上报告了检索与跟踪指标,但跨仿真与真机泛化仍受数据集与物理条件限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9367 字 阅读 →
论文解读

双人对话手势为何要先分清谁在说话:DyaDiT 用解耦音频与社会条件生成可控动作

DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。

 · 更新于 2026-09-24 · 约 19 分钟 · 9490 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把重叠声场拆开再对齐:FoleyDesigner 如何做时空可控的立体声拟音

针对无声电影片段生成与画面帧级对齐的立体声拟音问题,FoleyDesigner 选择先分解为分层拟音脚本再用视觉轨迹条件扩散逐事件生成并做多智能体混音,最强证据是时空对齐表上 IoU 达 32.2 与 GCC 最低 48.79,代价是密集重叠并发事件仍会出现定位误差且依赖仿真数据与多阶段流水线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9299 字 阅读 →
论文解读

用生成干净样本教判别器:在 FSD50K 里自动挑出单源声音

针对 FSD50K 存在背景干扰、重叠与稀疏标注的问题,该工作用扩散模型生成干净单源样本再构造受控混合来训练 BEATs 加 Bi-LSTM 判别器,在专家整理的 BSE 集上报告 95.51% 准确率与 98.58% 精确率,并据此筛选出 32,880 条的 FSD50K-Solo,代价是未验证对未见类别的泛化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9175 字 阅读 →
论文解读

同时去噪的音视频为何对不齐:Harmony 用跨任务监督稳住对应关系

针对联合扩散中双路噪声导致的对齐漂移,Harmony 用音频驱动与视频驱动辅助任务提供干净锚点,并以全局局部解耦交互与同步增强引导提升细粒度同步,主结果报告 Sync-C 为 5.61、Sync-D 为 7.53,代价是三阶段训练与双分支推理开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8328 字 阅读 →
论文解读

按语音层级拆开看:低层管内容音色、高层管韵律的视频到语音生成

针对无声视频生成语音时视觉稀疏而语音稠密的不对称问题,HiCoDiT 用残差向量量化的 12 层离散 token 层级先验把唇动身份与表情解耦注入低层和高层扩散块,在未训练的 LRS3 与 LRS2 上以 A/B 偏好 57.0% 对 38.1% 胜过 AlignDiT 等基线,代价是身份多样性受限且部分客观指标未全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8430 字 阅读 →
论文解读

不对称伪造下为何要先估一致性再分配计算:IaMSB 的三段桥

针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。

 · 更新于 2026-09-24 · 约 21 分钟 · 10450 字 阅读 →
论文解读

不微调也能说话:用预训练扩散模型拼出口型、身份与时间一致

论文研究无任务微调的说话脸生成,用冻结的稳定扩散加图像适配器做骨干并配三个无可训练参数的模块,在 CREMA 和 HDTF 上报告了最低的口型几何误差和最高的口型相关性,代价是依赖外部人脸先验与逐帧重绘加后滤波的推理链路。

 · 更新于 2026-09-24 · 约 20 分钟 · 9972 字 阅读 →
论文解读

不从零学跳舞:用保先验适配让视频扩散模型听音乐起舞

问题是从音乐生成对拍对风的舞蹈视频,方法选择是冻结预训练文本到视频扩散模型并只在精选层注入零初始化音频交叉注意力,最强证据是舞蹈质量与视频质量上超过从零训练的音视频基线,代价是依赖有限舞蹈数据混合与单卡约 20 小时的适配训练。

 · 更新于 2026-09-24 · 约 18 分钟 · 8921 字 阅读 →
论文解读

语义冲突与任务竞争之下统一视频文本到音频生成的三段式解法

该工作针对统一视频文本到音频生成中音频歧义导致的数据语义冲突与跨任务和任务内竞争,用高对齐的 SoundAtlas 数据做语义桥并以三阶段渐进训练解耦竞争,在 VGGSound-Omni 上实现三任务统一最优,但强依赖数据流水线质量与分阶段训练成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9292 字 阅读 →
论文解读

缺测房间脉冲响应还能做波束形成吗:扩散修复补齐阵列的可用性检验

该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

看得见撞击,还要听得出轻重:PAVAS 把质量与速度写进视频生音频

针对视频生音频只学外观关联而忽视撞击轻重的问题,PAVAS 用估计出的物体质量与速度去调制潜在扩散模型,在 VGGSound 与 VGG-Impact 上同时报告了分布、感知与物理一致性证据,但依赖多组冻结视觉模块且未验证延迟与成本。

 · 更新于 2026-09-24 · 约 24 分钟 · 11524 字 阅读 →
论文解读

把感知显著性压进粗结构:噪声增强自编码器如何对齐音乐表征

该文用带噪潜变量微调一致性音频自编码器加感知损失来学习由粗到细的感知层次,并用自回归整流流估计音高惊奇度,在重建保真、与 IDyOM 相关性和 EEG 预测上报告了提升,但干净重建略有损失且高噪声机制仍待验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

单图加文本加音频做分钟级视频:Soul 用关键帧锚定与阈值码本抑制长时漂移

Soul 针对单帧人物图加文本加音频的人体动画任务,在 Wan2.2-5B 上新增音频注意力并用关键帧表示、段间重叠与阈值码本维持长时一致,再用步数蒸馏与轻量 VAE 加速,在 Soul-Bench 的开源对比与商用人评中取得优势,代价是复杂全身大动作仍可能出现伪影。

 · 更新于 2026-09-24 · 约 22 分钟 · 10657 字 阅读 →
论文解读

不重建整张网格:用分支-主干算子在连续房间空间中查询声场幅值

该文把声场重建写成从稀疏测点集合到任意查询点幅值的算子学习,用分支网编码麦克风坐标与幅值、主干网编码查询坐标并以交叉注意力聚合,在 32×32 训练网格上训练后可直接查询 64×64 细网格,并在 64 或 128 个测点时报告优于扩散基线,代价是 256 个测点时基线反超且本文只重建幅值不重建相位。

 · 更新于 2026-09-24 · 约 16 分钟 · 7766 字 阅读 →
论文解读

听到鸟叫不画鸟:为环境声景生成地理一致的街景

论文把问题定为地理上下文的声音景到景观生成,用声景加可选场景词生成街景级图像,以 SounDiT 三模块注入地理条件,在自建两套大数据集上以通用指标和三层地点相似度验证,代价是依赖预训练编码器与场景标注并需较多算力训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9353 字 阅读 →