论文解读

粗框也要贴边、对时也要对帧:声画同步实例编辑的空间与时间分工

AVI-Edit 以 Wan2.2 为视频骨干,用精度因子引导的掩膜精修器管空间边界、用分离生成混音返工的音频智能体管时间对齐,在 AVISET 与 AvED-Bench 上报告了质量与同步优势,代价是多实例只能串行逐个处理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9981 字 阅读 →
论文解读

电影混音三轨分离:用脸与场景两路视觉约束生成式分离

针对电影混音需分离对白、音效、音乐且缺乏带干净分轨的视听电影数据问题,该工作用条件流匹配同时生成三路频谱并以面部与场景双路视觉为条件,合成数据训练后在合成与真实电影片段上获得更干净的主观与分布指标,但多步采样与预测模型在信噪比类指标上的差距仍是代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

稀疏上下文下房间脉冲响应为何只能生成分布:FLAC 的多模态流匹配做法

针对新房间仅给 1 至 8 条脉冲响应、深度与位姿时确定性方法无法表达声学不确定性的问题,FLAC 用潜空间流匹配加扩散变换器生成合理脉冲响应分布,并在 AcousticRooms 未见房间与真实 HAA 上以单样本超越 8 样本基线,但分布真实性与单步推理之间仍需权衡。

 · 更新于 2026-09-24 · 约 21 分钟 · 10102 字 阅读 →
论文解读

不做迭代生成:用一次重建加音频到姿态解耦做实时唇同步

论文把唇同步拆成一步潜空间图像编辑器与音频到唇姿态变换器,用纯重建加流匹配代替对抗与扩散,并在重建与跨音频评测中以 109.41 帧每秒的单卡速度达到可比的同步与保真,代价是遮挡与极端姿态仍待加强。

 · 更新于 2026-09-24 · 约 20 分钟 · 9995 字 阅读 →
论文解读

不用反演找噪声:以视觉氛围与音高约束同时改风格、保旋律

该文把音乐风格迁移拆成视觉文本联合定风格与色度约束保旋律两件事,用无反演流直接搬运隐变量并以内层梯度拉回音高结构,代价是旋律锚定越强时目标风格贴合会轻微下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10502 字 阅读 →
论文解读

只听指定的那一个:文本如何从混合画面中挑出目标声音

针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8784 字 阅读 →
论文解读

看见鼓槌落下才发声:用音视频对齐的扩散变换器与语义时间偏好优化做视频生音频

针对无声视频生成音频时语义错位与时间错位并存的问题,论文用音视频时间对齐加图文语义引导的流匹配扩散变换器做基座,再用 ImageBind 与 Synchformer 自动排序的偏好优化做对齐微调,在 VGGSound 测试集上以 151M 参数取得分布与同步指标的领先,但高帧率编码与多轮偏好迭代仍带来额外开销与过优化风险。

 · 更新于 2026-09-24 · 约 19 分钟 · 9262 字 阅读 →
论文解读

长视频越播越走样:先定低分辨率动作再用姿态锚定外观的音频驱动动画

针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9524 字 阅读 →
论文解读

画面内外都要出声:OmniSonic 如何把语音和环境声放在同一视频里生成

针对视频配音只做可见环境声、做不了语音与画外声共存的问题,OmniSonic 用视频加文本联合条件的流匹配扩散与三路交叉注意力加门控融合,在自建的三场景基准上同时生成语音与环境声,主观与客观指标报告全面领先,但时间同步仍弱于带细粒度同步视觉特征的基线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9217 字 阅读 →
论文解读

一次生成一小段连续潜块:SCAPES 如何用轻量流模型做语义可控的环境声

针对环境声语义描述粗疏而波形稠密、离散量化破坏连续性、非因果编解码拼接易产生边界伪影的问题,SCAPES 冻结 EnCodec 连续潜空间并用条件连续归一化流做段级自回归生成,在约 34 分钟 10 类数据上以约 36M 参数单卡约 1 小时训练实现长稳可控合成,代价是对语音音乐等长结构建模不足且部分类别指标未胜出。

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →
论文解读

既要对齐时间又要能重建细节:SyncStream 在隐空间统一判别与生成

针对音视频时间同步被忽视且掩码自编码重建模糊的问题,SyncStream 用隐空间对比掩码自编码学紧凑对齐表示再用条件流匹配精修隐变量,在 VGGSound 上把分类准确率从 38.40% 提升到 49.14% 并降低音频重建误差,代价是两阶段训练与解码器深度需要权衡。

 · 更新于 2026-09-24 · 约 27 分钟 · 13232 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

分开给音色和风格:FC-TTS 用两阶段管线约束解耦的边界

FC-TTS 要解决用两段不同参考语音分别控制音色与风格的问题,它用音色先定模糊谱、风格再细化的方法组织生成,并在 RAVDESS 音色控制上报告保持可用质量,而代价是放弃部分内容与细节信息并引入中间瓶颈。

 · 更新于 2026-09-24 · 约 18 分钟 · 8837 字 阅读 →
论文解读

不重训识别器:在语言向量空间里把失真推回干净流形

针对噪声混响等导致语言向量漂移的问题,该文冻结语种识别器并在其输出向量上学习流匹配变换,用五语种失真配对实验把 ECAPA 整体准确率从 0.6900 提升到 0.8672,代价是推理需 50 步常微分方程求解且法语等个别情形仍弱于波形前端。

 · 更新于 2026-09-24 · 约 17 分钟 · 8373 字 阅读 →
论文解读

在嵌入空间做生成式后端:FM-SEE 如何把教师嵌入推向干净分布

针对声学失配下说话人嵌入漂移问题,论文用条件流匹配在嵌入空间学习从高斯噪声到干净教师嵌入的映射,并用多次采样估计目标分数均值做分数归一化,在七个数据集上平均相对降低等错率约 17%,代价是推理需多步常微分方程求解且在干净匹配条件下几乎无增益。

 · 更新于 2026-09-24 · 约 18 分钟 · 8885 字 阅读 →
论文解读

极低码率下保住语义再重建波形:FlowTokenizer 的分层对齐与单层稠密量化

针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9967 字 阅读 →