论文解读

不靠姿态骨架:用文本管动作、用音频管节奏的说话人像生成

SyncDreamer 针对只有离散情绪标签和依赖姿态中间表示导致动作僵硬的问题,用视觉适配器保身份、音频动态编码器抓节奏能量、跨模态提示增强器把文本变成动作指令,在 HDTF、AVSpeech 人像和 EMTD 半身基准上报告了最优的真实感与同步指标,代价是两阶段扩散训练与更长的提示构造链路。

 · 更新于 2026-09-24 · 约 24 分钟 · 11529 字 阅读 →
论文解读

从一路混合音频生成面对面双人 3D 对话:空间、注视与轮流如何被建模

该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。

 · 更新于 2026-09-24 · 约 21 分钟 · 10319 字 阅读 →
论文解读

人声与人脸为何总对不上:用不对称时间窗口重建音画同步

针对以人为中心联合生成中唇同步偏差与语义情绪脱节,UniAVGen 采用对称双分支加不对称跨模态交互、面部感知调制与模态感知引导实现单模型多任务生成,论文报告在更少联合样本下取得音色与情绪一致性优势,同时存在主体一致性未胜出与大模型打分客观性不足等边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9864 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把音符当集合而非序列:Amadeus 用自回归加双向扩散重排属性依赖

针对符号音乐中音符属性被强加固定单向顺序的问题,Amadeus 采用音符级自回归加属性级双向离散扩散的两级架构并引入 CIEM,在 AMD 大规模数据上以 16.23 notes/s 实现文本条件与可控生成的提升,代价是扩散步数与速度需权衡且数据存在风格偏置。

 · 更新于 2026-09-24 · 约 19 分钟 · 9100 字 阅读 →
论文解读

反转轨迹并非处处关键:用曲率与信息增益决定何时跳过神经网络计算

针对反转式音频编辑必须用密集固定步数导致计算昂贵的问题,论文提出免训练的自适应轨迹外推框架 AdaTE,只在高曲率与高信息增益处做神经网络评估,其余用线性外推跳过,在 AudioLDM2 上以 12.8 次评估达到 3.9 倍加速且保真度基本不降,但激进阈值与极端不稳定轨迹仍会带来退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8605 字 阅读 →
论文解读

从文本到定时再到可懂语音:ControlAudio 为何要用渐进式扩散拆解控制

ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。

 · 更新于 2026-09-24 · 约 20 分钟 · 9654 字 阅读 →
论文解读

把扩散解码做实:DIFFA-2 如何用双适配与四阶段课程补齐音频理解

DIFFA-2 针对自回归音频大模型数据贵、串行解码慢的问题,选择冻结 Whisper-Large-V3 加语义与声学双适配器加 LLaDA-8B 扩散主干与四阶段课程,在 MMSU 总体 60.45 分等公开基准上追平同级自回归模型,代价是第一阶段词错误率略高于自回归对照且三元混合音频仍偏弱。

 · 更新于 2026-09-24 · 约 18 分钟 · 8913 字 阅读 →
论文解读

不训练也能加速语音扩散模型:先标出冗余再逐对校准

针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8816 字 阅读 →
论文解读

SegTune:把歌曲控制从整首描述下沉到分段时间窗

针对全局提示无法刻画配器情绪能量随段落演变的问题,SegTune 用全局加分段层级条件与大模型句级时长预测做非自回归扩散生成,在 15 首中文流行歌测试中把音素错误率降到 14.5% 并把音乐性主观分做到 4.57,代价是偏好优化后性别年龄跟随出现下滑。

 · 更新于 2026-09-24 · 约 19 分钟 · 9487 字 阅读 →
论文解读

不做反演的音乐编辑:用分数蒸馏把改动留在数据空间

针对前向加噪加反向去噪带来的旋律失真问题,论文用增量去噪分数直接在数据空间优化音频,并用个性化增量分数加分布偏移正则与时序对比损失引入用户自定义风格,报告显示在内容保持与偏好率上占优,但强风格迁移与原曲保持之间仍需权衡。

 · 更新于 2026-09-24 · 约 18 分钟 · 9011 字 阅读 →
论文解读

把水印藏进起始噪声:锚定反演如何找回被波形转换打乱的归属

针对潜扩散文本生成音频的归属问题,该文把水印映射为初始隐向量这一支点锚,用无引导扩散生成锚序列并以软动态时间规整优化反演轨迹,在保持生成流程不变下报告了更强的鲁棒性,但每步多轮优化带来了可观的提取时间代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8615 字 阅读 →
论文解读

已有配音怎么改:AV-Edit 用音画联合表示做加、删、换

针对已有视频音轨需随画面增删替换音效的问题,AV-Edit 先用细粒度对比掩码预训练学到音画对齐表示,再用相关门控加多模态扩散重生成,在 VGG-Edit 三类编辑与 VGGSound 生成上报告最优距离与质量,代价是原文承认不能无失真保留原音。

 · 更新于 2026-09-24 · 约 20 分钟 · 9758 字 阅读 →
论文解读

用光流解耦外观与运动、再用强度引导噪声搜索压住闪烁的说话头生成

ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9366 字 阅读 →
论文解读

双人同时动还要各像各的:DialoGen 如何把互动与个人风格分开建模

DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。

 · 更新于 2026-09-24 · 约 20 分钟 · 9954 字 阅读 →
论文解读

用可预测的显式节奏信号约束扩散:Diff-V2M 的分层条件设计

针对通用视频背景音乐在时间对齐与多视角特征融合上的困难,Diff-V2M 用节奏预测器从视频估计低分辨率起音检测函数并以情感先行、语义与节奏并行融合的分层交叉注意力约束音频潜在扩散,在域内混合测试与域外 V2M-Bench 上取得更优的客观指标与主观偏好,代价是依赖场景切分与帧差等粗粒度视觉动态且缺乏显式风格控制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9969 字 阅读 →
论文解读

不用自回归也能听懂语音:DIFFA 以冻结扩散模型加双适配器做理解

DIFFA 针对语音理解仍依赖自回归解码的问题,选择冻结 Whisper-small 与 LLaDA-8B-Instruct、只训练语义与声学双适配器的两阶段路线,在 960 小时 ASR 加 127 小时合成指令数据下 MMAU 平均 49.71% 与 MMSU 平均 56.04%,代价是音系与副语言细粒度感知仍弱于语义推理。

 · 更新于 2026-09-24 · 约 19 分钟 · 9250 字 阅读 →
论文解读

无标注数据用不满:用分频带扩散扰动与全局-类别置信留住更多样本

针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。

 · 更新于 2026-09-24 · 约 21 分钟 · 10192 字 阅读 →
论文解读

偏好打架时不要平均:把动作、口型、画质拆开学再按时步和层融合

针对音频驱动人像动画中动作自然度、唇同步、视觉质量互相冲突的问题,该工作用 Talking-Critic 学三维奖励并自动构建 410K 偏好对,再用 TLPO 分专家独立优化后做时步-层自适应融合,报告显示主指标和用户评分全面提升,代价是两阶段训练与多专家推理融合的额外复杂度。

 · 更新于 2026-09-24 · 约 22 分钟 · 10601 字 阅读 →