SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

📄 SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks 标签:#语音增强 #扩散模型 #模型压缩 #高效推理 7.6/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #扩散模型 | #模型压缩 #高效推理 | arxiv 👥 作者与机构 第一作者:Nagashree K. S. Rao(Fraunhofer IIS, Am Wolfsmantel 33, 91058 Erlangen, Germany) 通讯作者:正文未明确标注 作者列表:Nagashree K. S. Rao、Shrishti Saha Shetu、Mohamed Elminshawi、Emanuël A. P. Habets、Andreas Brendel(机构:Fraunhofer IIS, Am Wolfsmantel 33, 91058 Erlangen, Germany;International Audio Laboratories Erlangen) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 470 words

Generalized Audio-Driven Synthesis of Precise Drummer Motion

📄 Generalized Audio-Driven Synthesis of Precise Drummer Motion 标签:#音视频生成 #扩散模型 #音乐理解 #游戏音频 7.8/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.8/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音视频生成 | #扩散模型 | #音乐理解 #游戏音频 | arxiv 👥 作者与机构 第一作者:Álvaro G. Iñesta(机构未说明) 通讯作者:未说明 作者列表:Álvaro G. Iñesta、Mattia Ryffel、Amit H. Bermano、Robert W. Sumner、Martin Guay(机构信息未在当前正文中完整说明) 💡 毒舌点评 用生成模型驱动鼓手机器人的动作是个人机交互的好题目,但当前版本的泛化边界画得很紧:所有动作来自同一名鼓手同一套鼓,风格与体型泛化未验证;模型假定鼓组布局固定,连交叉手演奏都排除了。输入必须是纯鼓轨,多乐器歌曲要靠源分离预处理,泄漏与瞬态损失会传导到动作质量。一秒训练窗口有利于高速击打细节,长时一致性只能靠重叠拼接维持而未定量评估。二十二人的用户研究规模也偏小。 ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 568 words

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

📄 DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation 标签:#音视频生成 #生成模型 #扩散模型 #强化学习 #实时处理 8.0/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.3/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #扩散模型 | #生成模型 #强化学习 | arxiv 👥 作者与机构 第一作者:Yubo Huang(中国科学技术大学);通讯作者:Enhong Chen。 合作者来自中国科学技术大学、南京大学、合肥工业大学和清华大学。 💡 毒舌点评 DynaForcing 把“看起来清晰”与“真的在动”这两个目标拆开,是 talking avatar 领域很实用的诊断。它的三件套并不神秘:给 rollout 一个真实动态锚点、给损失补 motion reward、给参考图加扰动;真正的贡献在于把这三层作用和 collapse 的反馈回路对上。遗憾是训练仍依赖 14B WanS2V 和八张 H100,普通团队复现门槛不低。补充两点边界:评测全部集中在 talking-head avatar 上,其他视频生成任务是否同样受益未知;结果绑定 WanS2V 14B 与特定训练配方,动态奖励权重和 p_data 对说话人风格的敏感性消融也不成体系。加上未公开代码模型,复现门槛实际相当高。 ...

2026-08-19 · 更新于 2026-09-04 · 3 min · 505 words

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

📄 Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer 标签:#语音克隆 #扩散模型 #音视频生成 6.4/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音克隆 | #扩散模型 | #音视频生成 | arxiv 👥 作者与机构 第一作者:Ivan Mikheev(Kandinsky Lab, Moscow, Russia) 通讯作者:Ivan Mikheev(Kandinsky Lab, Moscow, Russia)、Viacheslav Vasilev(Kandinsky Lab, Moscow, Russia) 作者列表:Ivan Mikheev(Kandinsky Lab, Moscow, Russia)、Viacheslav Vasilev(Kandinsky Lab, Moscow, Russia)、Anna Dmitrienko(Kandinsky Lab, Moscow, Russia)、Alexey Letunovskiy(Kandinsky Lab, Moscow, Russia)、Ivan Kirillov(Kandinsky Lab, Moscow, Russia)、Kirill Chernyshev(Kandinsky Lab, Moscow, Russia)、Denis Dimitrov(Kandinsky Lab, Moscow, Russia) 💡 毒舌点评 这项工作用“prepend 参考 latents + 单个零初始化 FiLM 层”这种轻量改造,在 5B T2AV 模型上把说话人相似度做到三个验证网络全榜第一,证明了大模型先验对声音克隆的价值;但论文的 WER/CER 明显高于专用 TTS(如 k6a_5b WER 5.76% vs. Qwen3-TTS 0.6B 的 0.81%),而且没有放出代码、权重或可下载模型,开源与复现贡献几乎为零。 ...

2026-08-18 · 更新于 2026-09-04 · 6 min · 1100 words

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

📄 AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model 标签:#音视频语音合成 #扩散模型 #知识蒸馏 #实时处理 #零样本 6.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频语音合成 | #扩散模型 | #知识蒸馏 #实时处理 | arxiv 👥 作者与机构 第一作者:Kwan Yun(韩国科学技术院文化技术研究生院博士生,共同第一作者) 共同第一作者:Serin Yoon(多伦多大学 DGP 实验室访问研究员,原韩国科学技术院文化技术研究生院硕士,论文标记为共同第一作者) 通讯作者:未说明 作者列表:Kwan Yun(韩国科学技术院文化技术研究生院)、Serin Yoon(多伦多大学 DGP 实验室访问研究员,论文标记共同第一作者)、Sunjin Jung(诚信女子大学计算机工程系助理教授)、Jung Eun Yoo(研发工程师,韩国科学技术院文化技术研究生院 2025 年博士毕业,具体公司未说明)、Inyup Lee(韩国科学技术院文化技术研究生院博士生)、Junyong Noh(韩国科学技术院文化技术研究生院教授) 💡 毒舌点评 这篇文章的切入点聪明:把 2D talking-head 视频扩散模型的运动先验“白嫖”到 3D blendshape 上,并用零音频嵌入做静帧微调,确实绕开了对 3D 动画数据的需求。但评测仍偏软:SyncNet 和用户研究不足以证明几何级口型正确性,蒸馏后的 AnyTalk_RT 在 LSE-D 上从 11.74 退化到 12.19、LSE-C 从 3.24 掉到 2.96,实时版的唇同步损失没有给出令人信服的补偿方案。此外,论文声称代码公开,但正文未给出可验证的仓库链接、模型权重或数据下载,开源可获取性存疑。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 868 words

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

📄 CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects 标签:#音视频语音合成 #扩散模型 #音视频生成 #课程学习 #基准测试 7.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频语音合成 | #扩散模型 | #音视频生成 #课程学习 | arxiv 👥 作者与机构 第一作者:Yusheng Dai(Monash University)与 Kangdi Wang(University of Chinese Academy of Sciences,并列第一) 通讯作者:未说明 作者列表:Yusheng Dai(Monash University)、Kangdi Wang(University of Chinese Academy of Sciences)、Baolong Gao(Tsinghua University)、Yuxuan Jiang(Tsinghua University)、Weiqiang Wang(Monash University)、Qiuhong Ke(Monash University)、Jianfei Cai(Monash University) 💡 毒舌点评 亮点是用 SynchFormer 的 holistic 视觉特征配合 semantic-bundled transcription,在不做脸裁剪、不显式 diarization 的情况下把多说话人 cpWER 从最强基线的 43.47% 压到 13.93%,说服力较强。短板是开源与复现链条几乎断裂:无代码、无权重、无数据集下载细节,且 CineDub-Multi 仅 139 条样本,GRID 上零样本 CineDub* 反而优于非零样本 CineDub,协议一致性需要解释。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 879 words

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

📄 Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion 标签:#空间音频 #扩散模型 #多通道 #鲁棒性 6.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #空间音频 | #扩散模型 | #多通道 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Xiang Zhou(西北工业大学 智能声学与沉浸式通信中心;南洋理工大学 数字信号处理实验室) 通讯作者:Wen Zhang(西北工业大学 智能声学与沉浸式通信中心,wen.zhang@nwpu.edu.cn) 作者列表:Xiang Zhou(西北工业大学 智能声学与沉浸式通信中心;南洋理工大学 数字信号处理实验室)、Zhengqiao Zhao(西北工业大学 智能声学与沉浸式通信中心)、Zhengding Luo(西北工业大学 智能声学与沉浸式通信中心)、Wen Zhang(西北工业大学 智能声学与沉浸式通信中心) 💡 毒舌点评 这篇论文用 GASHP 前端、双分支条件扩散和低阶/高阶空间正则的组合,试图解决稀疏五麦克风阵列下 FOA/SOA 编码的欠定与病态问题。整体思路清楚,物理投影至少避免了直接伪逆放大噪声,消融也基本支持各模块贡献。但硬伤同样直接:没有代码、没有模型权重、数据仅有“on request”的空泛承诺;2.66 秒/4 秒音频的推理速度与实时部署背道而驰;Table 3 中估计 SOA 反投影超过 Ground Truth 的结果,作者解释为二阶截断误差,却没有提供任何控制实验排除模型过拟合到特定阵列响应或参考信号失真。更刺眼的是,相关工作里明确讨论了同为生成式稀疏麦克风 Ambisonic 编码的 Flow-HOA,实验却完全不做对比,这削弱了“相对于最新生成式基线”的说服力。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 928 words

Iterative Self-Learning for Expressive Text-to-Speech Synthesis

📄 Iterative Self-Learning for Expressive Text-to-Speech Synthesis 标签:#语音合成 #自监督学习 #语音情感识别 #扩散模型 #低资源 6.1/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #自监督学习 | #语音情感识别 #扩散模型 | arxiv 👥 作者与机构 第一作者:Nicholas Sanders(机构未说明) 通讯作者:未说明 作者列表:Nicholas Sanders(未说明)、Gustav Eje Henter(未说明)、Simon King(未说明)、Korin Richmond(未说明) 资助信息中提及 University of Edinburgh、Huawei、Wallenberg AI 等,但论文正文未说明作者所属机构。 💡 毒舌点评 本文将 Invert-Classify 嵌入迭代自训练,抓住了生成式 TTS 中标签质量与合成质量可能解耦这一关键点,并用两个任务、多档低资源条件验证了迭代收益。但方法仍只在一个轻量 Matcha-TTS 骨干上验证,缺少与分类器/预训练模型伪标注的公平对比,极端低资源下不稳定,且部分主观测试置信区间宽到接近无差异;距离一套可复现的低资源工程方案还有明显距离。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 915 words

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

📄 SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning 标签:#音视频生成 #流匹配 #扩散模型 #零样本 6.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #流匹配 | #扩散模型 #零样本 | arxiv 👥 作者与机构 第一作者:Tao Feng(实习期间在 Kling Team, Kuaishou Technology 完成本工作) 通讯作者:Xu Li(未说明)、Wei Xue(未说明) 作者列表:Tao Feng、Xu Li、Xiangyang Luo、Ming Wen、Huadai Liu、Chen Zhang、Wei Xue 文中未给出各作者的正式机构归属;仅注明 Tao Feng 的致谢与实习经历。 💡 毒舌点评 作者把"可见人物是否拥有 vocal"从隐式假设提升为显式语义角色,用 source/listener 的共享语音通路统一了说话、聆听、纯跳舞和唱跳四种行为,这是本文最有价值的设计判断。可惜,唱跳主实验的舞蹈端到端基线仅有 MusicInfuser 和 Wan-S2V 两个,后者更偏 speech-driven human animation,并未直面 OmniDance、Wan-Dancer 等更直接的 music-conditioned RGB 舞蹈系统;评测样本量也偏小,SingDance-50 只有 50 个 case,且未报告置信区间或方差。listener 角色方面的证据几乎完全依赖自动唇同步指标的"低值",缺少数目可观的人类评估来确认"嘴不唱但人还自然"。工程化细节和训练数据均未公开,复现基本靠想象。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 1051 words

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

📄 Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis 标签:#音视频生成 #扩散模型 #对比学习 #Adapter #高效推理 6.2/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #对比学习 #Adapter | arxiv 👥 作者与机构 第一作者:Chaolong Yang(论文中标注单位 1、2、3) 通讯作者:Jie Sun(单位 2)、Kaizhu Huang(单位 3) 作者列表:Chaolong Yang(1,2,3)、Yinuo Guo(4)、Kai Yao(5)、Yuyao Yan(2)、Jie Sun(2)、Guangliang Cheng(1)、Shibin Wu(6)、Bin Dong(7)、Kaizhu Huang(3) 机构信息:论文仅以数字上标标注作者单位,未在文本中给出上标对应的机构名称,因此具体大学、实验室或公司均未说明。 💡 毒舌点评 这项工作最有趣的地方是把情绪监督压到 PCA 低方差尾部,确实比一刀切全空间监督更聪明,也换来了接近真实视频的情绪分类准确率。但它只在 MEAD 四个测试说话人上证明自己,LSE-C 和 FID 明显输给部分基线,而且所谓开源还停留在“will be publicly available”;更麻烦的是,低主成分投影到底该作用于干净运动还是预测噪声,论文的公式和动机对不齐,审稿人很难为可复现性和跨域泛化买账。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 869 words