VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

📄 VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics 标签:#音乐生成 #扩散模型 #流匹配 #音频生成 #数据集 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #扩散模型 | #流匹配 #音频生成 | arxiv 👥 作者与机构 论文原文未提供作者列表、第一作者、通讯作者或机构信息。正文脚注仅给出 GitHub 仓库 https://github.com/User-tian/VIOLET,不能据此确认作者身份,因此这里不臆测任何姓名或机构。 💡 毒舌点评 VIOLET 在“可控小提琴合成”这个垂直方向上确实做到了新高度:技巧与连续动态都能显式控制,客观指标明显超过 ViolinDiff,并在多项主观评分中逼近商业虚拟乐器。但训练数据仍以商用 VI 渲染为主,真实录音只作为辅助数据,且评测基准也大量建立在合成数据上;因此论文标题中的“高保真”更准确地说应是“商业 VI 渲染分布内的高保真”,对真实演奏录音的泛化尚未被证明。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 762 words

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

📄 Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing 标签:#语音编辑 #扩散模型 #音频修复 #Transformer #零样本 7.3/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音编辑 | #扩散模型 | #音频修复 #Transformer | arxiv 👥 作者与机构 第一作者:Iftach Shoham(Ben-Gurion University of the Negev)与 Tali Dror(Ben-Gurion University of the Negev),论文标注为共同一作 作者列表:Iftach Shoham、Tali Dror、Oren Gal(University of Haifa)、Haim Permuter(Ben-Gurion University of the Negev)、Gilad Katz(Ben-Gurion University of the Negev)、Eliya Nachmani(Ben-Gurion University of the Negev) 通讯作者:未说明 💡 毒舌点评 把 RVQ 码本的粗到细层级显式编码进离散扩散的条件因子化,是比直接 flatten 所有码本更贴合语音 codec 结构的建模选择;代码仓库也给了。但语音编辑任务上相对 VoiceCraft 的 WER 只从 0.124 降到 0.121,差距几乎落在标准差范围内;实验只用了 RealEdit 一个基准,没有对比任何扩散/流匹配类非自回归方法,也没有人工听感评测。修复任务在短 gap 上的 MCD 优势很突出,但整体说服力仍配不上方法设计的优雅度。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 842 words

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

📄 Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model 标签:#音乐生成 #扩散模型 #自回归模型 #数据集 #音频理解 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #扩散模型 | #自回归模型 #数据集 | arxiv 👥 作者与机构 第一作者:Zhiwei Lin(未说明) 通讯作者:未说明 作者列表:Zhiwei Lin(未说明)、Jun Chen(未说明)、Boshi Tang(未说明)、Weihao Wu(未说明)、Jing Yang(未说明)、Yaolong Ju(未说明)、Fan Fan(未说明)、Zhiyong Wu(未说明) 备注:论文正文仅标出作者上标编号 1、2、3,未给出机构名称。 💡 毒舌点评 把 LDM 与自回归潜在上下文拼接结合来解决长程符号音乐生成,思路自然,且客观指标确实优于已有基线;但代码和模型权重均未公开,上下文模块没有做有/无的独立消融,长时长实验只验证到 32 小节,论文却宣称能生成“数分钟”一致音乐。这些 claim 目前主要靠 demo 和少量表格背书,审稿人无法直接复现验证。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 667 words

Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

📄 Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects 标签:#音频生成 #扩散模型 #可解释性 #模型评估 #工业应用 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #扩散模型 | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Yisu Zong(机构未说明) 通讯作者:未说明 作者列表:Yisu Zong(机构未说明)、Jinjie Shi(机构未说明)、Joshua Reiss(机构未说明) 💡 毒舌点评 将参考条件扩散模型与可微调音台结合,在保持可解释性的同时实现参考风格控制,且主观听感上 Diff2Mix-P 能达到人类混音水平,这是最清晰的亮点。但客观 KAD 在多数嵌入上仍落后于 MEGAMI,论文既没有给出 CFG 权重、掩码比例和效果链顺序的消融,也未深入解释主观与客观结果倒挂的原因;摇滚参考的全体失败进一步说明单一全局风格嵌入对轨道间交互建模不足。 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 590 words

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

📄 Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming 标签:#音视频生成 #后训练 #扩散模型 #流式处理 #音频理解 7.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #后训练 | #扩散模型 #流式处理 | arxiv 👥 作者与机构 共同第一作者:Menglin Han(Vorch Team;同济大学)、Yang Ding(Vorch Team),均标注 * 通讯作者:Zhangkai Ni(同济大学)、Lin Ma(机构未说明)、Yaohui Wang(Vorch Team),均标注 † 作者列表:Menglin Han(Vorch Team;同济大学)、Yang Ding(Vorch Team)、Yulei Lu(Vorch Team)、Haoran Yu(Vorch Team;哈尔滨工业大学(深圳))、Xin Ma(Vorch Team)、Junyi Chen(Vorch Team;上海交通大学)、Zhangkai Ni(同济大学)、Lin Ma(机构未说明)、Yaohui Wang(Vorch Team) 💡 毒舌点评 亮点是把双向 LTX2.3 的短片段生成能力拆成“因果块 + 稳定前缀窗口 + 显式 LLM 语音规划”,在两分钟 T2AV 上做到 27.12 FPS 并维持较低 WER,工程完成度很高。短板是训练语料和分布蒸馏教师都来自同一双向 LTX2.3,存在明显自举闭环;对比的流式基线只能跑到 30 秒,且论文没有提供代码、权重或数据,验证可信度被削弱 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 538 words

Masked diffusion enables coherent beat tracking

📄 Masked diffusion enables coherent beat tracking 标签:#音乐理解 #扩散模型 #模型集成 #多任务学习 #音频理解 6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #扩散模型 | #模型集成 #多任务学习 | arxiv 👥 作者与机构 第一作者:Francesco Foscarin(未说明机构) 通讯作者:未说明 作者列表:Francesco Foscarin(未说明机构)、Filip Korzeniowski(未说明机构)、Richard Vogl(未说明机构) 💡 毒舌点评 把 masked diffusion 从语言/图像生成迁移到节拍追踪,并用“双通道独立掩码+平衡反掩码+步间峰值拾取”解决事件稀疏、类不平衡与相邻伪峰问题,方向很漂亮,GTZAN 上无 DBN 条件下全面超过 Beat This 和 Gagneré ST-BCE,也让“连贯性”从口号变成了可测结果。但公开评测几乎只有 GTZAN 一个数据集,且三个关键设计没有做独立的组件级消融;与 SOTA 的对比数值又取自原论文而非统一重测,结论的普适性和归因强度仍显不足。 ...

2026-08-06 · 更新于 2026-08-14 · 4 min · 640 words

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

📄 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation 标签:#音视频生成 #扩散模型 #音频生成 #课程学习 #音频理解 6.8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #音频生成 #课程学习 | arxiv 👥 作者与机构 共同第一作者:Zehua Chen(论文脚注标注 “Equal contribution”,邮箱 zhc23thuml@tsinghua.edu.cn;正文未列出机构) 共同第一作者:Junyou Wang(脚注标注 “Equal contribution”,邮箱 ackokomi0222@gmail.com) 通讯作者:Jun Zhu(论文脚注标注 “Corresponding author” 及邮箱 dcszj@tsinghua.edu.cn,按作者列表位置推断) 其他作者:Yuxuan Jiang、Zhenying Fang、Yusheng Dai、Jianfei Chen、Ziwei Liu(文献信息均未披露所属机构) 说明:论文正文与附录均未给出明确机构列表;邮箱域名仅作为线索,不作为机构确认依据。作者姓名后的数字 1/2/3/4 可能标注不同的单位,但对应单位列表未在论文中披露。 💡 毒舌点评 这篇论文想要解决的问题是真实的,视频生成音频确实绕不开时间同步;它的方案也很"简洁"——把相邻帧做差送给 CLIP 再拼回去。问题是,整篇论文的卖点几乎全部压在"时间差异(TD)“这一个概念上,而"把两帧相减"这样一个操作能否撑起一整篇顶会论文,值得打一个大大的问号。审稿人看完全文最想追问的一个问题或许是:FTD 本质上是否只是在用相邻帧的高频残差作为一种隐式的运动正则?如果是这样,TD 的"表示学习"含量并没有标题暗示的那么高。更让人遗憾的是,论文已经用了 massive 的预训练资源——AudioSet(5800 小时)、FreeSound(6246 小时)、MSD(7333 小时)、VGGSound(550 小时),最后却只在 VGGSound 一个测试集上做客观评测,主观评测更是只抽了 20 个样本、15 个被试,统计功效极其有限。与 Diff-Foley 相比,你的 AA 指标并没有全面超越,论文自己在正文里也承认只是"comparable”。此外,ATDG 引导需要在线执行三次 DiT 前向(无条件、帧条件、帧+TD 条件),虽然在 NFE 口径下与 CFG 对齐,但实际内存和延迟开销并未讨论。最后,最致命的是,代码、模型权重、数据集全部没有开源,唯一的结果来源是"自我报告"。对于一篇声称"surpassing dedicated V2A representations like CAVP"的论文来说,这样的可复现性现状是完全不合格的。结论:适合作为一项技术报告被公开,但作为顶会论文,其核心贡献的深度、评测的广度与开源诚意都有明显短板。 ...

2026-08-06 · 更新于 2026-08-14 · 6 min · 1069 words

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

📄 AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities 标签:#音频生成 #扩散模型 #音频理解 #Transformer #模型评估 6.9/10 | 创新 0.8/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.9/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #音频生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Sandy Abdo(Ontario Tech University, Oshawa, ON, Canada) 通讯作者:未说明 作者列表:Sandy Abdo(Ontario Tech University)、Bill Kapralos(Ontario Tech University)、Priyamvada Tripathi(Durham College)、KC Collins(Carleton University)、Adam Dubrowski(Ontario Tech University) 💡 毒舌点评 这篇综述按照PRISMA流程筛选了30篇论文,并按输入模态进行了分类,提出的模型总结表和指标汇总表对快速入门确有帮助。然而,全文本质上是30篇文献摘要的串联,严重缺乏批判性综合与深度对比,未能提供超越单篇论文的洞察。对于顶会审稿人而言,这种“叙事性”综述的贡献深度远远不够,更像一份文献调研课的优秀期末作业,而非推动领域认知的综合性研究。 ...

2026-08-05 · 更新于 2026-08-14 · 3 min · 624 words

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

📄 DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning 标签:#音频生成 #扩散模型 #强化学习 #音频理解 #Transformer 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #扩散模型 | #强化学习 #音频理解 | arxiv 👥 作者与机构 第一作者:Tristan Wu(未说明) 通讯作者:未说明 作者列表:Tristan Wu(未说明)、Daniel Chin(未说明)、Junan Zhang(未说明)、Junyan Jiang(未说明)、Yansen Jing(未说明)、Gus Xia(未说明) 💡 毒舌点评 亮点是将离散扩散与GRPO强化学习结合,构建了一个从监督预训练到音频域奖励微调的两阶段pipeline,这个组合在合成器反演任务上思路清晰;OOD实验结果也支撑了方法的有效性。短板是技术贡献偏向组合已有方法,缺乏足够的理论深度;且实验规模局限于Dexed单一合成器,对现代复杂合成器的泛化性存疑,同时GRPO微调后in-domain性能崩溃但未给出足够解释。 ...

2026-08-05 · 更新于 2026-08-14 · 3 min · 588 words

AcoustiTrace: When Plausible Sound Violates Physics

📄 AcoustiTrace: When Plausible Sound Violates Physics 标签:#音视频生成 #多模态模型 #音视频理解 #基准测试 #扩散模型 6.9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #多模态模型 | #音视频理解 #基准测试 | arxiv 👥 作者与机构 第一作者:Shiyang Li (中科院的机构1和2) 通讯作者:Changqing Zou (中科院的机构1和6) 作者列表:Shiyang Li (机构1,2), Yuewen Cao (机构2), Yihao Liu (机构2), Yuandong Pu (机构3), Baochang Zhang (机构4), Xiaofei Li (机构5), Changqing Zou (机构1,6) 机构说明:论文未明确给出机构全称,仅以数字标记了6个不同机构。 💡 毒舌点评 AcoustiTrace以其声学物理过程的三阶段八维度拆解,为现有音视频生成评估中“听着真但物理假”的棘手问题,提供了一套迄今最具结构感的诊断工具箱。它细致、体面、有洞见。然而,当这个基准的全部数据、验证过的评估器以及精心设计的提示套件都被作者们揣在兜里,拒绝开源时,它就从社区的公共基础设施退化成了一场自娱自乐的内部演习。再精巧的“手术刀”,若只允许少数人使用,其价值也大打折扣。 ...

2026-08-04 · 更新于 2026-08-14 · 3 min · 434 words