MMAG: A Multi-Control Mixed Audio Generation Benchmark

📄 MMAG: A Multi-Control Mixed Audio Generation Benchmark 标签:#音频生成 #大语言模型 #基准测试 #数据集 #模型评估 6.8/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音频生成 | #大语言模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Zihao Zheng(上海交通大学 MoE 人工智能重点实验室 / X-LANCE 实验室;上海人工智能实验室) 通讯作者:Mengyue Wu(上海交通大学 MoE 人工智能重点实验室 / X-LANCE 实验室) 其他作者:Xuenan Xu(上海人工智能实验室)、Jiahao Mei(上海交通大学 X-LANCE 实验室)、Yixuan Li(上海交通大学 X-LANCE 实验室;上海人工智能实验室)、Minghao Lv(上海交通大学 X-LANCE 实验室)、Wen Wu(上海人工智能实验室)、Chao Zhang(上海人工智能实验室) 💡 毒舌点评 MMAG 踩中了“混合音频生成缺少统一多控制评测基准”这个真实空缺,3,974 条主集、691 条 voice cloning 子集、约 1,828 条 timestamp 子集以及声学/语音/语义/时间四维评测协议都有实际参考价值。但作为 benchmark 论文,正文始终没有给出数据集或评测脚本的明确下载路径,只有项目主页;标注质量仅用“约 90% 抽查通过率”概括,未提供标注者间一致性或错误类型分布。更关键的是,所有模型在 timestamp 控制上都接近“弱可控”,AuDirector 最高也只有 SpeechF1=0.72、SoundF1=0.57。因此 MMAG 目前更像一个诊断工具,而不是一个能直接下载复现的公共评测资产。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 743 words

Objects as Audio-Visual Modal Sound Fields

📄 Objects as Audio-Visual Modal Sound Fields 标签:#音频生成 #多模态模型 #自监督学习 7.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #多模态模型 | #自监督学习 | arxiv 👥 作者与机构 共同一作:Zisen Shao(马里兰大学)、Zihao Wei(马里兰大学),论文脚注标注 “Equal contribution” 作者列表:Zisen Shao、Zihao Wei、Derong Jin、Ruohan Gao(马里兰大学,College Park) 通讯作者:未标注 💡 毒舌点评 把视觉语义先验注入模态声场重建,方向聪明,实验也比一般短文扎实:两个真实数据集、四组消融、非对称子集案例、甚至补了 N-shot 和输入视图数扫描。但审稿人不能忽略两个硬伤:第一,在 ObjectFolder Real 完整数据集上,KNN 的 L1 Log(0.930)实际上好于本方法(0.951),“显著优于强基线"这个结论只在部分指标上成立;第二,论文明确写"对每个物体运行 single-damping 和 spatial-damping 两个变体,根据 ENV 指标选最好的模型”——这是在测试集上做模型选择,所报数字存在系统性高估。代码仓库藏在项目主页里,正文连链接都不给,开源姿态不够大方。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 729 words

Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

📄 Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects 标签:#音频生成 #扩散模型 #可解释性 #模型评估 #工业应用 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #扩散模型 | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Yisu Zong(机构未说明) 通讯作者:未说明 作者列表:Yisu Zong(机构未说明)、Jinjie Shi(机构未说明)、Joshua Reiss(机构未说明) 💡 毒舌点评 将参考条件扩散模型与可微调音台结合,在保持可解释性的同时实现参考风格控制,且主观听感上 Diff2Mix-P 能达到人类混音水平,这是最清晰的亮点。但客观 KAD 在多数嵌入上仍落后于 MEGAMI,论文既没有给出 CFG 权重、掩码比例和效果链顺序的消融,也未深入解释主观与客观结果倒挂的原因;摇滚参考的全体失败进一步说明单一全局风格嵌入对轨道间交互建模不足。 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 590 words

EG-VAE: A Unified Framework for Electric Guitar Tone Transfer and Removal

📄 EG-VAE: A Unified Framework for Electric Guitar Tone Transfer and Removal 标签:#音频生成 #变分自编码器 #多任务学习 #音频理解 #Transformer 7.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #变分自编码器 | #多任务学习 #音频理解 | arxiv 👥 作者与机构 第一作者:Yen-Tung Yeh(National Taiwan University) 通讯作者:未说明 作者列表:Yen-Tung Yeh(National Taiwan University)、Yun-Ning (Amy) Hung(Moises)、Yi-Hsuan Yang(National Taiwan University) 💡 毒舌点评 用“掩码前向”统一训练解耦与推理移除的切入点很巧,且 seen/unseen 双设置、主观+客观+消融全套证据使得“统一优于分离”的结论基本站得住。但全文只给 demo 页、不给代码/权重/数据,且“unseen”仅来自同一厂商 Neural DSP 的另一套插件,实际泛化边界被明显高估。对最相关的 ST-ITO 只字未做实验对比,是审稿意见里躲不开的一刀。 ...

2026-08-07 · 更新于 2026-08-14 · 5 min · 920 words

AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

📄 AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation 标签:#音频生成 #多模态模型 #大语言模型 #音频理解 #Transformer 6.8/10 | 创新 1.5/2 | 严谨 0.8/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音频生成 | #多模态模型 | #大语言模型 #音频理解 | arxiv 👥 作者与机构 作者列表(按原文署名顺序):Jinting Wang、Yuguang Yang、Shengyu Li、Yan Rong、Shan Yang、Xiaoda Yang、Li Liu。 第一作者:Jinting Wang(机构编号 1,机构名称原文未给出)。 通讯作者:原文未标注。 机构编号:1、2、3 对应不同单位,但具体机构名称在可见原文中未说明。 💡 毒舌点评 该工作把“结构化声景表示 + 复杂度感知分层 + rubric 细粒度验证”组合成一个可操作的 TTA 评测协议,方向正确且工程化程度较好,弥补了纯 CLAP 相似度无法定位语义失败的缺陷。但当前作为 benchmark 论文却通篇不提自有代码、数据集、评测脚本或发布计划,核心产物完全不可获取。更严重的是,语音内容指标 SCCA@0.60 只做顺序无关的词/字覆盖率剪枝匹配,不惩罚语序错误和额外转录内容,且多数通用模型在此维度得分为零,区分度和解释力都有限。 ...

2026-08-06 · 更新于 2026-08-14 · 3 min · 450 words

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

📄 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation 标签:#音视频生成 #扩散模型 #音频生成 #课程学习 #音频理解 6.8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #音频生成 #课程学习 | arxiv 👥 作者与机构 共同第一作者:Zehua Chen(论文脚注标注 “Equal contribution”,邮箱 zhc23thuml@tsinghua.edu.cn;正文未列出机构) 共同第一作者:Junyou Wang(脚注标注 “Equal contribution”,邮箱 ackokomi0222@gmail.com) 通讯作者:Jun Zhu(论文脚注标注 “Corresponding author” 及邮箱 dcszj@tsinghua.edu.cn,按作者列表位置推断) 其他作者:Yuxuan Jiang、Zhenying Fang、Yusheng Dai、Jianfei Chen、Ziwei Liu(文献信息均未披露所属机构) 说明:论文正文与附录均未给出明确机构列表;邮箱域名仅作为线索,不作为机构确认依据。作者姓名后的数字 1/2/3/4 可能标注不同的单位,但对应单位列表未在论文中披露。 💡 毒舌点评 这篇论文想要解决的问题是真实的,视频生成音频确实绕不开时间同步;它的方案也很"简洁"——把相邻帧做差送给 CLIP 再拼回去。问题是,整篇论文的卖点几乎全部压在"时间差异(TD)“这一个概念上,而"把两帧相减"这样一个操作能否撑起一整篇顶会论文,值得打一个大大的问号。审稿人看完全文最想追问的一个问题或许是:FTD 本质上是否只是在用相邻帧的高频残差作为一种隐式的运动正则?如果是这样,TD 的"表示学习"含量并没有标题暗示的那么高。更让人遗憾的是,论文已经用了 massive 的预训练资源——AudioSet(5800 小时)、FreeSound(6246 小时)、MSD(7333 小时)、VGGSound(550 小时),最后却只在 VGGSound 一个测试集上做客观评测,主观评测更是只抽了 20 个样本、15 个被试,统计功效极其有限。与 Diff-Foley 相比,你的 AA 指标并没有全面超越,论文自己在正文里也承认只是"comparable”。此外,ATDG 引导需要在线执行三次 DiT 前向(无条件、帧条件、帧+TD 条件),虽然在 NFE 口径下与 CFG 对齐,但实际内存和延迟开销并未讨论。最后,最致命的是,代码、模型权重、数据集全部没有开源,唯一的结果来源是"自我报告"。对于一篇声称"surpassing dedicated V2A representations like CAVP"的论文来说,这样的可复现性现状是完全不合格的。结论:适合作为一项技术报告被公开,但作为顶会论文,其核心贡献的深度、评测的广度与开源诚意都有明显短板。 ...

2026-08-06 · 更新于 2026-08-14 · 6 min · 1069 words

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

📄 AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities 标签:#音频生成 #扩散模型 #音频理解 #Transformer #模型评估 6.9/10 | 创新 0.8/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.9/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #音频生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Sandy Abdo(Ontario Tech University, Oshawa, ON, Canada) 通讯作者:未说明 作者列表:Sandy Abdo(Ontario Tech University)、Bill Kapralos(Ontario Tech University)、Priyamvada Tripathi(Durham College)、KC Collins(Carleton University)、Adam Dubrowski(Ontario Tech University) 💡 毒舌点评 这篇综述按照PRISMA流程筛选了30篇论文,并按输入模态进行了分类,提出的模型总结表和指标汇总表对快速入门确有帮助。然而,全文本质上是30篇文献摘要的串联,严重缺乏批判性综合与深度对比,未能提供超越单篇论文的洞察。对于顶会审稿人而言,这种“叙事性”综述的贡献深度远远不够,更像一份文献调研课的优秀期末作业,而非推动领域认知的综合性研究。 ...

2026-08-05 · 更新于 2026-08-14 · 3 min · 624 words

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

📄 DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning 标签:#音频生成 #扩散模型 #强化学习 #音频理解 #Transformer 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #扩散模型 | #强化学习 #音频理解 | arxiv 👥 作者与机构 第一作者:Tristan Wu(未说明) 通讯作者:未说明 作者列表:Tristan Wu(未说明)、Daniel Chin(未说明)、Junan Zhang(未说明)、Junyan Jiang(未说明)、Yansen Jing(未说明)、Gus Xia(未说明) 💡 毒舌点评 亮点是将离散扩散与GRPO强化学习结合,构建了一个从监督预训练到音频域奖励微调的两阶段pipeline,这个组合在合成器反演任务上思路清晰;OOD实验结果也支撑了方法的有效性。短板是技术贡献偏向组合已有方法,缺乏足够的理论深度;且实验规模局限于Dexed单一合成器,对现代复杂合成器的泛化性存疑,同时GRPO微调后in-domain性能崩溃但未给出足够解释。 ...

2026-08-05 · 更新于 2026-08-14 · 3 min · 588 words

MEMS Microphones as Ultrasonic Transducers: Nonlinear Electrostatic Actuation and a Parametric Array Prototype

📄 MEMS Microphones as Ultrasonic Transducers: Nonlinear Electrostatic Actuation and a Parametric Array Prototype 标签:#音频生成 #音频理解 #Transformer #模型评估 5.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 📝 5.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音频生成 | #Transformer | #音频理解 #模型评估 | arxiv 👥 作者与机构 第一作者:Xiaoyu Niu (The University of Texas at Austin, Department of Electrical and Computer Engineering) 通讯作者:Neal A. Hall (The University of Texas at Austin, Department of Electrical and Computer Engineering) 作者列表:Xiaoyu Niu, Zihuan Liu, Ehsan Vatankhah, Yuqi Meng, Neal A. Hall(均为同一机构) 💡 毒舌点评 这篇工作把商用 MEMS 麦克风当作超声波发射器来玩 pull-in,思路接地气且实验观测完整,证明了廉价芯片就能产生可观的超声位移。但参量阵原型只有 28 个单元、差频 SPL 仅约 35 dB,离实用差了两个数量级的声压,既没有与现有 MEMS 参量阵系统直接对比,也没有独立标定接收非线性带来的 10 dB 修正,使“首个表征”的说服力打了折扣。 ...

2026-08-05 · 更新于 2026-08-14 · 4 min · 850 words

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

📄 Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds 标签:#音频生成 #多模态模型 #空间音频 #零样本 #音频理解 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #多模态模型 | #空间音频 #零样本 | arxiv 👥 作者与机构 第一作者:Masaki Yoshida(北海道大学) 通讯作者:未说明 作者列表:Masaki Yoshida(北海道大学)、Ren Togo(北海道大学)、Takahiro Ogawa(北海道大学)、Miki Haseyama(北海道大学) 💡 毒舌点评 论文定义了一个新颖且实用的任务——为预训练的3DGS世界自动生成空间一致的音景,并用一套巧妙的“无训练”流水线解决了跨视角实例关联这一核心难题,Gaussian Set Matching的设计具有洞察力。然而,整篇工作在本质上仍是对多个成熟基础模型(VLM、SAM、T2A)的工程组合,缺乏对生成声音本身与视觉场景之间细粒度语义对齐的深度建模,且提出的评价指标在真值依赖和语义绑定上存在明显空白,难以支撑“高质量音景生成”这一更高级别声明。 ...

2026-08-04 · 更新于 2026-08-14 · 4 min · 695 words