VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

📄 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 标签:#音频生成 #流匹配 #自回归模型 #强化学习 #数据集 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #流匹配 | #自回归模型 #强化学习 | arxiv 👥 作者与机构 第一作者:Wenxiang Guo(浙江大学) 通讯作者:Zhou Zhao(浙江大学) 作者列表:Wenxiang Guo(浙江大学)、Changhao Pan(浙江大学)、Ziyue Jiang(浙江大学)、Fei Wu(浙江大学)、Zhou Zhao(浙江大学) 💡 毒舌点评 VoxAudio 用“随机 chunk 边界 + 异步流匹配 + 多奖励 NFT”这一套组合拳,确实把 vocalized audio synthesis 从一个被 T2A/TTS 各管一段的尴尬地带推进到了可流式、可控时序的 unified 方案,尤其在 WER 和区间定位上提升明显。然而,这篇工作更像是一次高质量的工程集成而非方法级突破:VoxCorpus 的模拟+清洗管线和 RL 奖励设计虽然完整,但很多结论依赖单 baselines 和外部模型评估,跨域泛化性与真实噪声鲁棒性仍欠说服力。更令人担心的是,该方法在 MECAT 上的分布指标大幅落后于 Dasheng-AudioGen,作者却以“领域差异”轻轻带过,审稿人不应放过这一点。 ...

2026-08-14 · 更新于 2026-08-14 · 5 min · 1025 words

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

📄 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 标签:#音频生成 #大语言模型 #模型评估 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.0/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #大语言模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Xingwei Sun(MiLM Plus, Xiaomi Inc., Beijing, China) 通讯作者:未说明 作者列表: Xingwei Sun(MiLM Plus, Xiaomi Inc., Beijing, China) Heinrich Dinkel(MiLM Plus, Xiaomi Inc., Beijing, China) Gang Li(MiLM Plus, Xiaomi Inc., Beijing, China) Jiahao Mei(MiLM Plus, Xiaomi Inc., Beijing, China;X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China) Yadong Niu(MiLM Plus, Xiaomi Inc., Beijing, China) Zerui Han(MiLM Plus, Xiaomi Inc., Beijing, China) Yuepeng Jiang(MiLM Plus, Xiaomi Inc., Beijing, China) Jiahao Zhou(MiLM Plus, Xiaomi Inc., Beijing, China) Lichun Fan(MiLM Plus, Xiaomi Inc., Beijing, China) Jian Luan(MiLM Plus, Xiaomi Inc., Beijing, China) 💡 毒舌点评 本文最亮眼的是把统一场景模型里的语音可懂度从不可用拉到接近专用 TTS 的水平,并且公开了代码与权重,对实际使用者有直接价值。但"统一"的代价也很清晰:语音强项很大程度上是以牺牲音频保真度为代价换来的。在 AudioCaps 的 FAD、FD、KL 三项指标上,本文不仅落后专用 TangoFlux,也落后非自回归的 Dasheng AudioGen;MECAT 含语音混合类别的 FD/KL 同样多处落后。论文自称为"first end-to-end trained model for general text-to-audio generation",这个 claim 有架构层面的合理性,但距离一个真正的全域统一 SOTA 还有明显距离。 ...

2026-08-13 · 更新于 2026-08-14 · 6 min · 1244 words

Monophonic Audio Synthesizer Using FPGAs

📄 Monophonic Audio Synthesizer Using FPGAs 标签:#音频生成 #端到端 #实时处理 4.2/10 | 创新 0.8/2 | 严谨 0.5/1.5 | 实验 0.4/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 4.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频生成 | #端到端 | #实时处理 | arxiv 👥 作者与机构 第一作者:Michael Smith(Department of Electrical and Computer Engineering, University of Colorado Colorado Springs) 作者列表:Michael Smith、D.G. Perera,均署名 University of Colorado Colorado Springs 通讯作者:未说明 💡 毒舌点评 这篇报告最值得肯定的是它把失败的细节交代得比较清楚:UART 通信为何没调通、ADSR 和两个低通滤波器为何被移除、SMA 电压域问题如何影响输出,都有具体排查过程。但作为一篇 16 页的论文,最终真正能跑通的系统只是一个按键触发、音高固定为 A440、无包络、无滤波的方波输出;MIDI 控制链路从未工作,也没有任何量化指标支撑“合成器”这一核心声明。更糟的是,参考文献中混入大量与本文无直接关系的课题组自引,进一步削弱了报告的可信度。整体更像一份高年级 FPGA 课程项目报告,而不是 NeurIPS/ICML/ICLR 级别的可验证研究贡献。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 725 words

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

📄 A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies 标签:#音频生成 #生成模型 #自回归模型 #扩散模型 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.1/0.5 | 工程 0.6/1.5 ✅ 6.5/10 | 前50% | 文档类型:理论研究 | 评分置信度:中 | #音频生成 | #生成模型 | #自回归模型 #扩散模型 | arxiv 👥 作者与机构 第一作者:Dongchao Yang(The Chinese University of Hong Kong,dcyang@se.cuhk.edu.hk) 通讯作者:论文未明确标注通讯作者;由于论文仅有一名作者,该唯一作者承担通讯角色。 作者列表:Dongchao Yang(The Chinese University of Hong Kong) 💡 毒舌点评 这篇立场论文最聪明的地方是拆掉“离散 vs 连续”这堵假墙:它指出真正决定架构选择的是依赖时域与条件歧义,而不是输出接口的类别;RVQ“残差有序但语义无序”的澄清,也比常见综述里“低层语义、高层声学”的说法准确得多。然而,这个“统一视角”的骨架几乎全是信息论恒等式——恒等式没有错,但它们本身不产生预测。全文没有给出任何一个可证伪的量化声明:依赖时域怎么测、条件歧义怎么算、式 (2) 的经验可建模性剖面具体长什么样,统统没有。概念框架像一张精美的地图,但没有标出任何一条实际走过的路。作为观点文章,清晰度够格;作为可检验的“框架”,验证基本缺位。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 459 words

Beyond Reconstruction: Full-Context Generative DiT for Music Generation

📄 Beyond Reconstruction: Full-Context Generative DiT for Music Generation 标签:#音乐生成 #流匹配 #音频生成 #生成模型 7.5/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.5/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #流匹配 | #音频生成 #生成模型 | arxiv 👥 作者与机构 第一作者:Yunjia Li(核心作者,未提供机构信息) 其他核心作者:Menglin Wu、Junyu Dai、Xinyue Fan、Xiangang Li、Haoxu Wang、Jianwei Yu、Huaicheng Zhang、Han Zhao 贡献者:Weiqin Li、Yufei Shi、Cheng Wen、Sitong Zhao、Qixi Zheng、Haina Zhu、Wei Li 通讯作者:未说明 机构信息:原文未给出任何作者的机构归属 💡 毒舌点评 亮点:FullDiT 将声学渲染器从“重建干净 codec token”的被动解码器,重定义为“从不完美离散计划进行全上下文生成”的主动条件流模型;EMDC 按码本预测难度匹配替换率,并用余弦 KNN 近错 token 模拟语言模型真实误差形态;4-CFG 将文本与离散计划的引导增量分开控制。问题定义、训练干预、架构调整和推理控制形成了较完整的工程闭环。 短板:8B 完整系统与 1.5B 受控消融之间存在规模鸿沟,EMDC 在最终系统上的独立贡献无法直接验证;自动指标虽在 18 项中赢下 15 项,但若干优势幅度很小,且外部盲听 Elo 点估计仅列第三;无代码、权重、数据开源,削弱了该工作的可参考与可复现价值。 📌 核心摘要 本文聚焦混合式音乐生成系统中“声学渲染器训练时使用干净 codec token、部署时面对语言模型不完美预测”的 codec-interface exposure bias 问题。 核心方法为 FullDiT,一个以非因果完全上下文条件 DiT 为骨架的流匹配渲染器,输入 8 路帧对齐 RVQ token、独立编码的歌词与全局 caption,在完整歌曲长度的连续 VAE latent 上执行生成式声学渲染。 新意在于:将渲染任务从“重建”重定义为“从不完美离散计划进行全上下文生成”;提出 EMDC,按各码本教师强制 top-1 错误率进行随机替换,并从余弦 KNN 近邻中采样语义近错 token,同时保持声学目标不变;推理时提出 4-CFG,独立调节 codec、lyrics、caption 三个引导增量。 主要结果:在合成损坏条件下,EMDC 使 ViSQOL 从 2.4342 提升到 3.2036;在固定语言模型 token 的盲听非平局对比中,M1 对 M3 胜率 69.7%;完整系统在 18 项自动指标中 15 项超过五个商业系统,并在 Artificial Analysis Music with Vocals Leaderboard 快照中获得 1129 Elo,点估计排名第三。 实际意义:针对混合式音乐生成管线的接口失配,提供了一套从训练扰动、全上下文声学建模到推理引导的工程化解决方案,对数分钟级带词歌曲的渲染有较强参考价值。 主要局限:受控消融均在 1.5B 规模完成,8B 系统只有端到端评测;自动指标优势普遍偏小,外部盲听排名非第一;未提供可复现代码、模型权重或数据集。 🔗 开源详情 未披露。机器摘要资源状态为 has_code=未说明、has_model=未说明、has_dataset=未说明。论文仅提供 demo 页面链接(https://selinacloudl.github.io/fulldit-demo/),未提供代码仓库、模型权重、数据集或预训练检查点;未提及任何开源许可证或计划。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 1032 words

Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books

📄 Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books 标签:#音频生成 #大语言模型 #音频交互 #零样本 #游戏音频 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音频生成 | #大语言模型 | #音频交互 #零样本 | arxiv 👥 作者与机构 第一作者:Karim Benharrak(University of California, Berkeley) 通讯作者:未说明 作者列表:Karim Benharrak(University of California, Berkeley)、Oriol Nieto(Adobe Research, San Francisco)、Bryan Wang(Adobe Research, Seattle)、Zeyu Jin(Adobe Research, San Francisco)、Amy Pavel(University of California, Berkeley) 💡 毒舌点评 把面向对象编程搬到音频剧剪辑台上是一次聪明的抽象跃迁,9.7×编辑放大和约4倍时间缩减足以让DAW厂商坐不住;但整套系统建立在ElevenLabs、Gemini 3 Pro以及其他闭源生成模型之上,对象级传播完全交给LLM却不给出任何可靠性度量,N=8固定顺序的受试设计又让"显著降低任务负荷"的因果故事无法完全闭合。审稿人在点头之余,始终悬着一个无法验证的问号。 ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 294 words

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

📄 MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection 标签:#音视频理解 #多模态模型 #基准测试 #语音合成 #音频生成 6.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.5/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频理解 | #多模态模型 | #基准测试 #语音合成 | arxiv 👥 作者与机构 作者列表:Yanqiu Li、Yang Xiao、Jisheng Bai、Bin Chen、Hong Jia、Ting Dang。 机构编号为 1、2、3;具体机构名称在提供的论文原文片段中未披露。 通信作者信息未披露。 💡 毒舌点评 论文把“环境音频”从被长期忽视的背景音升级成了独立伪造组件,但复现所需的代码、数据和模型权重却被藏成了未披露的第三个组件。行文与表格中存在大量排版损坏字符,读起来像从 PDF 里抢救出来的半成品;实验设计值得肯定,工程开源程度却让“rigorous foundation”显得有点嘴硬。 ...

2026-08-11 · 更新于 2026-08-14 · 3 min · 561 words

RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

📄 RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction 标签:#音频生成 #扩散模型 #音乐生成 #多模态模型 #对比学习 6.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #扩散模型 | #音乐生成 #多模态模型 | arxiv 👥 作者与机构 第一作者:Ambuj Mehrish(CVML Lab, Ca’ Foscari University of Venice) 通讯作者:未说明 作者列表:Ambuj Mehrish(CVML Lab, Ca’ Foscari University of Venice)、Sebastiano Vascon(CVML Lab, Ca’ Foscari University of Venice) 💡 毒舌点评 把 SDEdit / rectified-flow 中间初始化搬到脑到音频生成,用检索 exemplar 锚定采样轨迹而不是把它当条件或直接输出,确实是处理 prior domination 的务实思路;用 MusicGen 做负对照把“轨迹初始化”从“检索本身”中分离出来,也比一般脑解码文章的实验设计更用心。但全篇只在 Brain2Music 一个数据集、5 个受试者、300 个 pooled 样本上验证,代码链接还是 TBA;FAD 从 13.49 降到 1.25 主要是靠贴近检索真音频,而不是生成器本身的音频质量变强,所以作者没有 claim 超过 retrieval-only 是对的——RAG 相对纯检索的增量其实只有 novelty 从 0.06 提到 0.18,FAD 反而从 0.89 涨到 1.25,这个 trade-off 值不值取决于具体应用。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 1065 words

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

📄 SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation 标签:#音频生成 #流匹配 #语音合成 #音乐生成 #统一音频模型 7.6/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.6/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频生成 | #流匹配 | #语音合成 #音乐生成 | arxiv 👥 作者与机构 第一作者:Yunrui Cai(香港中文大学;实习于快手 Kling Team) 通讯作者:Xu Li(快手 Kling Team)、Helen Meng(香港中文大学) 作者列表: Yunrui Cai(香港中文大学;快手 Kling Team) Xu Li(快手 Kling Team) Yucheng Zhou(快手 Kling Team) Jinchao Li(快手 Kling Team) Dingdong Wang(香港中文大学) Dongchao Yang(香港中文大学) Xixin Wu(香港中文大学) Chen Zhang(快手 Kling Team) Zhiyong Wu(清华大学深圳国际研究生院) Pengfei Wan(快手 Kling Team) Helen Meng(香港中文大学) 💡 毒舌点评 用“连续音频块路由 + 先验/证据冲突门”把条件计算从 token 级提升到局部连续结构,确实比任务级或帧级 MoE 更贴合语音/音乐/音效的短时连续性,受控消融和路由可视化初步撑起了核心 claim。但公开基准上并未全面压过专用 SOTA,复杂场景优势主要靠自家 100 条提示 + Gemini 参考无关裁判背书;代码仓库虽然挂在项目主页,但权重和训练数据依然没有放出,“统一音频场景生成”的增量价值仍需要更独立、更可复现的验证。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 976 words

VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

📄 VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics 标签:#音乐生成 #扩散模型 #流匹配 #音频生成 #数据集 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #扩散模型 | #流匹配 #音频生成 | arxiv 👥 作者与机构 论文原文未提供作者列表、第一作者、通讯作者或机构信息。正文脚注仅给出 GitHub 仓库 https://github.com/User-tian/VIOLET,不能据此确认作者身份,因此这里不臆测任何姓名或机构。 💡 毒舌点评 VIOLET 在“可控小提琴合成”这个垂直方向上确实做到了新高度:技巧与连续动态都能显式控制,客观指标明显超过 ViolinDiff,并在多项主观评分中逼近商业虚拟乐器。但训练数据仍以商用 VI 渲染为主,真实录音只作为辅助数据,且评测基准也大量建立在合成数据上;因此论文标题中的“高保真”更准确地说应是“商业 VI 渲染分布内的高保真”,对真实演奏录音的泛化尚未被证明。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 762 words