Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

📄 Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion 标签:#音乐转录 #扩散模型 #生成模型 #音频理解 #Transformer 6.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #扩散模型 | #生成模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Wei-Han Hsu(论文中未提供机构信息) 通讯作者:未说明 作者列表:Wei-Han Hsu、Chih-Cheng Chang、Bo-Yu Chen、Li Su、Yi-Hsuan Yang(所有作者均未在论文中提供机构信息,致谢部分提及台湾国科会及教育部资助项目) 💡 毒舌点评 这篇论文试图用潜扩散生成五类鼓 stem 完成“分离-检测”转录,想法讨巧且对制作场景友好,额外“白送”的可编辑音轨是个卖点。但扩散推理慢、hi-hat 与 cymbal 分离仍是糊涂账,且转录性能全面落后于端到端 SOTA,只敢在 kick/snare 两个子集上说自己“有优势”。实验设计上缺少对推理速度和实际听感的严格评估,让生成式前端的实用价值打了折扣。 ...

2026-08-04 · 更新于 2026-08-14 · 4 min · 837 words

Exploring Efficient Waveform Diffusion Models for Foley Sound Generation

📄 Exploring Efficient Waveform Diffusion Models for Foley Sound Generation 标签:#音频生成 #扩散模型 #音频理解 #Transformer #模型评估 6.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Runwu Shi (Institute of Science Tokyo) 通讯作者:未说明 作者列表:Runwu Shi (Institute of Science Tokyo)、Chang Li (University of Science and Technology of China)、Jiahui Li (Institute of Science Tokyo)、Jiang Wang (Institute of Science Tokyo)、Yaozhong Kang (Institute of Science Tokyo)、Nabeela Khan (Institute of Science Tokyo)、Linghan Fang (Technical University of Munich)、Benjamin Yen (Institute of Science Tokyo)、Takeshi Ashizawa (Institute of Science Tokyo)、Kazuhiro Nakadai (Institute of Science Tokyo) 💡 毒舌点评 这篇论文用一个双路径时频注意力架构,把Foley波形扩散模型的参数量压到了3M级别,性能居然能和70M参数的模型打得有来有回,效率账算得很漂亮,架构设计的直觉也合情合理。但故事到这里就有点“高开低走”了:模型虽然参数少,但推理速度并不快,DP-DiT的实时率高达31.06,离“效率”二字相去甚远;主观评测仅9人且不提统计显著性;最关键的是,只有demo音频,没有代码也没有权重,整个社区想要踩在你的肩膀上继续走,得先花大力气把你走过的路重新铺一遍。 ...

2026-08-03 · 更新于 2026-08-14 · 3 min · 432 words

语音/音乐/音频论文速递 2026-08-03

语音/音乐/音频论文速递 2026-08-03 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #音频理解 2篇 ██ #主动降噪 1篇 █ #元学习 1篇 █ #医疗音频 1篇 █ #声源定位 1篇 █ #数据集 1篇 █ #语音交互 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Do Music Foundation Models Embed Pitch in Helical Struc 8.1分 前25% 方法研究 #音乐理解 🥈 Versatile On-device Adaptation at the Edge by Unifying 8.1分 前25% 系统技术报告 #元学习 🥉 FriendBench: Benchmarking Dyadic Familiarity Inference 7.9分 前25% 数据集与基准 #音视频理解 4. Cloned Voices, Real Consequences: Evaluating Bias in Po 7.7分 前25% 数据集与基准 #语音伪造检测 5. A Neurosymbolic Approach for Explainable Early Diagnosi 7.7分 前25% 系统技术报告 #音频理解 6. DoubleHelix: Structured Cross-Modal Fusion for Audio-Vi 7.4分 前50% 方法研究 #音视频语音识别 7. Tensor-Based Joint Pitch and DOA Estimation 6.9分 前50% 方法研究 #声源定位 8. ParaASR: Multi-Token Prediction for Fast and Long-Conte 6.7分 前50% 系统技术报告 #语音识别 9. Exploring Efficient Waveform Diffusion Models for Foley 6.5分 前50% 方法研究 #音频生成 10. Leveraging Beam Search Information for Confidence Estim 6.3分 前50% 方法研究 #语音识别 11. TORUS: A Test of Rendering-Understanding Self-Coherence 6.1分 前50% 数据集与基准 #音频理解 12. M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain 6.1分 前50% 数据集与基准 #语音交互 13. Stable Autoregressive Speech Generation with Low-Frame- 5.8分 前50% 方法研究 #语音合成 14. Learning to Predict Performance-induced Emotion Differe 5.6分 前50% 方法研究 #数据集 15. Model-Agnostic Meta-Learning Initialization for Distrib 5.1分 后50% 方法研究 #主动降噪 16. Technological Advances in Detecting and Managing Cognit 4.0分 后50% 综述 #医疗音频 📋 论文列表 🥇 Do Music Foundation Models Embed Pitch in Helical Structure? 8.1/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ...

2026-08-03 · 更新于 2026-08-14 · 14 min · 2783 words

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

📄 VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition 标签:#歌唱生成 #自回归模型 #语音合成 #扩散模型 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #歌唱生成 | #自回归模型 | #语音合成 #扩散模型 | arxiv 👥 作者与机构 第一作者:Yukun Chen(Nanyang Technological University, Singapore; 未说明具体院系) 通讯作者:未说明 作者列表:Yukun Chen(Nanyang Technological University; 未说明具体院系)、Tianrui Wang(Nanyang Technological University; 未说明具体院系)、Zhaoxi Mu(未说明)、Xinyu Yang(未说明)、EngSiong Chng(Nanyang Technological University; 未说明具体院系) 💡 毒舌点评 这篇论文瞄准了歌唱合成(SVS)从“实验室demo”走向“作曲家工具”的核心痛点,提出了完全基于符号乐谱、无需显式时长预测的 VoclRender 系统。数千小时级的工程化数据构建和精巧的交错式提示设计,确实让人眼前一亮。 但它的实验设计存在硬伤:在决定其核心卖点“节奏与音高控制”的客观指标 IOU 和 RPA 上,VocalRender 几乎全面输给依赖时间对齐引导的 SoulX-Singer。作者试图用精心设计的主观测试(CMOS/MS-MOS)来证明自己“主观听感更好、更自然”,但这无法弥补“抛弃时长预测是否带来了更可控的艺术表达”这一核心命题在定量论证上的缺失。更致命的是,其巨大模型和数据集均未公开,导致所有声称的“SOTA”结果都成了无法被外界验证的空中楼阁。 ...

2026-07-31 · 更新于 2026-08-14 · 4 min · 689 words

Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection

📄 Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection 标签:#语音伪造检测 #扩散模型 #音频理解 #Transformer #模型评估 6.6/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音伪造检测 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Haotian Mo(未说明所属机构) 通讯作者:Qinglin Wang(未说明所属机构) 作者列表:Haotian Mo、Jie Liu、Siqi Shen、Songzhu Mei、Xinhai Chen、Xiangyang Wang、Yigui Feng、Shuai Li、Gencheng Liu、Keqi Yang、Qinglin Wang 机构标注:作者1,2,4,5,6,7,8,9,10,11 同属一个未命名机构;作者3 属另一个未命名机构;作者12 属第三个未命名机构。论文 PDF 元数据中未发现具体的机构名称。 💡 毒舌点评 这篇论文在“如何安全地融合分布外残差证据与强听觉先验”这个问题上,贡献了一个干净且有效的解决方案。音频锚定融合的设计动机清晰,辅助监督与融合结构交互的发现也挺漂亮——能让竞争融合在所有种子上集体崩坏,而锚定融合却从中受益,这现象本身就很有说服力。但致命的问题是,全文最核心的“锚定机制”的效用,是藏在一个系统级对比里的。动态竞争系统跟锚定系统之间,差的不止是那扇“门”,还有残差路由和整个视觉编码器的组织方式。这等于说,“锚定”到底有多大功劳,是笔算不清的账。对于一篇把“提出音频锚定融合”作为核心贡献的文章来说,缺了严格的一对一因果消融,让所有关于“锚定”的结论都只能停留在“建议”层面。 ...

2026-07-30 · 更新于 2026-08-14 · 4 min · 828 words

Qwen-Audio-3.0-Gen-Preview Technical Report

📄 Qwen-Audio-3.0-Gen-Preview Technical Report 标签:#音频生成 #扩散模型 #音频理解 #Transformer #模型评估 5.6/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:模型报告 | 评分置信度:中 | #音频生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:未说明(按姓氏字母排序且标注同等贡献) 通讯作者:未说明 作者列表:Junyu Dai, Xiaoyue Duan, Xinyue Fan, Yihan Feng, Xiangang Li, Yunjia Li, Lejun Min, Yufei Shi, Xingchen Song, Yiran Wang, Cheng Wen, Menglin Wu, Bajian Xiang, Huaicheng Zhang, Han Zhao, Ruichen Zheng(机构均未说明) 💡 毒舌点评 这篇报告在场景级音频统一生成上迈出了有意义的一步,两阶段数据课程和结构化条件渲染的设计思路值得参考。但作为一个未开源的preview版本,实验对比范围明显偏窄——仅与Seed-Audio-1.0做多说话人和时间定位对比,而对真正同期的混合场景模型(如Bagpiper、Dasheng AudioGen虽在AudioCaps有对比但在混合场景任务上缺失)几乎避而不谈,大量关键训练与推理细节也完全缺失,让报告的参考价值大打折扣。 ...

2026-07-30 · 更新于 2026-08-14 · 2 min · 412 words

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

📄 TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation 标签:#音视频生成 #扩散模型 #音频理解 #Transformer #模型评估 6.7/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Qijun Gan(未说明机构) 通讯作者:Meiguang Jin(未说明机构) 其他作者:Chenwei Zhang, Junfeng Ma, Qiu Shen(均未说明机构) 备注:论文中未明确标明各作者所属的具体机构名称和地址。 💡 毒舌点评 这篇工作将不可变锚点与受门控的动态记忆巧妙地结合起来,用于抑制长时因果生成中的身份漂移,其细致的记忆因子化和推理流水线设计展现了扎实的工程功底。然而,实验对比避开了最直接的因果生成竞品(如 Mutual Forcing/AvatarForcing)的同条件较量,使得其宣称的领先优势说服力打折;完全依赖合成数据进行训练和评估,也为这项工作的泛化能力打上了一个大大的问号。虽然有承诺开源的网页,但当前缺乏复现所需的核心资产与数据。 ...

2026-07-30 · 更新于 2026-08-14 · 3 min · 589 words

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

📄 Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model 标签:#语音合成 #Adapter #扩散模型 #零样本 #多语言 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #Adapter | #扩散模型 #零样本 | arxiv 👥 作者与机构 第一作者:Carlos Muñoz-Romero(Universitat Oberta de Catalunya (UOC), Spain / Monoceros Labs, Spain) 通讯作者:未明确标注(论文中提供了邮箱 carlosmr@uoc.edu, joseangl@ugr.es,未指定通讯作者) 作者列表:Carlos Muñoz-Romero(Universitat Oberta de Catalunya (UOC), Spain / Monoceros Labs, Spain)、Jose A. Gonzalez-Lopez(Department of Signal Theory, Telematics and Communications, University of Granada, Spain) 💡 毒舌点评 本文的“Freeze-Align”框架巧妙地将人脸到语音的任务转化为预训练声学空间的语义对齐问题,避免了从零训练语音生成器,思路干净。然而,在仅有24个未见说话人上的检索结果微弱且无统计显著性,身份保真度严重依赖TTS先验,使得“从人脸生成可信声音”这一核心卖点更像是在一个强先验上的微调整形。 ...

2026-07-30 · 更新于 2026-08-14 · 3 min · 434 words

Parallel Decoding Distillation for Fast Image and Video Generation

📄 Parallel Decoding Distillation for Fast Image and Video Generation 标签:#音视频生成 #知识蒸馏 #扩散模型 #音频理解 #Transformer 6.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #知识蒸馏 | #扩散模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Neta Shaul(NVIDIA, Weizmann Institute of Science) 通讯作者:未说明,Arash Vahdat和Julius Berner为共同指导(equal advising) 作者列表:Neta Shaul(NVIDIA, Weizmann Institute of Science)、Chao Liu(NVIDIA)、Arash Vahdat(NVIDIA)、Julius Berner(NVIDIA) 💡 毒舌点评 这篇论文在轨迹蒸馏的路上走得扎实:用并行解码替代单步回归,既免去了JVP/有限差分的计算开销,又把视频生成的多样性从分布蒸馏的泥潭里拉了出来。但作为一篇自称“方法简单鲁棒”的工作,实验对比中对核心创新“并行解码”本身的消融近乎为零——你从未直接证明并行预测优于单步预测,也未在相同NFE下与步进蒸馏做公平对比,这使得核心论证悬空。此外,生成模型的音视频评测中视频部分做得很足,但音频质量评估仅靠一个LLM打分,缺乏FAD等客观声学指标,这在此类应用中是个明显的短板。 ...

2026-07-29 · 更新于 2026-08-14 · 5 min · 964 words

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

📄 Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers 标签:#语音合成 #扩散模型 #音频理解 #Transformer #模型评估 6.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.5/1.5 ✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者/通讯作者:Dongseong Hwang (Apple), Prasanth Yadla (Apple) [标注*为同等贡献] 作者列表:Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen (全部来自Apple) 💡 毒舌点评 这是一篇典型的工业界“炫技”报告:论文极其出色地解决了在极端内存预算(~21 MB)的Apple AMX芯片上实时运行扩散声码器的工程难题,其恒定内存开销和16倍实时推理速度令人印象深刻,且已实际部署于Siri Expressive Voices这一亿级用户产品中。然而,作为一篇“系统技术报告”,它几乎牺牲了学术论文应具备的所有可验证性和基础洞察:核心的“完全共享参数深度解码器”和“DiT风格层级条件化”本质上是对Moshi架构的精巧微创手术,技术贡献的深度有限;声称性能优于Moshi,却在不同的帧率和比特率下进行对比,且最关键的感知质量评估竟缺席,仅凭自动化指标和整个系统的外部MOS来佐证一个模块的优势,这种证据链脱节是难以接受的;加之完全不公开任何代码、模型、数据及损失函数等训练核心细节,使得这篇报告更像是一份为产品发布背书的商业白皮书,其对学术社区的推动作用因封闭性而大打折扣。 ...

2026-07-28 · 更新于 2026-08-14 · 3 min · 461 words