SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering

📄 SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering #音频修复 #流匹配 #多模态模型 #指令微调 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8/10 | 前25% | #音频修复 | #流匹配 | #多模态模型 #指令微调 | arxiv 👥 作者与机构 第一作者:Jan Melechovsky (Singapore University of Technology and Design) 通讯作者:Jan Melechovsky (Singapore University of Technology and Design) 作者列表:Jan Melechovsky(Singapore University of Technology and Design)、Ambuj Mehrish(Ca’ Foscari University of Venice)、Abhinaba Roy(Singapore University of Technology and Design)、Dorien Herremans(Singapore University of Technology and Design) 💡 毒舌点评 SonicMaster在"All-in-One"音乐修复上的尝试是勇敢且及时的,用一套流匹配框架统一了19种退化类型的处理,避免了以往的级联错误。但数据生成高度依赖模拟退化,而真实世界录音的退化远比参数化函数复杂和混沌得多,模型对真实复杂混合退化的泛化能力仍是未知数。VAE潜在空间的引入确实提升了效率,但也带来了可闻的编解码伪影——论文自己都承认会出现“机器人嗓音”和清晰度损失,这在一个标榜“专业级”的母带处理场景下显得不够“clean”。与效应移除模型的对比更像是一场不公平的“表演赛”,高得惊人的SI-SDR背后,很可能只是模型学会了把音频“母带化”得更响、更亮,而非真正忠实地修复了信号。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 556 words

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

📄 A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR #生成模型 #流匹配 #数据增强 7.5/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 1.2/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.8/0.5 | 工程 0.8/1.5 ✅ 7.5/10 | 前25% | #生成模型 | #数据增强 | #流匹配 | arxiv 👥 作者与机构 Lin Chen (北京工商大学), Jingping Fang (北京工商大学), Hairui Liu (西安电子科技大学), Chenyang Xu (清华大学), Junhao Chen (北京工商大学), Xiaorui Li (悉尼大学), Weidong Cai (悉尼大学), Xiaoming Chen (北京工商大学,通讯作者)。 ...

2026-07-01 · 更新于 2026-07-24 · 4 min · 685 words

VeRe-Flow: Guiding Flow Matching toward Clean Speech via Velocity Contrastive Regularization and Representation Alignment for Noise-Robust Bandwidth Expansion

📄 VeRe-Flow: Guiding Flow Matching toward Clean Speech via Velocity Contrastive Regularization and Representation Alignment for Noise-Robust Bandwidth Expansion #语音增强 #流匹配 #自监督学习 #正则化微调 #生成模型 #鲁棒性 7.7/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | #语音增强 | #自监督学习 | #流匹配 #正则化微调 | arxiv 👥 作者与机构 作者:Sujin Koo, Sangyoon Kim, Ji Sub Um, Hoirin Kim。机构:MAGO(韩国)和KAIST(韩国)。 ...

2026-06-30 · 更新于 2026-07-24 · 2 min · 408 words

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

📄 AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation #语音合成 #音频生成 #音乐生成 #自回归模型 #流匹配 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | #语音合成 | #音频生成 | #音乐生成 #自回归模型 | arxiv 👥 作者与机构 作者:Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma, Xiangang Li, Wei Xue 机构:香港科技大学 (HKUST), 通义团队, 阿里巴巴集团 (Tongyi Fun Team, Alibaba Group) ...

2026-06-23 · 更新于 2026-07-24 · 3 min · 436 words

Improving Text-to-Music Generation with Human Preference Rewards

📄 Improving Text-to-Music Generation with Human Preference Rewards #音乐生成 #流匹配 8.5/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.5/10 | 前50% | #音乐生成 | #流匹配 | arxiv 👥 作者与机构 作者:Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Chris Donahue 机构:未在论文中明确列出。 💡 毒舌点评 这篇文章与其说是学术研究,不如说是一份详实的工程调优报告。作者在120M参数的FluxAudio-S基线上,像搭积木一样组合了现有的分数条件化、专家迭代和DPO/CRPO技术,并通过详尽的消融实验验证了每一步的边际效益。其价值在于“工程集成”和“系统调优”,而非提出新算法或提供深刻的新理论。消融实验设计严谨,对“奖励条件化在推理时饱和”和“机制迁移不对称性”等非平凡现象的观察与记录,对后续实践者有不错的参考价值。但所有组件都缺乏原创性,评估仅限于一个小型内部验证集,对核心发现(如条件饱和)缺乏机理层面的解释,CRPO的微弱贡献也被一笔带过。整体而言,这是一篇扎实的系统工程报告,适合作为技术博客或赛道总结,但对于顶会而言,创新性和深度都显不足。 📌 核心摘要 本文报告了作者为ICME 2026学术文本到音乐生成(ATTM)挑战赛效率赛道所做的提交。该方案在120M参数的FluxAudio-S骨干网络上,整合了五项工程决策,核心是使用由TuneJury提供的学习到的人类偏好奖励。该奖励在训练时作为条件信号,在推理时作为样本选择标准。通过在100个Song Describer提示词上的逐阶段分解分析,作者展示了以下发现:(1) 训练时奖励条件化是有效的功能引导轴,但其效应在训练链末端被权重吸收,导致推理时的分数控制饱和;(2) 机制迁移(GlobalAdaLN到InputAdd)具有不对称性,仅单向安全;(3) 专家迭代是性能提升的主要贡献者,而CRPO带来的增益在统计噪声水平内。 🔗 开源详情 代码:https://github.com/yonghyunk1m/ttm-humanpref (包含完整的训练管道细节、模型架构、超参数设置和评估脚本)。 模型权重:论文中未提供具体权重文件的下载链接。文中指出基线模型“FluxAudio-S”由挑战组织者提供,但未给出获取链接。 数据集:论文中使用了由挑战组织者提供的MTG-Jamendo数据集(约55K条音轨),并基于Song Describer Dataset (SDD)进行评估。具体数据集的下载链接或开源协议未在论文中明确给出。 Demo:https://github.com/yonghyunk1m/ttm-humanpref (论文中“Code & Demo”链接指向此仓库,具体在线演示地址需在此仓库中查找)。 复现材料:论文中提及训练配置、检查点等细节在GitHub仓库中发布。具体包括:完整的训练管道细节(SFT、专家迭代、CRPO阶段)、模型架构(FluxAudio-S骨干网)、超参数设置(学习率、批量大小等)、评估协议(SDD-100和SDD-706评估集),以及完整的消融实验设计空间(在发布的仓库中)。 论文中引用的开源项目: TuneJury:偏好排序器。论文引用文献[18],未提供直接链接。 FluxAudio-S:文本到音乐生成模型。论文引用文献[8, 12],未提供直接链接。 Demucs:音源分离模型。论文引用文献[7],未提供直接链接。 LAION-CLAP-Music:音乐音频-文本嵌入模型。论文引用文献[29],未提供直接链接。 MERT (v11-330M):音乐自监督模型。论文引用文献[21],未提供直接链接。 BigVGAN:声码器。论文引用文献[19],未提供直接链接。 T5-Large:文本编码器。论文引用文献[26],未提供直接链接。 Song Describer Dataset (SDD):评估数据集。论文引用文献[23],未提供直接链接。 以及引用的其他数据集来源:Music Arena [17]、MusicPrefs [13]、AIME [9]、SongEval [30],均未提供直接链接。 🏗️ 方法概述和架构 本文提出的文本到音乐生成流程基于一个120M参数的FluxAudio-S流匹配Transformer骨干网络,该网络由挑战赛组织者提供作为基线。整个流程可分解为训练时和推理时两大部分,其中训练部分又分为三个阶段。架构的核心创新在于将一个学习到的人类偏好奖励分数(\(s\))作为额外的条件信号,通过不同的注入机制融入生成过程。 ...

2026-06-23 · 更新于 2026-07-24 · 2 min · 399 words

ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion

📄 ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion #语音转换 #流匹配 #扩散模型 6.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.3/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 6.6/10 | 前50% | #语音转换 | #流匹配 | #扩散模型 | arxiv 👥 作者与机构 作者: Jeongsoo Choi, Ji-Hoon Kim, Shujie Hu, Joon Son Chung 机构: KAIST (韩国科学技术院), Chung-Ang University (中央大学), The Chinese University of Hong Kong (香港中文大学) ...

2026-06-23 · 更新于 2026-07-24 · 3 min · 578 words

Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

📄 Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS #语音合成 #流匹配 7.2/10 | 创新 1.4/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | #语音合成 | #流匹配 | arxiv 👥 作者与机构 Seymanur Akti, Alexander Waibel。单位:卡尔斯鲁厄理工学院 (KIT), 卡内基梅隆大学 (CMU), KIT Campus Transfer (KCT)。 💡 毒舌点评 这篇工作在“模拟朗伯效应”这个实际问题上动了心思,双轴控制的概念也直观。但作为顶会论文,细节经不起推敲。伪标签的定义像“拍脑袋”,词级控制把 \(\beta\) 拉到 1.5 超出范围,理论依据一句“为了感知显著性”就带过了,这很不严谨。实验基线用简单信号处理,这有点欺负人,和最新的神经网络可控TTS比比看?作者自己都承认WER在极端条件下可能失效,但又拿它作为主要可懂度指标,结论的基石就有点晃。总的来说,想法不错,但打磨和验证的功夫还差火候,离“扎实”的距离比评分显示的要远。 ...

2026-06-23 · 更新于 2026-07-24 · 2 min · 282 words

How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech

📄 How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech #语音合成 #扩散模型 #流匹配 7.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前50% | #语音合成 | #扩散模型 | #流匹配 | arxiv 👥 作者与机构 Nityanand Mathur, Wasim Hamees, Apoorv Madha, Sameer Singh, Akshat Khurana, Sudarshan Mandloi, Nityanand Kamath Smallest.ai 💡 毒舌点评 论文提出了一个有价值的问题:风格描述中的词语如何影响语音合成。将DAAM适配到语音领域(具体是流匹配模型)的思路是新颖的,且实验规模(3600组合)值得肯定。 然而,“可解释性”工作的核心在于解释的深度和普适性。本文的解释停留在“统计关联”层面(如方差低=全局调节),缺乏对机制本身的因果探索(如注意力编辑实验)。所揭示的规律(早期步骤重要)在扩散模型中并非全新发现。 最大的硬伤在于其“可复现性”和“可扩展性”。分析完全基于单一、未公开的商业模型(CapSpeech),使用的是精心构造的合成提示(120个模板化句子)。这严重限制了结论的泛化能力。读者无法验证、复现或在自己的模型上应用该方法。 部分分析结论(如函数token在后期步骤重要性上升)虽然有趣,但缺乏更深入的解释,只是现象描述。整体而言,这篇论文像是一份详尽的“模型行为观察报告”,而非一篇能提供新方法或深刻洞见的可解释性研究。 📌 核心摘要 本文首次将扩散模型注意力归因方法(DAAM)适配到语音合成领域,用于分析风格描述词如何影响基于流匹配的TTS模型(CapSpeech-TTS)的输出。通过对大量(风格描述,文本转录)组合生成的跨注意力图进行系统性分析,论文发现:风格标记通过注意力机制扮演全局调节角色,其注意力模式在时间上分布均匀,与生成语音的基频和能量具有语义一致的统计相关性,且其影响力在生成过程的早期ODE步骤和深层Transformer层中达到峰值。 ...

2026-06-19 · 更新于 2026-07-24 · 2 min · 391 words

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

📄 Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow #Transformer #流匹配 #多模态模型 #模型压缩 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前50% | #Transformer | #Transformer | #流匹配 #多模态模型 | arxiv 👥 作者与机构 Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang* ...

2026-06-19 · 更新于 2026-07-24 · 4 min · 658 words

Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow

📄 Time-Unconditional Generative Speech Enhancement via Autonomous Rectified Flow #语音增强 #流匹配 #生成模型 7.0/10 | 创新 1.3/2 | 严谨 1.0/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.3/1.5 | 复现 0.7/0.5 | 工程 0.8/1.5 ✅ 7.0/10 | 前25% | #语音增强 | #流匹配 | #生成模型 | arxiv 👥 作者与机构 张文斌(Wenbin Zhang)、江晓飞(Xiaofei Jiang)、张文(Wen Zhang)、周(Zhou) 杭州电子科技大学通信工程学院,杭州电子科技大学自动化学院 💡 毒舌点评 这篇论文提出了一个有趣的观点:在边界锚定的线性路径语音增强任务中,显式的时间步可能是冗余的。核心洞察(目标向量场的时间不变性)在数学上是成立的,并且实验上确实展示了移除时间步模块后在单步推理效率和质量上的优势。然而,其理论贡献的深度有限,只是对线性路径的一个直接推论。实验的广度不足,缺乏在真实复杂噪声或低资源场景下的验证。作者声称“通用性可与传统流程媲美”,但DNS Challenge上的性能与FlowSE相当且在混响条件下有波动,这更像是持平而非优势。此外,论文对“自治ODE”可能带来的训练不稳定性、对初始状态的敏感性等潜在问题讨论不足。开源仅提供代码但无模型权重,复现门槛较高。总体而言,这是一个扎实的工程优化,理论新意有限,实验未能充分支撑其广泛影响力的断言。 📌 核心摘要 该论文针对生成式语音增强中显式时间步条件化的必要性提出质疑。作者提出“自治整流流”框架,将增强过程建模为一个自治常微分方程系统。理论上证明了在连接带噪观测和干净语音的线性插值路径下,目标向量场是时间不变的,其形式等价于噪声分布。因此,神经网络无需输入时间步,仅从当前状态和带噪观测的空间关系即可预测恒定的去噪方向。实验表明,该框架在VoiceBank+DEMAND数据集上,当NFE=5时达到3.11 PESQ;在极端的单步推理(NFE=1)时,仍保持3.00 PESQ,显著优于基线,同时将实时因子降低至0.02。消融研究证实移除时间步可提升质量与速度。在DNS Challenge数据集上,其性能与FlowSE相当。 🔗 开源详情 代码: https://github.com/zhangwen0821/ARFSE.git (论文脚注1提供) 模型权重: 未提及 数据集: VoiceBank+DEMAND:公开数据集,论文未提供直接下载链接。 INTERSPEECH 2020 DNS Challenge 公开合成测试集:公开数据集,论文未提供直接下载链接。 Demo: 未提及 复现材料: 模型架构:基于NCSN++,冻结时间步输入和噪声调度模块。 超参数:Adam优化器,学习率 \(1\times10^{-4}\),批大小4,训练100个epoch,\(\sigma=0.5\),EMA衰减因子0.999。 信号处理设置:FFT大小510,帧移128。 复现:提供了训练配置细节,但未明确说明是否包含完整的检查点、训练脚本或详细附录的获取方式。 🏗️ 方法概述和架构 本文提出的自治整流流框架的核心是建立一个不依赖显式时间步 t 的语音增强模型。其方法论构建在以下关键组件上: ...

2026-06-19 · 更新于 2026-07-24 · 3 min · 535 words