Unified Audio Intelligence Without Regressing on Text Intelligence

📄 Unified Audio Intelligence Without Regressing on Text Intelligence #音频理解 #语音识别 #语音翻译 #语音合成 #音频生成 #多模态模型 #强化学习 6.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.2/0.5 | 工程 1.3/1.5 ✅ 6.8/10 | 前50% | #音频交互 | #多模态模型 | #音频理解 #语音识别 | arxiv 👥 作者与机构 论文摘要中未提供作者列表,无法确定具体作者与所属机构。 💡 毒舌点评 亮点在于将统一音频智能锚定在 30B MoE 文本 LLM 上,并明确提出“不退化文本智能”这一核心目标。但摘要几乎全篇堆砌任务名称与数据规模,却未给出任何可验证的定量对比数字,这使得 SOTA 宣称显得空洞。这种“全功能宣传册”式的摘要削弱了技术报告的严谨感。 📌 核心摘要 本文提出 Audex,一个基于 30B MoE 文本 LLM(Nemotron-Cascade-2-30B-A3B)的统一音频-文本大语言模型。采用单一 Transformer 解码器统一处理音频与文本:音频输入经编码器提取特征,通过投影映射到文本嵌入空间;量化的离散音频输出 token 与文本 token 混合,一同送入自回归解码生成。训练包括三阶段:(1)在 curated 的音频-文本数据集(157.4B 音频 token + 320.5B 文本 token)上进行多阶段监督训练;(2)纯文本 Cascade RL,用于强化文本对齐与推理能力,防止文本退化;(3)多域 on-policy 蒸馏,稳定多模态表现。论文宣称模型在音频理解、语音识别/翻译、TTS、音频生成与语音到语音生成等任务上达到 SOTA,同时文本推理、对齐、知识、长上下文与智能体能力仅有微弱甚至零退化。模型权重已释放。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 323 words

AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching

📄 AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching #语音合成 #音频生成 #可解释性 7.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | #语音合成 | #知识蒸馏 | #音频生成 #可解释性 | arxiv 👥 作者与机构 第一作者:Pengfei Zhang(香港科技大学(广州)信息枢纽人工智能学域) 通讯作者:Li Liu(香港科技大学(广州)信息枢纽人工智能学域) 作者列表:Pengfei Zhang、Tianxin Xie、Minghao Yang、Li Liu(均来自香港科技大学(广州)信息枢纽人工智能学域) 💡 毒舌点评 这篇论文最大的亮点是发现并实证了“存储-贡献分离”(SCD)现象,然后巧妙地用一个因果归因工具(FoG-A)来指导层选择,把REPA从“凭经验瞎猜”升级成了“看谁真干活”。动机清晰,intuition很有说服力。但话说回来,实验规模偏小(总步数仅500k,两个数据集),跨架构验证虽然做了但深度不够——只给了几个FAD/WER/MOS数字,缺少更系统的分析(如动态、消融等),无法确定增益是否只是某种隐式正则化的结果。虽然FoG-A排名看起来稳定,但在更长/更大规模训练下的行为完全是未知数。此外,从Jacobian链式传播直接跳到一个强烈的“蝴蝶效应”论断有些牵强,没有严谨讨论梯度衰减或中间层Jacobian性质对结论的影响。方法整体仍停留在原型验证阶段。 📌 核心摘要 问题定义:在token-conditioned音频流匹配(Flow Matching)模型中,现有的表示对齐(REPA)策略通常凭经验固定中间层(如第8层)进行监督,忽略了“存储语义最丰富的层”与“对生成速度场v_θ贡献最大的层”可能不一致,导致训练效率低下。 方法核心:提出归因引导的REPA(AG-REPA)。首先,利用前向门控消融(FoG-A)作为因果探针,量化DiT每一层对最终预测速度场的因果贡献;然后,自动选出贡献最大的Top-K层,并按贡献大小进行加权对齐,从而将对齐目标从“语义储层”转向“因果驱动层”。 与已有工作的不同:不同于固定层REPA或基于梯度范数的选择,AG-REPA首次将因果干预度量引入音频流匹配的表示对齐,明确区分“表示存储”与“函数贡献”,并据此设计了一种全新的层选择与损失加权策略。 主要实验结果(Config B, 500k步):在LibriSpeech和AudioSet的统一音频生成任务上,AG-REPA相比于固定中层REPA(Layer 4, 8, 12),语音FAD从1.45降至1.29,音效FAD从2.88降至2.56,语音MOS从3.92升至4.12。跨架构(Voicebox, CosyVoice, F5-TTS)实验也取得一致改进,例如在F5-TTS上FAD从1.45降至1.15。关键消融显示,对齐FoG-A选出的“因果驱动层”相比对齐LASP选出的“表示丰富层”,FAD改善幅度提升约3.4倍,且收敛加速约3.3倍。 实际意义与普适性:为扩散/流匹配模型的训练加速提供了一种轻量、可移植的归因引导范式。其诊断工具集(BiT-C, LASP, FoG-A)不仅服务于AG-REPA,也为理解其他生成架构的内部行为提供了可操作的工具。 主要局限性:实验在有限训练规模(500k步)下进行;FoG-A排名虽短程稳定,但在更长训练或模型显著漂移后是否依然有效未知;方法依赖双教师蒸馏,增加了部署依赖;未在更泛化的音频/视觉任务上进行验证。 🔗 开源详情 代码:https://github.com/zpforlove/AG-REPA 模型权重:未提供。 数据集:LibriSpeech 与 AudioSet,论文未直接提供下载链接,但LibriSpeech可通过https://www.openslr.org/12 获取,AudioSet通过https://research.google.com/audioset/ 获取。 Demo:未提供。 复现材料:论文附录提供了部分架构和诊断协议细节,但未提供完整的训练配置文件、预训练检查点或独立复现脚本。 论文中引用的相关开源项目: Whisper (large‑v3): https://github.com/openai/whisper BEATs: https://github.com/microsoft/unilm/tree/master/beats RepCodec: 引用自 Huang et al. (2024) Vocos: https://github.com/gemelo‑ai/vocos Qwen3‑0.6B‑Base: https://huggingface.co/Qwen/Qwen3‑0.6B CosyVoice: https://github.com/FunAudioLLM/CosyVoice F5‑TTS: https://github.com/swivid/F5‑TTS Matcha‑TTS: https://github.com/shivammehta25/Matcha‑TTS DINOv2: https://github.com/facebookresearch/dinov2 🏗️ 方法概述和架构 整个工作围绕一个两阶段的统一音频生成流水线展开:第一阶段是自回归大语言模型(LLM)预测离散声学token;第二阶段是基于DiT的流匹配模型将这些token生成为连续mel谱,再经由神经声码器合成波形。本文的核心贡献并不在该流水线设计,而在于第二阶段DiT训练过程中的表示对齐策略。作者引入了一套“先诊断、后干预”的机制,包含三个互补的探测工具和一个归因引导的训练算法。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 447 words

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

📄 AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing #多模态模型 #音频生成 #音频理解 #语音合成 #说话人日志 5.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.9/1.5 | 开源 0.1/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 📝 5.8/10 | 前50% | #音频生成 | #扩散模型 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:William Chen(Adobe Research, Carnegie Mellon University) 通讯作者:William Chen williamchen@cmu.edu, Prem Seetharaman pseeth@adobe.com 作者列表:William Chen(Adobe Research, Carnegie Mellon University)、Prem Seetharaman(Adobe Research)、Rithesh Kumar(Adobe Research, OpenAI)、Oriol Nieto(Adobe Research)、Shinji Watanabe(Carnegie Mellon University)、Justin Salamon(Adobe Research)、Zeyu Jin(Adobe Research) 💡 毒舌点评 这是一篇工程味很重的工作,为统一处理复杂多源音频场景提供了一个端到端的解决方案,pipeline设计完整。但核心创新很有限,本质是将视觉领域的Transfusion和Diffusion Forcing技术结合后迁移到音频,并强依赖于一个用专有模型合成的数据集。评测高度内循环,在域外真实音频上的泛化性存疑,且模型不公开,更像是Adobe内部技术实力的展示而非推动社区开放研究的产物。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 550 words

Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks

📄 Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks #语音识别 #音频生成 7.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | #语音识别 | #音频生成 | arxiv 👥 作者与机构 第一作者:Tianyi Xu(中国科学院信息工程研究所,中国科学院大学网络空间安全学院) 通讯作者:Yue Zhao(中国科学院信息工程研究所),Kai Chen(中国科学院信息工程研究所) 作者列表:Tianyi Xu、Cheng’an Wei、Yue Zhao、Kai Chen(均来自中国科学院信息工程研究所 / 中国科学院大学网络空间安全学院) 💡 毒舌点评 本文巧妙利用“听觉不留意”的心理声学现象,将其建模为可优化的注意力稀释损失,在对抗音频隐蔽性上迈出了关键一步。200人用户研究中55.6%的不可察觉率远超前人,攻击成本仅0.43美元,成果说服力强。然而,方法深度依赖人工精选的42首音乐载体库和经典MPEG-1掩蔽模型,对长命令和稀疏音乐的泛化能力明显不足;防御实验仅测试了两种基础信号处理手段,面对现实世界中可能存在的说话人验证、音频取证等主动防御系统时,其攻击效力仍存疑,这削弱了其宣称的现实威胁等级。 📌 核心摘要 论文要解决的问题:在真实物理世界中对商用黑盒自动语音识别(ASR)系统发起隐蔽对抗攻击。现有方法仅关注压缩扰动幅度,忽视了人类选择性注意力机制,导致生成的对抗音频仍易被察觉(如Occam仅10.78%用户认为正常,Kenku有46%用户能识别嵌入的指令)。 方法核心是提出HWN(Hearing Without Noticing)框架,包含两个关键设计:基于心理声学掩蔽效应的注意力兼容载体选择算法(从候选音乐库中选出最能掩蔽目标命令的音乐片段)和基于结构-残差分解的注意力稀释损失函数(抑制频谱中易捕获注意力的突变成分)。 与已有方法相比,HWN的新颖之处在于显式建模“注意力”而非仅最小化信噪比,通过载体选择与频谱纹理平滑双重机制提升感知隐蔽性,将攻击从“小声”推向“不被注意”的层次。 ...

2026-07-04 · 更新于 2026-07-24 · 2 min · 367 words

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

📄 STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation #音频生成 7.9/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ✅ 7.9/10 | 前25% | #音频生成 | #变分自编码器 | arxiv 👥 作者与机构 第一作者:Huadai Liu(香港科技大学、阿里巴巴通义 Fun Team) 通讯作者:Wei Xue(香港科技大学) 作者列表:Huadai Liu(香港科技大学、阿里巴巴通义 Fun Team)、Wen Wang(阿里巴巴通义 Fun Team)、Kaicheng Luo(阿里巴巴通义 Fun Team)、Qian Chen(阿里巴巴通义 Fun Team)、Xiangang Li(阿里巴巴通义 Fun Team)、Wei Xue(香港科技大学) 💡 毒舌点评 这篇论文将音频 VAE 中一个被长期默认的实践——各通道均等 KL 惩罚——上升到"三元悖论"的理论高度,并用一个幂律增长的通道方向约束场(Gamma-Growth)优雅地重构了潜在空间拓扑。洞察清晰、动机扎实,实验也相当全面。然而,方法核心高度依赖对 γ=2.0 这一具体取值的经验消融,缺乏信息论或谱分析层面的严格理论支撑来解释"为何是幂律而非其他函数族",更缺少对该参数的数据驱动自适应机制;且论文将 STAR 包装为"适用于任何 VAE 架构"的通用正则化器,但在纯 CNN 上的收益幅度远小于结合 Mamba 的跃升,通用性声明的力度可能需要更审慎的限定。此外,无开源代码和模型权重,在当前顶会生态中属于较大减分项。 ...

2026-07-04 · 更新于 2026-07-24 · 7 min · 1335 words

Two-dimensional quantization for geometry-aware audio coding

📄 Two-dimensional quantization for geometry-aware audio coding #语音编码 #语音合成 #音频生成 7.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 7.6/10 | 前25% | #语音编码 | #语音合成 | #音频生成 | arxiv 👥 作者与机构 第一作者/通讯作者:Tal Shuster (School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Be’er Sheva, Israel) 作者:Eliya Nachmani (School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Be’er Sheva, Israel) 注:原文脚注中通讯作者仅为 Tal Shuster,与已有分析不同。 💡 毒舌点评 这篇论文用一个巧妙的几何直觉——将独立标量量化扩展到二维结构化网格——解决了神经音频编解码中效率和利用率的两难问题。实验覆盖度不错,尤其是在低码率下能用一个量化器挑战一堆级联 RVQ 的基线,很有杀伤力。但论文对为什么是二维、为什么菱形网格更好的分析偏经验主义,缺乏从率失真理论或音频特征统计特性角度的深刻解释;此外,仅在与 FSQ 和 WavTokenizer 的对比中严格控制了训练数据和配置变量,与其他 SOTA 模型对比时使用了异构的训练数据和配置,削弱了部分 SOTA 声明的直接可比性。 ...

2026-07-04 · 更新于 2026-07-24 · 4 min · 740 words

Predicting Timbre Traits for Interpretable Assessment of Musical Sound Synthesizers

📄 Predicting Timbre Traits for Interpretable Assessment of Musical Sound Synthesizers #音频生成 #音乐信息检索 6.1/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.6/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 6.1/10 | 前50% | #音频生成 | #音乐信息检索 | arxiv 👥 作者与机构 作者:Théo Chasle Cauchy (Nantes Université, LS2N, 法国), Modan Tailleur (Nantes Université, LS2N, 法国), Lindsey Reymore (Arizona State University, School of Music, Dance and Theatre, 美国), Fanny Roche (Arturia, 法国), Mathieu Lagrange (Nantes Université, LS2N, 法国)。 ...

2026-06-30 · 更新于 2026-07-24 · 2 min · 254 words

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

📄 AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation #语音合成 #音频生成 #音乐生成 #自回归模型 #流匹配 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | #语音合成 | #音频生成 | #音乐生成 #自回归模型 | arxiv 👥 作者与机构 作者:Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma, Xiangang Li, Wei Xue 机构:香港科技大学 (HKUST), 通义团队, 阿里巴巴集团 (Tongyi Fun Team, Alibaba Group) ...

2026-06-23 · 更新于 2026-07-24 · 3 min · 436 words

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

📄 LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity #音频水印 #音频生成 #语音合成 8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8/10 | 前25% | #音频水印 | #生成对抗网络 | #音频生成 #语音合成 | arxiv 👥 作者与机构 Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie University of Toronto, Canada *Equal contributions, BCorresponding author 💡 毒舌点评 本文首次将“放射性”水印概念系统化地引入音频领域,并通过语义潜在空间嵌入提出了一个新颖的框架LambdaMark,实验结果看起来非常漂亮,声称在所有评估的攻击下都保持了鲁棒性。然而,审稿人必须指出几个严重关切。首先,该方法的“通用性”高度依赖于一个特定的、未开源的语义编码器(Dasheng)和声码器(SemanticVocoder)骨干网络,这使得其声称的通用性打了折扣。其次,论文在理论深度上有所欠缺,主要贡献是架构设计和实证验证,缺乏对为何“语义嵌入”比“波形嵌入”更鲁棒的严格数学分析或理论证明。第三,尽管实验全面,但评估完全依赖于作者自己提出的“HarmonicAttack”,且该攻击的泛化性和威胁强度是否代表最先进水平有待商榷。论文的局限性部分诚实,但更多地描述了方法适用范围,而非对方法内在缺陷的深入剖析。总体而言,这是一篇不错的工程导向论文,但距离顶会论文所要求的理论创新和深度分析仍有差距。 ...

2026-06-23 · 更新于 2026-07-24 · 5 min · 922 words

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

📄 STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation #音频生成 #变分自编码器 #正则化微调 8.8/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.8/10 | 前25% | #音频生成 | #变分自编码器 | #正则化微调 | arxiv 👥 作者与机构 未说明机构信息。作者:Huadai Liu, Wen Wang, Kaicheng Luo, Qian Chen, Xiangang Li, Wei Xue。 💡 毒舌点评 这篇论文定位清晰,问题(R-D-R三难困境)定义具有洞察力,提出的STAR正则化在理论上合理且实验上有效。STAR-VAE的混合架构设计和STAR-Gen的LLM流匹配框架都展示了不错的工程整合能力。然而,论文的“开源”声明需要澄清——实际上只提供了项目主页,并未开源代码或模型权重,这对于一篇声称“通用”和“优越范式”的工作来说略显不足。实验比较全面,但部分消融分析(如Appendix C.1的γ值选择)可以更深入。最大的弱点在于对“Reconstruction Drift”现象的实证分析主要依赖间接指标(如ablation),缺乏更直接的可视化或量化证据来证明高容量编码器在各向同性约束下会优先丢失纹理信息。 📌 核心摘要 本文针对连续音频变分自编码器(VAE)中各向同性高斯先验导致的“率-失真-正则化三难困境”提出了系统解决方案。通过形式化定义三难困境,作者指出平坦的潜空间拓扑无法容纳音频的层级信息结构(结构化的低频与随机的高频)。为此,提出结构化拓扑感知正则化(STAR),通过Gamma增长函数对潜空间通道施加非均匀的KL惩罚,诱导形成与音频信息密度对齐的容量梯度,从而将结构信息路由至高容量通道,随机纹理分配至低容量通道。基于此,构建了STAR-VAE,采用混合CNN-Mamba架构,在保证线性复杂度全局建模能力的同时,借助STAR正则化避免了高容量编码器可能出现的“重建漂移”。进一步,提出了STAR-Gen,一个基于LLM的流匹配框架,利用STAR-VAE的结构化潜空间实现高质量的文本到音频生成,避免了向量量化伪影。大量实验表明,STAR-VAE在相同潜空间率下显著优于现有基线,STAR-Gen也达到了文本到音频生成的新水平。 ...

2026-06-23 · 更新于 2026-07-24 · 5 min · 1004 words