Unified Audio Intelligence Without Regressing on Text Intelligence
📄 Unified Audio Intelligence Without Regressing on Text Intelligence #音频理解 #语音识别 #语音翻译 #语音合成 #音频生成 #多模态模型 #强化学习 6.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.2/0.5 | 工程 1.3/1.5 ✅ 6.8/10 | 前50% | #音频交互 | #多模态模型 | #音频理解 #语音识别 | arxiv 👥 作者与机构 论文摘要中未提供作者列表,无法确定具体作者与所属机构。 💡 毒舌点评 亮点在于将统一音频智能锚定在 30B MoE 文本 LLM 上,并明确提出“不退化文本智能”这一核心目标。但摘要几乎全篇堆砌任务名称与数据规模,却未给出任何可验证的定量对比数字,这使得 SOTA 宣称显得空洞。这种“全功能宣传册”式的摘要削弱了技术报告的严谨感。 📌 核心摘要 本文提出 Audex,一个基于 30B MoE 文本 LLM(Nemotron-Cascade-2-30B-A3B)的统一音频-文本大语言模型。采用单一 Transformer 解码器统一处理音频与文本:音频输入经编码器提取特征,通过投影映射到文本嵌入空间;量化的离散音频输出 token 与文本 token 混合,一同送入自回归解码生成。训练包括三阶段:(1)在 curated 的音频-文本数据集(157.4B 音频 token + 320.5B 文本 token)上进行多阶段监督训练;(2)纯文本 Cascade RL,用于强化文本对齐与推理能力,防止文本退化;(3)多域 on-policy 蒸馏,稳定多模态表现。论文宣称模型在音频理解、语音识别/翻译、TTS、音频生成与语音到语音生成等任务上达到 SOTA,同时文本推理、对齐、知识、长上下文与智能体能力仅有微弱甚至零退化。模型权重已释放。 ...