离散还是连续:语义约束决定音频理解上限
该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。
该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。
StepAudio 3 Gen 用 12.5 Hz 共享 16 码本离散表示把语音、歌声、音效和音乐放在一个自回归流中建模,以主干预测首码本加轻量预测器补全残差码本的分工,在四阶段渐进预训练与零初始化适配下保持文本能力,并在中文人声相似度与声音设计指令遵循上报告了可核对的胜率与一致性得分,其代价是长序列声学建模与多阶段训练流程的复杂度。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对统一大音频语言模型偏向平滑上下文而漏掉短暂声学线索的问题,论文提出只在推理时对比原始与时域模糊音频的对数几率并做门控稀疏修正,在 MMAU 上 Qwen2.5-Omni 平均达 73.2%,代价是每样本多一次慢路径预填充前向与双路解码缓存。
针对语音与音乐联合训练中的任务冲突和数据不均衡,论文用动态容量混合专家做按词元分配计算的三阶段课程训练,在语音内容一致性和音乐美学指标上报告了超越专用基线与稠密联合基线的结果,代价是更复杂的专家初始化与路由调参流程。
UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。
AuK 用自然语言指令加可选音频统一五类语音任务,以多模态大语言模型语义条件、联合训练的音频变分自编码器声学潜变量和混合整流流 Transformer 为核心,在约 3.03 billion 指令音频实例与 1.95 million 小时监督上经生成预热、联合预训练、编辑偏好优化与生成强化学习取得零样本与指令合成及通用编辑的领先结果,并以 4 步无分类器自由 …
在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。
音频理解 | 8.7/10
音频生成 | 7.6/10
音频理解 | 6.1/10
统一音频模型 | 8.3/10
语音生成 | 7.5/10
音频生成 | 8.5/10
音频生成 | 8.5/10
音频生成 | 8.5/10
音频生成 | 7.5/10
音频生成 | 8.0/10
音频事件检测 | 7.5/10
语音合成 | 7.5/10