论文解读

离散还是连续:语义约束决定音频理解上限

该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。

 · 更新于 2026-09-24 · 约 22 分钟 · 10552 字 阅读 →
论文解读

离散自回归统一音频生成:以首层码本规划与残差声学补全分工控制干扰

StepAudio 3 Gen 用 12.5 Hz 共享 16 码本离散表示把语音、歌声、音效和音乐放在一个自回归流中建模,以主干预测首码本加轻量预测器补全残差码本的分工,在四阶段渐进预训练与零初始化适配下保持文本能力,并在中文人声相似度与声音设计指令遵循上报告了可核对的胜率与一致性得分,其代价是长序列声学建模与多阶段训练流程的复杂度。

 · 更新于 2026-09-24 · 约 24 分钟 · 11918 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

平滑偏置之下:用模糊视图逼出瞬态证据的解码修正

针对统一大音频语言模型偏向平滑上下文而漏掉短暂声学线索的问题,论文提出只在推理时对比原始与时域模糊音频的对数几率并做门控稀疏修正,在 MMAU 上 Qwen2.5-Omni 平均达 73.2%,代价是每样本多一次慢路径预填充前向与双路解码缓存。

 · 更新于 2026-09-24 · 约 16 分钟 · 7528 字 阅读 →
论文解读

语音要语义、音乐要结构:用动态容量专家缝合统一音频生成

针对语音与音乐联合训练中的任务冲突和数据不均衡,论文用动态容量混合专家做按词元分配计算的三阶段课程训练,在语音内容一致性和音乐美学指标上报告了超越专用基线与稠密联合基线的结果,代价是更复杂的专家初始化与路由调参流程。

 · 更新于 2026-09-24 · 约 21 分钟 · 10251 字 阅读 →
论文解读

把结构化语音与非结构化音效装进同一指令接口:UniSonate 的对齐与课程设计

UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9402 字 阅读 →
论文解读

AuK 用一条指令接口统一生成与编辑:语义条件与声学潜变量如何分工

AuK 用自然语言指令加可选音频统一五类语音任务,以多模态大语言模型语义条件、联合训练的音频变分自编码器声学潜变量和混合整流流 Transformer 为核心,在约 3.03 billion 指令音频实例与 1.95 million 小时监督上经生成预热、联合预训练、编辑偏好优化与生成强化学习取得零样本与指令合成及通用编辑的领先结果,并以 4 步无分类器自由 …

 · 更新于 2026-09-24 · 约 27 分钟 · 13283 字 阅读 →
论文解读

冻结表征上分离对比损失与正确配对的语义精炼

在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →
论文解读

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6164 字 阅读 →
论文解读

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

音频生成 | 7.6/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9341 字 阅读 →
论文解读

TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

音频理解 | 6.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8405 字 阅读 →
论文解读

StepAudio 2.5 Technical Report

统一音频模型 | 8.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6187 字 阅读 →
论文解读

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

语音生成 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8743 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5314 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4691 字 阅读 →
论文解读

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

音频生成 | 8.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5965 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5499 字 阅读 →
论文解读

AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Hierarchical Activity Recognition and Captioning from Long-Form Audio

音频事件检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4494 字 阅读 →
论文解读

InstructAudio: Unified Speech and Music Generation with Natural Language Instruction

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9232 字 阅读 →