听不清细节的音频大模型:用可验证的合成音频一轮轮自己出题
针对音频语言模型能懂语义却听不准声学细节的问题,EvoAudio 用当前模型的弱项决定下一轮练什么、工具合成波形保证答案可验证、GRPO 训练加留出集晋级做 13 轮递归进化,最强证据是五个不同骨干平均最高且总体最高提升 6.3 点,代价是工具覆盖不到的语义文化推理提升有限且后期收益变平。
针对音频语言模型能懂语义却听不准声学细节的问题,EvoAudio 用当前模型的弱项决定下一轮练什么、工具合成波形保证答案可验证、GRPO 训练加留出集晋级做 13 轮递归进化,最强证据是五个不同骨干平均最高且总体最高提升 6.3 点,代价是工具覆盖不到的语义文化推理提升有限且后期收益变平。
论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。
针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。
针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。
针对音频大模型能转写却听不懂说话方式与声学环境的问题,论文用 22 维特征定义、120 万音频问答对与先单属性后多属性的两阶段课程训练 ParA-LLM,在 ParA-Bench 总体上报告 43.53% 准确率并在外部语音基准上同步提升,代价是声学单项仍弱于 GPT-4o-Audio 且绝对准确率仍远低于人类。
针对舞蹈线索稀疏而作曲需要稠密结构的问题,CMA-OT 用 Jukebox 多尺度专家对 DiT 隐表示做由粗到细的课程对齐与尺度自适应 FGW 软对齐,并以流匹配生成损失联合训练,在 AIST++ 与 TikTok 上报告了节奏与质量提升,代价是训练侧引入多尺度 OT 与课程调度。
论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。
论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对给定目标脉冲响应反推虚拟平板混响器六维物理与空间参数的问题,ALAMODE 用无梯度差分进化分三阶段依次锁定频率、位置与整体能量参数,在 128 条合成与 16 条挑战数据上实现高谱重合,但第三阶段质量密度精度与仿真速度仍受限。
HydraQE 针对语音翻译无参考质量估计,用 Qwen3-ASR 同时编码源语音和译文假设,经稀疏层混合与双向重编码得到共享表示并用 DA、MetricX、xCOMET 三头监督加课程采样训练,在 IWSLT 2026 开发集与测试集段级别上超过级联文本基线,但不同预测头在语种与段级和系统级之间存在权衡且开发集系统级分数不稳定。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
该文把求载波复音以产生目标二次差频谱的问题转成学习失真函数连续近似逆,用齐次结构加课程式训练换来可实时插值的合成器,代价是重建误差略高于随机牛顿迭代。
该文在 ASVspoof 2019 上用省略敏感性与熵损失诊断出 A1 与 A4 等高影响攻击,再用先学低影响后适配高影响的重放课程把跨数据集总体 EER 明显压低,代价是两阶段训练与四项正则的额外复杂度。
针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。
UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。
UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。