边听边拧合成器:连续动作强化学习如何做实时音色跟随
该文把现场音色匹配做成每 0.093 秒调一次连续合成参数的强化学习控制问题,用描述符状态加五种奖励在合成器内域与跨域及真实乐器语料上验证,最强证据是同合成器内域匹配显著更准,而代价是跨域只能近似且对描述符与奖励选择高度敏感。
该文把现场音色匹配做成每 0.093 秒调一次连续合成参数的强化学习控制问题,用描述符状态加五种奖励在合成器内域与跨域及真实乐器语料上验证,最强证据是同合成器内域匹配显著更准,而代价是跨域只能近似且对描述符与奖励选择高度敏感。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对自然语言到二维均衡参数的连续控制任务,论文用约 9 万次用户交互构建非参数偏好密度奖励面,先以 GRPO 做在线结构对齐再以 DPO 做峰值注入精修,在分布外概念上以 1.5B 模型达到与 GPT-4o mini 可比的听感,代价是混合管线对分组数敏感且仅适用于低维空间。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该文在因果多通道时频网格网络基线不动的情况下,用近端策略优化学习少量混合系数,以感知函数相对基线的提升为奖励,在助听器四通道与眼镜七通道发育集上取得小幅稳定改进,但混合结构保守且奖励依赖预训练评估模型。
SteerDuplex 针对全双工语音模型可操控性不足,用 Moshi 骨干加针对性监督微调建立语气人设语速操控,再用两阶段连续性感知的混合奖励强化学习改善打断响应与暂停等待,代价是仍存在过早让出话轮与奖励钻空子的权衡。
论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。
针对长视频音频问答中 GRPO 样本浪费、组内奖励相同导致优势为零、全序列平均授信的问题,AVATAR 用分层回放加离线修正与首尾抛物线加权做强化学习,在 Qwen2.5-Omni 上取得 MMVU 加 5.4 等增益,代价是四阶段课程与多奖励判断器带来的训练复杂度。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。
针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。
针对社交媒体多模态伪造分散评测的问题,论文构建覆盖图像、音频、视频与音视频讲话头的统一基准并提出课程微调加统一奖励强化的 Omni-Fake-R1,最强证据来自严格不相交的 OOD 划分与联合评测,而代价是渐进式训练流程更长且定位精度仍受篡改细粒度限制。
论文研究如何在低功耗乐器内嵌入可调映射学习,让演奏者在演奏中用奖惩塑造神经网络映射,报告显示可高速探索大参数空间但精调困难且依赖预设偏置。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对全模态情感推理中模型过度依赖视觉而忽视声音与文本的模态坍缩问题,该工作用带引导词的结构化推理数据做冷启动,再用基于引导词熵的奖励做强化学习校准模态使用,在四个情感基准上取得多项最优并保留通用能力,代价是对极端长尾类别与强模态冲突仍敏感。
针对语音输入推理明显弱于文本的模态推理鸿沟,论文提出非对称奖励的在线轨迹对齐框架 TARS,用表示对齐约束层间隐状态、用行为对齐约束输出语义,在 MMSU 与 OBQA 上把语音恢复率提升到 98.89 到 100.45 区间,代价是约 27.5 小时基线之上的在线强化学习与约 4.4% 额外奖励计算开销。
针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。
针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。
针对先想后说首音等待过长而边想边说又破坏思维块原子性的矛盾,论文用流式掩蔽机制保证音频不欠载、用原子一致性修复重建逻辑因果,在 VoiceBench 上从 67.24 提升到 73.41 的同时把首次音频延迟从 20.35s 降到 3.65s、实时率从 7.04 降到 1.05,代价是依赖外部教师模型打分且复杂混合推理仍与串行思考存在小幅差距。