论文解读

边听边拧合成器:连续动作强化学习如何做实时音色跟随

该文把现场音色匹配做成每 0.093 秒调一次连续合成参数的强化学习控制问题,用描述符状态加五种奖励在合成器内域与跨域及真实乐器语料上验证,最强证据是同合成器内域匹配显著更准,而代价是跨域只能近似且对描述符与奖励选择高度敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9239 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

不用学奖励模型:用人群密度地形图做对话式均衡的在线探索与离线打磨

针对自然语言到二维均衡参数的连续控制任务,论文用约 9 万次用户交互构建非参数偏好密度奖励面,先以 GRPO 做在线结构对齐再以 DPO 做峰值注入精修,在分布外概念上以 1.5B 模型达到与 GPT-4o mini 可比的听感,代价是混合管线对分组数敏感且仅适用于低维空间。

 · 更新于 2026-09-24 · 约 20 分钟 · 9787 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不动主模型只调混合旋钮:用感知奖励微调多通道语音增强

该文在因果多通道时频网格网络基线不动的情况下,用近端策略优化学习少量混合系数,以感知函数相对基线的提升为奖励,在助听器四通道与眼镜七通道发育集上取得小幅稳定改进,但混合结构保守且奖励依赖预训练评估模型。

 · 更新于 2026-09-24 · 约 18 分钟 · 8625 字 阅读 →
论文解读

可操控的全双工对话:在会说话的同时听懂指令与保住话轮

SteerDuplex 针对全双工语音模型可操控性不足,用 Moshi 骨干加针对性监督微调建立语气人设语速操控,再用两阶段连续性感知的混合奖励强化学习改善打断响应与暂停等待,代价是仍存在过早让出话轮与奖励钻空子的权衡。

 · 更新于 2026-09-24 · 约 21 分钟 · 10239 字 阅读 →
论文解读

数得准还要指得出:长视频线索级音视计数的基准与能力迁移训练

论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。

 · 更新于 2026-09-24 · 约 20 分钟 · 9734 字 阅读 →
论文解读

看听推理不断线:AVATAR 用离线复用与首尾加权修补 GRPO

针对长视频音频问答中 GRPO 样本浪费、组内奖励相同导致优势为零、全序列平均授信的问题,AVATAR 用分层回放加离线修正与首尾抛物线加权做强化学习,在 Qwen2.5-Omni 上取得 MMVU 加 5.4 等增益,代价是四阶段课程与多奖励判断器带来的训练复杂度。

 · 更新于 2026-09-24 · 约 22 分钟 · 10852 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

不暴力看全片:用跨模态预测逼模型补全听觉与视觉

针对视频问答中被动看帧、忽视音频的问题,该工作用跨模态未来与过去摘要预测做监督微调,再用对比式强化学习约束双模态联合推理,在 16 帧与 64 帧条件下以 7B 与 8B 规模在四个音视频基准上达到与大闭源模型可比的水平,代价是两阶段推理延迟高于单阶段模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9332 字 阅读 →
论文解读

长视频越播越走样:先定低分辨率动作再用姿态锚定外观的音频驱动动画

针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9524 字 阅读 →
论文解读

四模态同判:Omni-Fake 把检测、定位与解释放进同一基准与同一模型

针对社交媒体多模态伪造分散评测的问题,论文构建覆盖图像、音频、视频与音视频讲话头的统一基准并提出课程微调加统一奖励强化的 Omni-Fake-R1,最强证据来自严格不相交的 OOD 划分与联合评测,而代价是渐进式训练流程更长且定位精度仍受篡改细粒度限制。

 · 更新于 2026-09-24 · 约 23 分钟 · 11386 字 阅读 →
论文解读

把训练装进乐器里:用演奏手势调映射的 NISPS 与双自述研究

论文研究如何在低功耗乐器内嵌入可调映射学习,让演奏者在演奏中用奖惩塑造神经网络映射,报告显示可高速探索大参数空间但精调困难且依赖预设偏置。

 · 更新于 2026-09-24 · 约 18 分钟 · 8716 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

用引导词把视觉听觉拉回同一条推理链:OmniCoT 与动态模态熵

针对全模态情感推理中模型过度依赖视觉而忽视声音与文本的模态坍缩问题,该工作用带引导词的结构化推理数据做冷启动,再用基于引导词熵的奖励做强化学习校准模态使用,在四个情感基准上取得多项最优并保留通用能力,代价是对极端长尾类别与强模态冲突仍敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9477 字 阅读 →
论文解读

语音能听懂却不会推理:用在线轨迹对齐把语音拉回文本推理线

针对语音输入推理明显弱于文本的模态推理鸿沟,论文提出非对称奖励的在线轨迹对齐框架 TARS,用表示对齐约束层间隐状态、用行为对齐约束输出语义,在 MMSU 与 OBQA 上把语音恢复率提升到 98.89 到 100.45 区间,代价是约 27.5 小时基线之上的在线强化学习与约 4.4% 额外奖励计算开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8538 字 阅读 →
论文解读

在自己的语音轨迹上学文本推理:CORD 的加权在策略跨模态自蒸馏

针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9227 字 阅读 →
论文解读

说什么与何时说分开评:面向全双工对话的双轴生成式奖励模型

针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。

 · 更新于 2026-09-24 · 约 17 分钟 · 8143 字 阅读 →
论文解读

边想边说不断流:用播放掩蔽保连续,用四重约束修原子性

针对先想后说首音等待过长而边想边说又破坏思维块原子性的矛盾,论文用流式掩蔽机制保证音频不欠载、用原子一致性修复重建逻辑因果,在 VoiceBench 上从 67.24 提升到 73.41 的同时把首次音频延迟从 20.35s 降到 3.65s、实时率从 7.04 降到 1.05,代价是依赖外部教师模型打分且复杂混合推理仍与串行思考存在小幅差距。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →