锚定一侧再学另一侧:AV-GRPO 把音视频联合偏好拆成条件单模子问题
针对联合音视频生成中混合奖励难归因与双塔联合更新成本高的问题,AV-GRPO 用模态锚定分组、轨迹锁定加冻结对方塔、交替更新来解耦学习,基座 LTX-2.3 22B 上的 JavisBench 与 VABench 报告显示质量、对齐与同步多项提升,但不同训练方式与指标间仍存在权衡。
针对联合音视频生成中混合奖励难归因与双塔联合更新成本高的问题,AV-GRPO 用模态锚定分组、轨迹锁定加冻结对方塔、交替更新来解耦学习,基座 LTX-2.3 22B 上的 JavisBench 与 VABench 报告显示质量、对齐与同步多项提升,但不同训练方式与指标间仍存在权衡。
针对音频语言模型靠文本捷径答题的问题,论文用同一冻结教师有音频与无音频的对数概率差重塑蒸馏目标,在两个 3B 学生和三个基准上超过普通同策略蒸馏,代价是训练时每步要多做一次无音频教师前向。
针对生成增强在真实噪声下语言一致性不足的问题,该文用转录本计算的负词错误率奖励对预训练 FlowSE 做 Reinforce Adjoint Matching 后训练,在 CHiME-4 真实录音上把词准确率从 76.98% 提高到 82.06%,而报告的非侵入式音质指标未下降,默认奖励强度下主观听感无显著偏好。
针对自由文本下每条条件只有极少真实样本而难以估计条件分布的问题,DriftAudio 保留文本条件生成而在冻结特征空间匹配边际分布,从 MeanAudio 出发把 FAD 从 1.68 降到 1.11、FD 从 15.43 降到 12.71,从 FdAudio 出发把 FAD 从 1.22 降到 0.99,代价是部分起点上的 IS 与 CLAP 出现回落。
针对解析训练态与自生 rollout 态的暴露偏差,纠正性强制用动态 rollout 纠正加反事实转移一致性统一后训练 SB-VE 与 OT-CFM,在 VoiceBank 上把 SB-VE 的 PESQ 从 3.07 提升到 3.21 并稳定多步 SI-SDR,代价是 UTMOS 提升有限且需额外 rollout 开销。
针对 1 或 2 kHz 到 16 kHz 的极端语音超分,P2Flow 用音素后验引导缺失高频包络、用 3 段渐进恢复 0-2、2-4、4-8 kHz 速度场并对声码器做后训练,在 TIMIT 与 VCTK 上报告了谱失真、感知质量与可懂度同步改善,代价是 3 阶段流水线与额外分类器依赖。
GenTraceBench 把同一 TTS 谱系内预训练与 SFT、DPO、GRPO 适配后的配对检查点固定文本和说话人重合成来测取证稳定性,报告显示 RL 对齐平均归因变化小而部分 SFT 与预训练数据更换带来大幅漂移,且多样本注册只能缓解方差型漂移而不能纠正均值偏移。
针对从零训练的解码器语音合成的内容幻觉问题,论文把只作用于优选样本的轻量 CTC 对齐项折进直接偏好优化,在 Seed-TTS 英文集上把严重幻觉率从 4.4% 降到约 0.6%,代价是需要切到 eager 注意力读图且过强加权会转入自信但错位的过锐区。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对全模态大模型把一模态线索误用到另一模态提问以及过度依赖文本先验的问题,论文提出在偏好优化中加入不相关模态不变与相关模态敏感两项解耦约束并叠加纯文本惩罚,用自动构造的约 1.8 万偏好样本训练,在幻觉基准上报告最高约 27% 的匹配任务提升,而代价是每步增加无需梯度的损坏输入前向与四分之一轮数的训练预算控制。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对语音输入推理明显弱于文本的模态推理鸿沟,论文提出非对称奖励的在线轨迹对齐框架 TARS,用表示对齐约束层间隐状态、用行为对齐约束输出语义,在 MMSU 与 OBQA 上把语音恢复率提升到 98.89 到 100.45 区间,代价是约 27.5 小时基线之上的在线强化学习与约 4.4% 额外奖励计算开销。
针对 Qwen2-Audio-7B 语音翻译压缩到 4 GB 磁盘的问题,Diet-KIT 用 HQQ 分组量化打底、嵌入低比特加敏感度选层补足、AWQ 校准收尾,在 ACL 60/60 上以 3.98 GB 取得 en→de COMET 74.4、en→zh 77.1,代价是全模型统一 3 比特会使 BLEU 与 COMET 断崖式下跌。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。
针对端到端语音对话中统一偏好优化易引起声学漂移的问题,WavAlign 用全 token 有监督微调做声学锚、用仅文本的组相对策略优化改语义并以 rollout 统计动态加权,在两种架构上同时提升语义与表达但仍受限于序列级奖励与音频评价可靠性。
针对音频问答中显式推理不稳定、提示词无法自适应开关思考的问题,Audio-Thinker 用自适应思考准确率奖励加一致性和思考质量奖励在 GRPO 下训练,只用约 4 万条后训练样本就在 MMAU、MMAR 和 AIR 上超过同基座的显式推理基线,代价是依赖外部 Qwen3-8B 做推理裁判并增加强化学习采样开销。
针对生成式语音修复中似然目标与听感偏好错位及单指标奖励作弊问题,论文用四维一致投票构造约 8 万偏好对并做 DPO 对齐,在 AR、掩码生成与流匹配三范式上报告了一致的客观与主观增益,代价是依赖自动指标代理与同范式数据更有效。
语音合成 | 7.5/10