从绝对打分到相对偏好:语音质量奖励建模的范式转换与细粒度难例
论文把语音质量评估从跨库不可比的平均意见分回归改为库内偏好比较,用 55333 对训练偏好的 MOS-Pref 统一训练三类奖励模型,最强标量模型整体准确率达 80.04%,而 MOS 感知的生成式奖励模型在小分差上进一步提升,代价是生成式路径仍弱于标量排序且依赖偏好标注质量。
论文把语音质量评估从跨库不可比的平均意见分回归改为库内偏好比较,用 55333 对训练偏好的 MOS-Pref 统一训练三类奖励模型,最强标量模型整体准确率达 80.04%,而 MOS 感知的生成式奖励模型在小分差上进一步提升,代价是生成式路径仍弱于标量排序且依赖偏好标注质量。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对无参考语音翻译质量估计在文档内排序的评价方式,论文把 580M 参数的 CometKiwi-22 改为文档内成对排序加权 MSE 微调,在开发集上达到平均 35.2% 的 per-source Kendall τ,相对 34.6% 基线小幅提升,代价是只用英德和英中数据且未利用音频信号。
针对文本到音频中推理扩展不足与偏好错位问题,论文用连续掩码流匹配加迭代掩码重预测扩展推理计算,并用奖励加权微调对齐文本对应与审美,主证据是在 AudioCaps 上 FAD 为 1.10、KL 为 1.30、MOS-Q 为 78.87,代价是需要多步 ODE 求解与多轮掩码迭代。
针对并行三元组稀缺与合成目标封顶质量的问题,MimicLM 把 TTS 合成语音做源、真录音做目标并配合交错文本建模与偏好对齐,在保持音色口音情感相似度可比的同时提升自然度,代价是仍需大规模合成过滤与两阶段训练且真实输入词错率高于纯音色转换。
针对图像视频音频的理解与生成六类任务,OmniHallu 用原子断言拆分加模态专家验证再推理聚合做声明级检测,在 10000 样本基准上以宏平均 F1 领先基线并用可训练验证器把专家调用减少约三分之二。
该文针对语音进语音出对话只用单轮语义奖励的问题,用四路独立偏好数据加单 DPO 目标联合训练,在保持轮次与块级解码兼容的同时,以语义与声学指标的联合提升为证据,代价是情感与可懂度之间出现轻微竞争。
针对连续自回归语音模型没有显式序列似然而难以直接做直接偏好优化的问题,该工作用大音频语言模型自动构造同提示 chosen-rejected 对,并以拒绝采样微调冷启动加带监督锚的流匹配偏好优化做两阶段对齐,在 1600 句官方测试上把最终分从 73.96 提高到 75.80,而整体质量基本保持稳定。
针对文本评测看不见韵律情感与书面腔问题,该工作用真实对合成与书面對口语两类多轮偏好对训练端到端奖励模型,在分层基准上以 96.61% 模态微平均等证据显示可运行优势,代价是绝对分值仍随域偏移需谨慎用于优化。
针对全局提示无法刻画配器情绪能量随段落演变的问题,SegTune 用全局加分段层级条件与大模型句级时长预测做非自回归扩散生成,在 15 首中文流行歌测试中把音素错误率降到 14.5% 并把音乐性主观分做到 4.57,代价是偏好优化后性别年龄跟随出现下滑。
针对双轨分离把主唱与和声混为一轨导致的下游含混问题,VocalRep 用全局身份条件加排序约束做三轨分离,在保持可比分离分的同时以更干净的主唱提升歌声转换可懂度与音高稳定性和唇同步精度,代价是求和比较时累积误差与多人主唱假设受限。
共分析 42 篇语音/AI 论文
本文要解决似然训练抓不住主观音乐审美的问题,对比训练时 RLHF 与 DPO 和推理时树搜索三条路线,最强证据是约 300000 对偏好训练的 MusicRL 与 CLAP 提升 29.4% 的推理对齐,主要代价是数据不公开与推理延迟。
针对零样本语音合成中误读、可听噪声与异常停顿导致的不稳定问题,论文用能同时输出错误时间范围、转写文本与整句质量分的 Vox-Evaluator 做局部遮罩重改与细粒度偏好优化,在 Seed-TTS 上把 F5-TTS 的字错率从 1.73% 降到 1.42%,代价是最多两轮迭代改写与偏好训练过久后奖励饱和回落。
针对音频驱动人像动画中动作自然度、唇同步、视觉质量互相冲突的问题,该工作用 Talking-Critic 学三维奖励并自动构建 410K 偏好对,再用 TLPO 分专家独立优化后做时步-层自适应融合,报告显示主指标和用户评分全面提升,代价是两阶段训练与多专家推理融合的额外复杂度。
论文把音乐诱发绘画评估定义为直接预测感知一致性分数,用音乐调制视觉的 MPJudge 结合回归与偏好优化学习,在自建专家标注集上报告 SRCC 0.86 与 MAE 0.04,代价是更大的绘画编码器与对专家标注的依赖。
针对生成式语音修复中似然目标与听感偏好错位及单指标奖励作弊问题,论文用四维一致投票构造约 8 万偏好对并做 DPO 对齐,在 AR、掩码生成与流匹配三范式上报告了一致的客观与主观增益,代价是依赖自动指标代理与同范式数据更有效。
针对全模态大模型忽略视听证据与视频音频互相对不齐的问题,OmniDPO 用文本偏好对与加噪模态偏好对做条件偏好优化,在 Qwen2.5-Omni 与 MiniCPM-o-2.6 上降低幻觉并提升推理,但仍受基座视觉能力限制。
该工作以 Wan2.1 为基座,先用 LoRA 适配长视频,再只更新音频交叉注意力并用自动构造的 DPO 偏好对提升口型与表情,最后在推理侧用空间掩码加权的 Mask-CFG 实现三人以上多人音频驱动,最强证据是 HDTF 与 CelebV-HQ 上的 FID 与 FVD 领先,代价是三阶段大算力训练与推理时多路条件前向的额外开销。
SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。