合不合语境比像不像情绪更难:CEAEval 如何评语音表达得体性
论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。
论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。
论文把语音质量评估从跨库不可比的平均意见分回归改为库内偏好比较,用 55333 对训练偏好的 MOS-Pref 统一训练三类奖励模型,最强标量模型整体准确率达 80.04%,而 MOS 感知的生成式奖励模型在小分差上进一步提升,代价是生成式路径仍弱于标量排序且依赖偏好标注质量。
针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
该工作以 FishAudio-S2-Pro 为基座研究英语参考到法语阿拉伯语汉语的跨语种克隆,用母语文字语言标签减少口音泄漏并以 GRPO 强化微调改善可懂度,再用推理时参考检索做词项匹配以稳住领域词发音,代价是汉语基线一度波动且说话人相似度与自然度总体保持稳定而非大幅提升。
针对大音频语言模型感知错误主导问答失败的问题,论文用听觉场景分析做语音与环境、多说话人两层解耦并构造 PAQA,再以显式反思加 PAUSE 隐式计算的两阶段 HyPeR 训练,在保持可核查声学证据的同时以多目标奖励提升复杂音频问答,且额外暂停计算带来训练与推理开销。
针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。
针对转写文本丢失语气与环境线索且难以拆解分层话术的问题,SAFE-QAQ 用端到端音频大模型加三阶段规则奖励强化学习做慢思考推理,在 TeleAntiFraud-Bench 上以 SAFE-LS 取得场景 84.64、欺诈 89.61、类型 88.23 的加权 F1,代价是仍依赖单一数据集且实时版类型精度有所下降。
针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。
针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。
该文针对合成语音评测只有分数、跨任务跨语言泛化弱的问题,构建覆盖四任务四语言的 SpeechEval 并用指令微调加奖励优化训练 SQ-LLM,最强证据是在评估与对比维度相关性上超过专家基线,代价是约 43 个 A100 小时训练与对特定伪造来源泛化仍不稳定。
论文针对音频问答中统一长度推理导致的简单题冗余和难题推理不足,提出随模型感知难度调节长度奖励的 GRDR 与 GA2DR,在保持准确率的同时报告平均推理长度下降至少 50%,代价是 GRDR 在强噪声与高难度集上更易出现奖励投机与不稳定。
针对语音生成评价依赖主观平均意见分且单指标奖励不透明的问题,UniSRM 用四任务统一数据加两阶段推理评价与推理一致奖励,在 UniSRM-Bench 上提升多任务准确率,但多轮对话与跨域泛化仍受数据覆盖和计算开销限制。
针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。
针对端到端语音对话中统一偏好优化易引起声学漂移的问题,WavAlign 用全 token 有监督微调做声学锚、用仅文本的组相对策略优化改语义并以 rollout 统计动态加权,在两种架构上同时提升语义与表达但仍受限于序列级奖励与音频评价可靠性。
该文要解决厅堂在人员与声源变化下混响时间漂移的问题,选择用卷积神经网络估计当前混响时间再由强化学习调节面板吸声系数的闭环路线,给出的最强证据是动态条件下把混响时间维持在目标 0.15 秒以内,代价是全过程依赖仿真反馈且未报告真实厅堂部署的延迟与能耗实测。
针对音频问答中显式推理不稳定、提示词无法自适应开关思考的问题,Audio-Thinker 用自适应思考准确率奖励加一致性和思考质量奖励在 GRPO 下训练,只用约 4 万条后训练样本就在 MMAU、MMAR 和 AIR 上超过同基座的显式推理基线,代价是依赖外部 Qwen3-8B 做推理裁判并增加强化学习采样开销。
针对引用音频视觉分割中语言理解浅与推理分割互损问题,AURORA 用结构化思维链加分割特征蒸馏起步,再经纠错反思与分组奖励强化学习提升,在引用音频视觉分割的已见与未见划分上取得最高分,其代价是三阶段流水线与多模型标注依赖。
针对短视频广告中夸大表述与跨模态错位带来的细粒度政策违规,BLM-Guard 采用规则锚定的交错模态推理冷启动加自适应评论奖励的分组优化实现可解释审核,在自建基准与消融矩阵中报告严格准确率与一致性提升,但资源本次未能确认可达且一致性依赖大模型打分。
针对 Whisper 类模型在噪声与口音下置信度不可靠的问题,论文用可学习解码器提示加温度采样产生候选并以 CLAP 音频文本相似度做奖励做单样本强化更新,在 LibriSpeech 加噪与 L2-Arctic 上把平均词错误率降到 28.64% 与 28.21%,代价是每次推理需多轮采样打分并在样本后恢复参数。