论文解读

合不合语境比像不像情绪更难:CEAEval 如何评语音表达得体性

论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。

 · 更新于 2026-09-24 · 约 23 分钟 · 11141 字 阅读 →
论文解读

从绝对打分到相对偏好:语音质量奖励建模的范式转换与细粒度难例

论文把语音质量评估从跨库不可比的平均意见分回归改为库内偏好比较,用 55333 对训练偏好的 MOS-Pref 统一训练三类奖励模型,最强标量模型整体准确率达 80.04%,而 MOS 感知的生成式奖励模型在小分差上进一步提升,代价是生成式路径仍弱于标量排序且依赖偏好标注质量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8989 字 阅读 →
论文解读

先保证译对再求快:用分层奖励纠正合成轨迹的无界语音同传

针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。

 · 更新于 2026-09-24 · 约 20 分钟 · 9604 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

英语音色说法语汉语为何走调:语言标签与词项检索如何稳住跨语种克隆

该工作以 FishAudio-S2-Pro 为基座研究英语参考到法语阿拉伯语汉语的跨语种克隆,用母语文字语言标签减少口音泄漏并以 GRPO 强化微调改善可懂度,再用推理时参考检索做词项匹配以稳住领域词发音,代价是汉语基线一度波动且说话人相似度与自然度总体保持稳定而非大幅提升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7699 字 阅读 →
论文解读

先听清再推理:用分层解耦把音频感知钉牢的混合推理

针对大音频语言模型感知错误主导问答失败的问题,论文用听觉场景分析做语音与环境、多说话人两层解耦并构造 PAQA,再以显式反思加 PAUSE 隐式计算的两阶段 HyPeR 训练,在保持可核查声学证据的同时以多目标奖励提升复杂音频问答,且额外暂停计算带来训练与推理开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9818 字 阅读 →
论文解读

一段话里换情绪又调语速:以后训练如何教会已有 TTS 听懂分段指令

针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。

 · 更新于 2026-09-24 · 约 15 分钟 · 7305 字 阅读 →
论文解读

不转写直接听:用慢思考强化学习把诈骗电话的声音细节留下来

针对转写文本丢失语气与环境线索且难以拆解分层话术的问题,SAFE-QAQ 用端到端音频大模型加三阶段规则奖励强化学习做慢思考推理,在 TeleAntiFraud-Bench 上以 SAFE-LS 取得场景 84.64、欺诈 89.61、类型 88.23 的加权 F1,代价是仍依赖单一数据集且实时版类型精度有所下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10285 字 阅读 →
论文解读

先听片段再分流:用文本可答性把死记训练和听觉强化分开

针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8830 字 阅读 →
论文解读

先定情绪再说话:Self-EmoQ 把情绪当作可规划的动作

针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9038 字 阅读 →
论文解读

从打分到讲理:用多任务标注与两阶段训练让语音大模型当评测者

该文针对合成语音评测只有分数、跨任务跨语言泛化弱的问题,构建覆盖四任务四语言的 SpeechEval 并用指令微调加奖励优化训练 SQ-LLM,最强证据是在评估与对比维度相关性上超过专家基线,代价是约 43 个 A100 小时训练与对特定伪造来源泛化仍不稳定。

 · 更新于 2026-09-24 · 约 18 分钟 · 8767 字 阅读 →
论文解读

简单题别啰嗦、难题多想想:让音频大模型的推理长度跟着难度走

论文针对音频问答中统一长度推理导致的简单题冗余和难题推理不足,提出随模型感知难度调节长度奖励的 GRDR 与 GA2DR,在保持准确率的同时报告平均推理长度下降至少 50%,代价是 GRDR 在强噪声与高难度集上更易出现奖励投机与不稳定。

 · 更新于 2026-09-24 · 约 21 分钟 · 10062 字 阅读 →
论文解读

从单分到多维推理:UniSRM 如何让语音评价说出依据

针对语音生成评价依赖主观平均意见分且单指标奖励不透明的问题,UniSRM 用四任务统一数据加两阶段推理评价与推理一致奖励,在 UniSRM-Bench 上提升多任务准确率,但多轮对话与跨域泛化仍受数据覆盖和计算开销限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9597 字 阅读 →
论文解读

先看再听:用两段式推理链约束幻灯片辅助转写

针对全模态模型易复述可见幻灯片文字而忽略语音的问题,论文提出先在思考块中识别幻灯片文字再在回答块中引用锚定转写,并用四项奖励做组相对策略优化,在实体密集基准上改善实体识别,同时带来思考块的额外推理开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8645 字 阅读 →
论文解读

偏好只改文字、锚定稳住声音:WavAlign 的模态分工混合后训练

针对端到端语音对话中统一偏好优化易引起声学漂移的问题,WavAlign 用全 token 有监督微调做声学锚、用仅文本的组相对策略优化改语义并以 rollout 统计动态加权,在两种架构上同时提升语义与表达但仍受限于序列级奖励与音频评价可靠性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9124 字 阅读 →
论文解读

把混响时间锁在目标附近:感知加控制的自调节厅堂闭环

该文要解决厅堂在人员与声源变化下混响时间漂移的问题,选择用卷积神经网络估计当前混响时间再由强化学习调节面板吸声系数的闭环路线,给出的最强证据是动态条件下把混响时间维持在目标 0.15 秒以内,代价是全过程依赖仿真反馈且未报告真实厅堂部署的延迟与能耗实测。

 · 更新于 2026-09-24 · 约 20 分钟 · 9903 字 阅读 →
论文解读

何时想、如何想:用四路奖励教音频大模型做难度自适应的推理

针对音频问答中显式推理不稳定、提示词无法自适应开关思考的问题,Audio-Thinker 用自适应思考准确率奖励加一致性和思考质量奖励在 GRPO 下训练,只用约 4 万条后训练样本就在 MMAU、MMAR 和 AIR 上超过同基座的显式推理基线,代价是依赖外部 Qwen3-8B 做推理裁判并增加强化学习采样开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →
论文解读

推理与分割打架时:AURORA 用四步推理加蒸馏保住像素精度

针对引用音频视觉分割中语言理解浅与推理分割互损问题,AURORA 用结构化思维链加分割特征蒸馏起步,再经纠错反思与分组奖励强化学习提升,在引用音频视觉分割的已见与未见划分上取得最高分,其代价是三阶段流水线与多模型标注依赖。

 · 更新于 2026-09-24 · 约 22 分钟 · 10802 字 阅读 →
论文解读

广告审核为何需要跨模态因果链:BLM-Guard 的两阶段策略

针对短视频广告中夸大表述与跨模态错位带来的细粒度政策违规,BLM-Guard 采用规则锚定的交错模态推理冷启动加自适应评论奖励的分组优化实现可解释审核,在自建基准与消融矩阵中报告严格准确率与一致性提升,但资源本次未能确认可达且一致性依赖大模型打分。

 · 更新于 2026-09-24 · 约 20 分钟 · 9863 字 阅读 →
论文解读

不用真值也能改口音和噪声错误:以音频文本对齐奖励做测试时强化适应

针对 Whisper 类模型在噪声与口音下置信度不可靠的问题,论文用可学习解码器提示加温度采样产生候选并以 CLAP 音频文本相似度做奖励做单样本强化更新,在 LibriSpeech 加噪与 L2-Arctic 上把平均词错误率降到 28.64% 与 28.21%,代价是每次推理需多轮采样打分并在样本后恢复参数。

 · 更新于 2026-09-24 · 约 18 分钟 · 8818 字 阅读 →