英文题目:Aligning Audio Captions with Human Preferences
会议身份:
conference:interspeech:2026:conference-paper-id:hegde26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#偏好优化 #强化学习 #主观评测 #音频字幕生成
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Kartik Hegde:机构信息未能从会议 PDF 纯文本可靠映射
- Rehana Mahfuz:机构信息未能从会议 PDF 纯文本可靠映射
- Yinyi Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Erik Visser:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频字幕生成需以环境声音为输入、以自然语言描述为输出,面临时序结构模糊、同一声场景可多语义粒度描述及传统n-gram指标与人类感知弱相关的难点。本文先用预训练CLAP音频与文本编码器抽取512维嵌入并拼接为1024维联合表示,经隐藏层为512与128的两层网络输出区间为[0,1]的标量奖励,以Bradley-Terry损失在成对人类偏好数据上训练以捕捉细粒度偏好概率。接着冻结该奖励并以自临界序列训练策略梯度对CNN10编码器加Transformer解码器的15M参数基线模型做强化微调,无需真值标注,同时以期望长度为基准的长度惩罚重塑奖励以抑制超长与重复投机。与直接优化对比相似度(CLAPScore)或共识指标(Consensus-based Image Description Evaluation,CIDEr)不同,该链路用偏好概率替代真值监督并保留轻量解码结构。在自有数据集挑战划分上强化后模型人类胜率达59.11%,相对基线40.89%提升显著,同时在AudioCaps挑战划分胜率达53.93%,相对基线46.07%提升明显。该结论主要适用于基线质量较差或不自然的困难样本,在非困难样本上增益微弱甚至为负,且未在更大模型上验证。原文未披露训练、推理或部署成本实测。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决什么矛盾?
本文的输入是一段音频,目标是生成一句自然语言字幕,说明声音中发生了什么。对于刚进入语音音频方向的读者,可以把任务理解为给声音写一句让人能想象现场的说明文字。输出只有一句话,但评价很主观,既要正确指出声源和事件,又要读起来自然。
本文要解决的矛盾是:一方面传统做法依赖大量音频与字幕成对出现的人工标注,收集成本高;另一方面常用的词重叠类自动指标与人的判断相关较弱,直接优化这类指标不等于让人更满意。同时,同一段声音在不同听者笔下可以用不同粗细程度描述,这让监督和评价都更不稳定。论文因此选择不新增成对标准答案,而是收集更容易获得的成对偏好,也就是让人听同一段音频后判断两句候选字幕哪句更好,再用这个信号改进任意基线字幕系统。
音频字幕 × 人类偏好对齐: 音频字幕的分工是把一段声音转成自然语言描述,说明听到了什么事件和场景;人类偏好对齐的分工是判断哪一句描述更正确、更自然。二者搭配的原因是同一段声音可以有多种粒度不同的正确说法,只靠词重叠无法判定好坏,组合意义是用人的二选一判断来定义优化方向,而不是用固定参考答案定义方向。
阅读本文需要先保留 3 条信息。第一,方法不要求强化阶段有标准答案字幕,奖励来自偏好数据训练的奖励模型。第二,基线是一个约 15000000 参数的轻量系统,由卷积音频编码器加变换器解码器构成,适合低资源部署。第三,最终好坏以人类二选一胜率为主要依据,自动指标只作辅助对照。下文按学习依赖展开,先讲相关路线,再走完一个样本的全流程,然后交代实验条件和结果边界。
已有路线各自解决了什么,又留下了什么缺口?
最早的音频字幕工作提供了大规模成对数据集,使有监督微调成为可能。评价长期借用图像字幕的词重叠指标,例如基于正确词序列匹配的分数和考虑同义与语序的分数,以及基于共识的分数。这些指标实现简单,但论文指出它们难以反映语义保真度和主观质量。后续有人把语义相似与错误建模结合,提出了与人意更一致的自动评价,但仍不能完全替代人的判断。
另一条路线是学习音频与文本的联合嵌入,例如对比语言音频预训练。它的分工是让相关音频文本对在向量空间更接近,可用于计算相关性分数或检测幻觉。但原文引用的近期研究显示,这类分数与人意相关仍然较弱,而且音频向量与文本向量之间存在模态间隙,细粒度语义对齐受限。也就是说,技术上相关不等于读起来自然、有上下文深度。
在优化方法上,图像字幕曾流行用自批判序列训练直接优化不可微指标,把测试时贪心解码结果作为基线来降低方差。音频字幕中这类按指标做强化学习的工作相对较少。近期有工作把基于对比嵌入的奖励与大语言模型结合,改善了与人期望的一致性,但依赖外部大模型会带来计算开销,不适合低内存嵌入式部署。直接偏好优化在文本领域有效,但论文认为它依赖静态成对比较,对简洁音频字幕的结构控制有限。因此本文选择在轻量基线上做偏好强化学习,并加入奖励塑形来稳定训练。
为什么绝对打分难用,成对偏好为什么更可行?
论文明确提到,对音频字幕做绝对评分时,标注者之间的一致性往往较差。每个人对好坏的尺度不同,有人给 3 分,有人给 4 分,很难统一。举例来说,同样是漏掉背景虫鸣,有人觉得是小瑕疵,有人觉得是关键错误。成对偏好把问题改为同一段音频下两句话哪个更好,判断更具体,分歧更小,收集也比从头写标准答案更省力。
从建模角度看,问题被定义为偏好概率估计。给定音频和两句候选字幕,奖励模型要给出各自分数,使得更受人喜欢的一句分数更高。两句分数之差经过逻辑函数后对应第一句胜出的概率,这正是布拉德利特里成对比较模型的写法。训练时用被偏好句和非偏好句的分数差构造损失,再加对分数大小的正则项,避免分数无界膨胀。推理时对单个音频字幕对输出零到一之间的分数,作为人会喜欢它的代理。
需要区分的是,本文没有声称偏好数据完全无噪声。原文用一致性系数报告了标注一致性处于可接受水平,但不是高度一致。这意味着奖励模型学到的是多数偏好趋势,个别模糊样本仍可能存在分歧。后文的挑战集划分正是为了检验在基线明显失败时,偏好信号能否把模型拉回正确和自然的方向。
整个方法如何串起偏好学习和强化微调?
先沿一个样本走完流程。输入是一段音频,基线字幕模型用两种解码方式各生成一句,一句是多项式采样得到的探索句,一句是贪心解码得到的基线句。两句分别与同一段音频配对,送入已训练好且冻结的自定义奖励模型,得到两个奖励分数。两个分数都经过长度惩罚调整,然后用采样奖励减去贪心奖励的差值乘以采样句的对数概率梯度来更新字幕模型。直觉是只有采样句确实优于当前贪心水平时,才增强它的生成概率。
下图左侧展示了这条强化回路,右侧展示了奖励模型内部结构,阅读时注意冻结与训练的区分以及长度惩罚插入的位置。
看图路径: 1. 先沿左侧音频到字幕模型的箭头看两条生成支路,区分采样字幕与贪心字幕;2. 再看中间两个冻结奖励模型分别打分并经过长度惩罚后进入强化更新的位置;3. 最后看右侧奖励模型内部音频编码器与文本编码器拼接再进神经网络输出分数的结构
论文图 2。原论文 Figure 2:“Proposed method for RL using custom reward model (left) and CLAP based architecture of the custom reward model infer- ence(right).”。
结合像素可见内容解释,左侧黄色大块是待更新的字幕模型,中间两个蓝色奖励模型块标为冻结,说明强化阶段只更新字幕模型,不再更新奖励模型。上方回传箭头标注了梯度近似式,右侧黄色与蓝色漏斗分别对应音频编码器和文本编码器,其输出拼接后进入神经网络得到奖励分数。下方图例用雪花表示冻结、用火焰表示训练,这与正文只微调基线字幕系统的说法一致。该图没有给出具体网络层宽和训练曲线,层宽需要回到正文的 512 维嵌入和隐藏层描述中核对。
奖励模型把音频和文字变成一个分数的具体动作是什么?
奖励模型的输入是一个音频字幕对。白话解释,对比语言音频预训练简称 CLAP,是一类把声音和文字映射到可比向量空间的预训练方法;奖励模型是本文在 CLAP 之上加的小网络,负责把向量变成偏好分数。具体动作是先用预训练的音频编码器和文本编码器分别得到 512 维向量,再把两个向量拼接成 1024 维联合表示,送入隐藏层大小分别为五百一十二和一百二十八的两层神经网络,最后经单个激活单元输出零到一之间的值。
训练时采用孪生结构,也就是同一套参数对偏好句和非偏好句各算 1 次分数。损失由两部分组成,一部分是基于分数差的成对偏好损失,分数差先乘以缩放因子再过逻辑函数取负对数;另一部分是对两个分数平方的正则项,用系数控制强度,减少过拟合并让奖励估计更稳定。推理时不需要成对输入,直接对单个音频字幕对打分。
CLAP × 奖励模型: CLAP 的分工是分别给出音频和文本的向量表示,让跨模态相似可计算;奖励模型的分工是在这两个向量拼接后学一个标量分数,估计人更可能喜欢哪一句。二者搭配的原因是直接用 CLAP 相似度与人意相关较弱且存在模态间隙,组合意义是在冻结的 CLAP 表示上再加两层网络,用偏好数据把相似度校准为更贴近正确性和自然度判断的分数。
另一个组件是长度惩罚。白话解释,奖励投机是指模型钻奖励函数的空子,用超长或重复换高分;长度惩罚是超过期望长度才扣分的塑形项。具体做法是设定期望字幕长度和强度系数,只有实际长度大于期望长度时才按超长比例扣减,否则不惩罚。原文报告初期实验中长度型投机占主导,因此在两个分支的奖励后都插入长度惩罚模块。
奖励投机 × 长度惩罚: 奖励投机的分工是指模型发现拉长句子或重复词语这类表面技巧可以抬高奖励分数;长度惩罚的分工是当生成长度超过期望长度时从原奖励中减去与超长比例有关的项。二者搭配的原因是初期实验中长度型投机占主导,组合意义是把奖励塑形为既看偏好分数又看长度合理性,避免模型用冗长换高分。
两阶段训练各自更新什么,冻结什么,监督从哪里来?
第一阶段训练奖励模型,监督来自人类成对偏好。CLAP 的音频和文本编码器保持预训练状态,实际学习的是拼接后的两层网络参数。原文给出的可复现条件包括训练轮数、批大小、学习率、输出截断区间、正则系数和分数差缩放因子。偏好数据的构造方式在实验设置节详述,这里只需记住奖励模型见过的是哪句更好,而不是标准答案怎么写。
第二阶段用强化学习微调字幕模型,监督来自冻结奖励模型的打分,不再需要标准答案。基线字幕模型参数被更新,奖励模型参数冻结。每次更新需要同一音频下的采样句和贪心句两个分数,梯度方向由二者之差决定。优化器采用自适应矩估计的变体并带权重衰减,先做两轮线性热身,再按固定间隔衰减学习率。长度惩罚的强度在公开数据和自有数据上取不同值,期望长度统一设为 13 个词左右的长度单位。
自批判序列训练 × 策略梯度: 策略梯度的分工是处理不可微的标量奖励,通过采样字幕的对数概率梯度来更新字幕模型;自批判序列训练的分工是用贪心解码结果作为基线,用采样结果相对基线的奖励差来降低梯度方差。二者搭配的原因是音频字幕生成是离散采样过程,不能直接对奖励求导,组合意义是只在采样字幕优于贪心字幕时增强其概率,否则抑制,从而稳定地向高奖励方向移动。
需要指出原文未报告的缺项。论文没有给出强化阶段采样温度、候选数和解码细节的完整清单,也没有报告奖励模型训练时的验证选择标准和早停规则。梯度是否经过截断、字幕模型编码器与解码器是否全量更新,原文只说微调基线系统,未明确分层冻结。因此复现时应先按原文超参数跑通,再把这些缺项当作需要补记的实验日志,而不是默认某种实现。
数据、划分、标注和人评协议是如何组织的?
偏好数据来自两部分。公开部分基于已有评价集,每个标注约有 1750 条 4 人评分,只保留 4 人一致的样本,得到一千多对来自音频字幕评价集和一千多对来自另一公开字幕评价集,按 8 比 2 划分训练与验证。为了覆盖部署场景,另在自有数据上收集四千多条偏好样本和八百多条挑战样本。每段音频用贪心和概率采样生成两句候选,让人选更优句或直接改写;若两句都失败则记为挑战样本。公开数据缺乏这种标记,就用自动评价选出得分最低的 250 段近似为挑战集,并加入随机错配的合成负例,帮助奖励模型惩罚语义不相关输出。
下图是成对偏好标注与主观评测的组织方式,阅读时把它当作数据生产线的示意图,而不是模型结构图。
看图路径: 1. 先从左侧音频加两个候选字幕的输入框看起,确认每次只比较同一段声音的两句话;2. 再看中间标注员的三选一分支,区分选第一句、无法决定和选第二句的走向;3. 最后看右侧如何把一次判断沉淀为偏好句与非偏好句,并注意需要改写时的处理支路
论文图 1。原论文 Figure 1:“Pairwise human preference annotation and subjective evaluation setup”。
结合像素可见内容解释,左侧同时呈现音频、第一句候选和第二句候选,中间是标注员,指令是为给定音频提供字幕偏好。标注员输出三选一,分别是第一句更好、无法决定、第二句更好,右侧再沉淀为偏好句与非偏好句,必要时经过改写。图中像素分辨率有限,不能辨认更细的界面文字,但 3 分支加改写的结构是清晰的。这与正文随机打乱候选顺序以避免位置偏置、按正确性和自然度做选择的描述相互印证。
为说明数据规模与划分条件,整理下表。阅读问题是偏好监督从哪里来、量级多大、挑战样本如何定义,公平条件是只比较同一来源内的构造方式,不跨域比较质量。
| 数据来源 | 偏好对数量 | 额外补充 | 划分与用途 | 筛选与构造 |
|---|---|---|---|---|
| 公开音频字幕评价集 | 1473 对 | 无 | 80/20 训练验证 | 仅保留 4 人一致 |
| 公开另一字幕评价集 | 1555 对 | 无 | 80/20 训练验证 | 仅保留 4 人一致 |
| 自有部署数据 | 基础偏好池 | 4424 条补充加 880 条挑战 | 训练奖励与评测 | 贪心加采样生成后人选或改写,两句皆失败记为挑战 |
| 公开近似挑战集 | 250 段 | 合成随机错配负例 | 评测与增强 | 按自动评价选最低分并加入不相关字幕 |
表后需要解释代价与边界。一致性筛选提高了信号纯度,但丢掉了有分歧的困难样本,可能让奖励模型对模糊情况估计不足。自有数据的改写和挑战标记更贴近部署失败,但收集成本高于公开数据复用。合成随机错配能教会模型拒绝明显不相关,但不能代表细微的自然度差异。原文报告的人评一致性系数在公开和自有数据上均处于中等可接受水平,说明二选一仍有噪声,后续胜率需要在非平局样本上统计并注意样本量。
主结果在什么条件下比较,哪些指标向好,哪些没有?
主比较在 4 个条件下进行,分别是公开数据非挑战集、公开数据挑战集、自有数据非挑战集、自有数据挑战集。比较对象是同一基线在强化微调前后的输出,强化阶段均不使用标准答案。指标方向是词重叠、语义相似、自定义奖励和人类胜率越高越好。关键信息是自动指标与人类胜率并不总是同向,基线在某些词重叠指标上不差,但人更喜欢强化后的版本,尤其在基线错误或不自然时。
论文报告,在挑战样本上强化后的提升更明显,而不是在本来已经写得不错的样本上做边际打磨。自定义奖励分数在多数条件下随人类胜率一起上升,但在公开评价集上出现例外,论文将其归因于该域偏好数据有限。语义类自动指标趋势不一致,有的上升有的波动,这支持了不能只看单一自动分数的判断。定性例子显示,强化后字幕在事件正确性和表达自然度上更接近人工参考,例如把含糊的音乐流派表述改为更具体的乐器演奏,把误认的鼾声改为连续虫鸣背景。
FENSE × 人类胜率: FENSE 的分工是用语义相似加错误建模给出自动分数;人类胜率的分工是让人听音频后在基线句和强化微调句之间二选一,统计强化微调被选中的比例。二者搭配的原因是自动指标方向可能与人意相反,需要并排放,组合意义是用人类胜率检验自动分数是否可信,论文也用加权偏离来度量每个自动指标跟随人意的程度。
为说明偏好数据量与奖励质量的关系,整理下表。比较问题是同样的强化流程下,奖励模型见过多少偏好数据会带来多大人类胜率变化,公平条件是基线结构和强化超参数不变,只换奖励训练数据。
| 奖励训练数据 | 数据量 | 对应强化后人类胜率 | 加权偏离 | 可读出的对照意义 |
|---|---|---|---|---|
| 仅公开音频评价集 | 1178 条 | 43.55% | 未单独报告 | 数据较少时胜率未过半 |
| 公开两评价集合并 | 2422 条 | 47.97% | 未单独报告 | 数据翻倍后胜率提升 |
| 自定义奖励相对其他自动指标 | 不适用 | 不适用 | 4.19 最低 | 与人意跟随最紧 |
| 语义相似等对照指标 | 不适用 | 不适用 | 高于 4.19 | 跟随人意较差 |
表后解释收益与代价。收益是偏好数据从一千一百多条增至两千四百多条时,人类胜率从 40% 多升至接近 40% 八,说明奖励模型质量随数据改善。自定义奖励的加权偏离最低,支持用它代替纯相似度分数。但代价是这些胜率仍接近 50% 上下,不是压倒性胜利,且未胜出项明确存在,例如非挑战集上人类胜率未超过一半,词重叠指标也未全面领先。这意味着方法更擅长纠正失败案例,不保证在所有句子上都更好,也未评测延迟和资源之外的其他部署约束。
去掉偏好规模和长度控制后还能复述什么对照?
论文没有做传统意义上的逐模块剔除,但提供了两类可当作对照的证据。第一类是奖励训练数据规模对照,已在上表展开,数据越多则强化后人类胜率越高。第二类是自动指标与人类胜率的跟随程度对照,用加权偏离度量每个指标在非挑战和挑战两个划分上与人类胜率的距离,自定义奖励距离最小,语义相似次之,基于规则的评价偏离最大。
为说明训练配置的可复现部分,整理下表。阅读问题是 2 阶段各用了多大计算配置,公平条件是按原文如实记录,不推测未报告的采样细节。
| 阶段 | 训练轮数 | 批大小 | 学习率 | 附加控制 |
|---|---|---|---|---|
| 奖励模型 | 70 轮 | 64 | 10-4 量级 | 分数差缩放因子 5,输出截断与正则 |
| 强化微调 | 100 轮 | 128 | 10-6 量级加权重衰减 | 两轮热身后阶梯衰减,期望长度 13 |
| 长度惩罚强度 | 不适用 | 不适用 | 不适用 | 公开域 0.4,自有域 1.0 |
| 基线规模 | 已预训练 | 不适用 | 不适用 | 约 15M 参数,卷积编码器加变换器解码器 |
| 标注规模 | 不适用 | 不适用 | 不适用 | 4 人评一致筛选与自有改写 |
表后需要讲清失败条件。原文明确说初期长度型奖励投机占主导,若不加长度惩罚,模型可能用超长句子刷高奖励而不改善语义。但论文没有报告拿掉长度惩罚后的完整数字,因此不能量化它具体贡献多少,只能说它是稳定训练的必要塑形手段之一。另外,合成负例有助于惩罚明显错配,但对细微自然度差异的帮助未单独度量。挑战集的近似构造依赖自动评价选最低分,可能混入标注噪声,这也是对照结论的外推边界。
哪些结论有直接证据,哪些只是可能,需要什么新验证?
直接报告的是强化后在挑战样本上人类胜率更高,自定义奖励与人意跟随更紧,以及偏好数据增多带来胜率提升。这些有具体胜率、偏离值和定性例子支持。有限解释的是公开评价集上自定义奖励未同步上升,论文用该域偏好数据有限来解释,这属于合理但未做因果验证的解释,需要补充在该域增加偏好数据后的重测才能确认。
未验证推测包括可扩展到任意基线、更大偏好数据必然带来更强奖励、以及更先进强化技术会进一步提升效果。这些在逻辑上可能成立,但本文没有给出跨结构基线、更大规模外推曲线或新算法对照,应表述为待验证。同样,论文未测量误判率、推理延迟、内存占用变化和训练算力成本,因此不能承诺这些量得到改善。轻量基线适合部署是结构层面的判断,不是本轮实验新测的延迟结论。
还有三处冲突与缺口需要标注。第一,自动指标之间方向不一致,不能把某一列数值相同当作同一能力相同,百分点差与相对百分比差也不同,跨指标相减没有意义。第二,胜率只在非平局样本上统计,样本量在公开评测为数百量级、自有评测每人仅数十条,推广时需注意置信区间。第三,原文存在表格与正文细节的表述差异时,应以实验条件段的划分为准,不自行编造新的聚合口径把数字圆成一致。
要复现这套流程,第一步做什么,需要哪些超参数?
复现先做数据,而不是先调模型。第一步按原文复刻偏好管线,对每段音频生成贪心句和采样句,随机打乱顺序后让人按正确性和自然度二选一,允许改写,两句皆失败记为挑战。对公开数据复用已有 4 人评分并只保留一致样本,按 8 比 2 划分;对自有场景记录补充量和挑战量。只在连续原句能逐字覆盖数字时记录规模,不要为凑表发明划分。
第二步训练奖励模型,冻结预训练的音频文本编码器,只训练拼接后的两层网络。保留的关键超参数包括训练轮数、批大小、学习率、输出截断、正则系数和分数差缩放因子。第三步冻结奖励模型,用采样减贪心的奖励差做策略梯度更新字幕模型,奖励先过长度惩罚,期望长度和强度系数按域设置,优化器学习率与衰减按原文设置。评测时组织独立人评,记录胜率时说明是否剔除平局、每组样本量和一致性系数,并同时报告词重叠与语义指标以展示不一致。
关于可用性,本次收到的证据中未发现来源绑定且完成网络状态验证的资源,不得声称代码、模型或数据已公开。复现应按论文文字从零搭建奖励头和强化回路,或用自有基线替代。训练资源方面,原文未报告硬件型号、耗时和显存占用,推理开销也未单独测量,因此预算只能按约 15000000 参数的轻量结构做粗估,实际部署前还需补测延迟与内存。
何时值得尝试这种方法,如何一句话记住它?
当已有字幕系统在困难音频上经常出错或表达生硬,而从头写标准答案成本太高时,值得尝试这种偏好强化路线。它的适用条件是能组织起稳定的二选一标注,能定义期望长度以抑制冗长,且能接受人类胜率接近 50% 上下的渐进改善,而不是期待 1 次解决所有错误。对于资源受限设备,轻量基线加小奖励头的结构比引入外部大模型更现实,但仍需补测真实延迟。
一句话记住,本文用人的选择代替标准答案来定义好坏,用冻结的小奖励模型把选择变成分数,再用贪心作基线的策略梯度把分数变成更好的句子。为避免投机,用超长才扣分的长度项把优化拉回合理长度。为检验可信度,用人类胜率对照自动指标,并用数据规模对照说明奖励质量决定最终效果。下 1 次验证应优先扩大难例偏好、公开完整采样与早停日志、补报训练与推理成本,这样才能把可能有效的趋势变成可部署的结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

