英文题目:Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
会议身份:
conference:interspeech:2026:conference-paper-id:zhao26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #偏好优化 #SFT #语音 #语音对话系统
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Mengjie Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Lianbo Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Fujita:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Roman Koshkin:机构信息未能从会议 PDF 纯文本可靠映射
- Yui Sudo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为日语语音指令,输出为可直接送入语音合成的文本,要求保留事实与意图的同时做到简洁口语化与可发声化,难点在于日语敬体谓语、终助词与复句结构使书面长文本合成后冗长机械且不合社交礼貌。方法先冻结语音编码器与大语言模型仅训练投影层以对齐语音文本表示,其输出的语音理解表示进入下一步偏好数据构造。接着用强模型改写与多轮采样构造口语优选与书面劣选对并合成波形验听,再以直接偏好优化联合监督微调拉大两者相对似然并用口语系统提示协同约束。与仅做提示或仅做文本指令微调不同,该机制显式对比口语与书面风格并以散度约束保持指令跟随,因而在保持知识的同时改变注意力与归一化带来的文体分布。在SpokenElyza基准下,KQ-LN调参模型的LLM-as-Judge得分为3.44,高于TopLayers调参模型的LLM-as-Judge得分3.38。结论仅在日语短指令问答与级联式语音对话(Speech Dialogue)场景得到验证,未检验长对话、多说话人与真实用户听感外推。该结论的适用边界受限于日语短指令场景,跨语言与真实听感外推尚未验证。原文披露预训练使用32张H100与偏好训练使用8张H100,但未披露具体训练时长与推理时延成本。从硬件看偏好训练的训练成本为使用8张H100,预训练硬件为32张H100。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出要变成什么样子?
这篇论文的输入是日语语音指令,模型先听懂声音,再输出一段日语文本,这段文本随后要交给语音合成系统念给人听。目标不是把识别或问答分数再刷高一点,而是让输出文本值得被念出来:简短、口语化、没有念不出来的符号,听一遍就能懂。必须保留的信息包括模型结构、偏好数据的构造方式、两个评测基准的对照关系,以及训练时冻结与更新了哪些参数。最终输出是 1 篇能复述方法的解读,重点讲清每一步做了什么、在什么条件下验证。
语音大模型通常由语音识别训练的编码器加上文本大语言模型 backbone 组成,天然继承了书面语的表达习惯:分点、加粗、长难句、敬语与句末表达不自然。日语的书面与口语差异尤其大,体现在礼貌谓语、句末助词和句法复杂度上。直接把书面回答送去合成,听感会显得冗长、机械甚至社交上不得体。论文把要学的文本性质定义为语音值得的:简洁、避免不可发音的人工产物、优先自然的对话流。
语音大模型 × 语音合成: 语音大模型负责听懂语音指令并生成文本回复,分工是理解与组织内容;语音合成负责把文本变成可听的语音,分工是发音与韵律呈现。两者搭配的理由是级联式语音对话仍是主流,文本是中间接口。组合意义在于文本必须可念、无视觉依赖,否则合成后会卡顿或念出符号。
对刚入门的研究生来说,关键动作是区分两个环节:模型写得对不对,以及念出来能不能听懂。事实正确但带表格和链接的回答,在文本评测里可能得分,在听觉评测里就要扣分。论文因此做了两件事:用偏好优化把日语语音大模型的输出从书面风格拉向口语风格,同时构造一个真正用耳朵验过的日语口语评测集。
同类路线在比什么,为什么还缺日语口语评测?
相关路线可以按输入、目标和运行阶段对照。第一类是听觉大模型本身,例如 Qwen2-Audio、SpeechGPT、SALMONN、GAMA,它们处理音频输入并生成文本,覆盖识别、声音事件理解和音乐理解,但主要训练在转写或文本指令数据上,输出偏书面。第二类是端到端语音到语音系统,例如 SLAM-Omni 和 Llama-Omni,能直接生成语音,但论文指出它们常有灾难性遗忘,在 VoiceBench 等评测上不如级联系统,因此生成适合合成的文本仍是关键中间步骤。第 3 类是让文本大语言模型输出更适合说的研究,例如 SpeechWorthy 和 Think-Verbalize-Then-Speak,它们只针对文本大语言模型,没有覆盖语音大模型。
在监督方式上,SpeechPref 的特点是音频优先:从 Databricks-Dolly-15K 过滤掉不适合语音交互的代码和数学推导,让标注者听合成波形后再给偏好。InstructS2S-200K 原为统一语音到语音系统准备,DeepDialogue 则是日常闲聊多轮对话。这些数据集分别对应指令跟随和闲聊口语,论文把它们都转成日语偏好对。需要提醒的是,类别不同不能当成同条件胜负,例如端到端与级联系统的比较条件本就不同。
日语口语评测的缺口是这篇论文的直接动机。广泛使用的 ELYZA-tasks-100 评估日语指令跟随,但面向文本大语言模型,不区分书面与口语风格。论文报告此前据其所知没有日语语音值得对话的评测资源,因此从 ELYZA-tasks-100 派生出 SpokenElyza。资源状态方面,本次收到的证据中没有完成超文本传输安全协议状态验证的可用资源,因此不能声称代码、模型或数据当前已公开,只能按论文文字转述其发布意图。
要解决的矛盾是什么,如何判定说得好不好?
中心矛盾是训练来源与使用方式不一致:语音大模型在识别转写或文本指令数据上训练,学会的是适合阅读的长而结构化的回答;部署时却要把回答念出来,需要适合听的短而连贯的回答。教学例子可以这样理解:同样回答玻璃用打火机加热会不会燃烧,书面版会分节加粗并解释二氧化硅成分,口语版则直接说不会马上燃烧、打火机温度不够、长时间加热可能破裂。前者眼睛看很清楚,后者耳朵听更省力。
判定标准分两层。第一层是内容正确与指令跟随,这是 Elyza 沿用的标准。第二层是听觉适用性,论文为 SpokenElyza 制定了 1 到 5 分的量表:1 分是事实错误或完全不跟指令,2 分是部分错误或不连贯,3 分是内容对但带 Markdown、列表、链接等不适合说的格式,4 分是准确且自然口语、可直接合成,5 分是在 4 分基础上用短句降低认知负荷并带有自然会话标记。自动表层指标作为补充:词数越少越简洁,依存深度越小句法越简单,不可发音字符比例越低越适合语音合成。
这个任务的难点在于不能只变短。实验显示只加口语系统提示会把平均词数压得很低,但偏好训练后的模型词数略有回升,却在依存深度和不可发音比例上更好,说明它在保持完整回答的同时维持了口语结构。理解这一点,才能看懂后文为什么要同时报告主观打分和表层指标。
整体链路如何从声音走到可合成的文本?
沿一个样本走完全程有助于建立定位感。输入是一句日语语音,例如询问玻璃用一次性打火机加热会不会燃烧。语音编码器把波形变成连续表示,浅层投影层把它映射到语言模型的表示空间,大语言模型再结合系统提示生成日语文本,最后由语音合成系统念出。偏好对齐只改变中间文本的风格,不改变听懂声音的能力。
论文配的概览图把这种前后对比画得很直观,阅读时应先看主路径,再看风格差异,最后落到合成环节。
看图路径: 1. 先从底部波形与日语问句出发,沿语音编码器到大语言模型再到文本的向上箭头走一遍主路径;2. 对比中间红色标记的书面回答与上方绿色标记的口语回答,看符号与长度差异;3. 确认顶部虚线框语音合成的位置,理解文本为何是语音对话的中间接口
论文图 1。原论文 Figure 1:“Overview of our speech-worthy alignment.”。
这张图自下而上是声音波形、日语问句、语音编码器、大语言模型、两版回答和顶部的语音合成框。底部箭头表示从声音到文本的流向。中间红色叉号框是书面风格回答,带有结论加粗、编号和星号等符号,右侧英文翻译同样标红;上方绿色对号框是口语风格回答,句子短、无符号,可直接送入顶部虚线框的语音合成。解释这张图时要抓住一点:模型结构没有变,变的是输出文本是否可念。符号密集和段落冗长是听觉负担的主要来源,去掉它们不是美化格式,而是让合成系统能自然发音。
从学习依赖看,后续所有细节都挂在这条链上:预训练解决听懂,偏好训练解决说得像人话,评测集解决如何证明说得像人话。先记住这个顺序,再看具体组件就不会迷路。
模型由哪些部件组成,各自冻结还是更新?
模型结构与 Qwen2-Audio 类似:语音编码器来自 Whisper-large,大语言模型使用 Sarashina-7B,看重其日语能力,两者之间用浅层投影层连接。大语言模型还可接受系统提示等文本嵌入。预训练阶段冻结语言模型和音频编码器,只训练投影层,目的是把语音和文本对齐到共享表示空间。偏好训练阶段则在投影层之外,再选择部分语言模型参数进行风格迁移。
直接偏好优化 × 监督微调: 直接偏好优化的分工是拉开偏好与非偏好回答的相对似然,学会口语与书面风格的对比;监督微调的分工是直接提高偏好回答的绝对似然,学会模仿口语回答。搭配理由是只做模仿容易丢失指令跟随,只做对比可能不稳定。组合后用权重 w 平衡两者,既学对比又保持生成能力。
具体到优化目标,论文使用直接偏好优化加监督微调的组合。直接偏好优化不需要单独的奖励模型,直接优化策略满足偏好。给定偏好对,偏好回答是口语风格,非偏好回答是书面风格,损失通过参照模型约束让策略提高偏好回答的相对似然,同时不偏离参照分布太远,以保护指令跟随能力。监督微调损失直接最大化偏好回答的似然。总目标是加权求和,权重 w 控制偏好学习与监督学习的相对重要性。论文试验了 0.5、0.9、0.95、0.99 四档。
语音编码器 × 大语言模型: 语音编码器的分工是把日语音频变成连续表示,承担听觉感知;大语言模型的分工是消费投影后的表示并生成日语文本,承担推理与表达。搭配理由是两者表示空间不同,需要浅层投影层桥接。组合意义是冻结编码器与语言模型只训练投影层时,先完成模态对齐,再做风格对齐。
参数选择上有两种策略:只微调顶层 4 个 Transformer 层,或微调所有层的键查询与层归一化参数。论文的假设是书面到口语主要是调整注意力模式与输出分布,而不是学习新知识,因此后者更合适。原文没有给出逐层梯度路径的完整实现细节,复现时应以论文文字为准,不从模型名称推定具体实现。
预训练和偏好训练分别用什么数据,如何训练?
预训练是模态对齐阶段。数据使用大规模开源日语语音文本对 ReazonSpeech,加上内部配对的音频文本数据。训练只更新投影层,学习率是 0.0001,训练 100000 步,使用 32 张 H100,每卡批量 16。这个阶段不做风格迁移,只解决能听懂。
偏好训练是风格对齐阶段,数据源有 3 类。第一类是 SpeechPref,大规模语音偏好语料,源自 Databricks-Dolly-15K 并过滤代码与数学,标注者听合成波形后给偏好,论文将其翻译成日语并用内部语音合成模型合成指令波形。第二类是 InstructS2S-200K,原为语音到语音系统准备,指令翻译成日语覆盖多种意图,用预训练检查点生成多个回答,再用 gpt-oss-120B 打 0 到 100 分的口语适合度分数,经过间隔过滤构造偏好对。第 3 类是 DeepDialogue 日常闲聊对话,取首轮翻译并同样做多回答打分与波形合成。
构造偏好对的过滤规则很具体:丢弃最高分低于 90 的指令,最高分回答作为选中回答,只有当备选分数乘以 1.5 仍小于选中分数时才保留为拒绝回答,以保证口语差距足够大。训练时学习率是 0.000005,训练 2 个轮次,每个偏好训练运行用 8 张 H100。论文还使用了口语系统提示,明确要求模型生成适合语音的对话回答。需要指出的是,内部语音合成模型和内部预训练数据的具体构成未在证据中详细报告,这是复现时的缺项,不应自行脑补。
评测集如何从书面题库变成能用耳朵验的基准?
理解评测构造是复现的关键,因为它决定了分数的含义。起点是 ELYZA-tasks-100 的 100 个例子,论文认为其中有些不适合口语交互,例如字符串操作。构造 SpokenElyza 经过 4 个阶段。第一是模态过滤,筛掉本质上不可发音的任务,并把输入指令改写成自然口语问法,得到 36 对指令回答,称为 Elyza,保留原始书面风格回答。第二是口语风格迁移,用 gpt-oss-120B 在严格约束下重写:去掉 Markdown 与列表,把书面谓语转成礼貌口语形式,简化复杂嵌套句,保证只靠听能懂。
有两个例子重写后仍过长,因任务本身复杂而从 SpokenElyza 剔除,剩下 34 个例子;Elyza 保留全部 36 个,因为书面评测不惩罚长度。
Elyza × Spoken: Elyza 的分工是保留原始书面风格回答与评分标准,检验通用指令跟随是否退化;Spoken 的分工是用口语化重写回答与听觉适用评分标准,检验是否适合听。搭配理由是只看一方无法判断风格迁移的代价。组合意义是同时报告两者,才能说明口语提升是否以牺牲书面能力为代价。
第三是母语专家听觉验证,把重写回答用内部语音合成系统合成音频,由日语母语研究者逐条听并修正,保证听觉可懂。第四是评分标准统一,把原来每个例子自带的绝对打分方面转成从满分 5 分扣减的相对扣分,保证跨例子一致。最终用 Qwen2.5-32B-Instruct 做大语言模型裁判,Elyza 用原始侧重事实与指令跟随的提示,SpokenElyza 用听觉适用性量表。表层指标用 Janome 分词计词数,用 SpaCy 日语依存分析算最大深度,并统计不可发音字符比例。
硬件与评估聚合方面,论文报告预训练与偏好训练的卡数和步数,评测分数为各例子 1 到 5 分的平均值。统计显著性方法在证据中没有报告,引用时应说明这一缺项。
口语变好了多少,书面能力掉了多少?
核心比较问题是:在公平使用同一语音输入与同一裁判模型的条件下,偏好训练加口语提示是否在口语基准上显著提升,同时在书面基准上不大幅退化。指标方向是两个基准分数越高越好,满分 5 分。下表整理了论文报告的主要打分,需要同时看两列才能判断 trade-off。
| 模型条件 | Elyza 分数 | SpokenElyza 分数 | 评估满分 | 分数方向 |
|---|---|---|---|---|
| 预训练检查点 | 3.97 | 2.91 | 5 | 越高越好 |
| 预训练加口语提示 | 未报告 | 2.94 | 5 | 越高越好 |
| 直接偏好优化加监督微调 | 3.78 | 2.97 | 5 | 越高越好 |
| 直接偏好优化加监督微调加口语提示 | 未报告 | 3.44 | 5 | 越高越好 |
表后解释要同时说收益与代价。收益是最好组合在 SpokenElyza 上达到 3.44,相对预训练基线 2.91 提升约 18%,论文将其归因于偏好训练与提示的互补。代价是在 Elyza 上从 3.97 降到 3.78,相对下降约 5%。论文认为这在预期内,一是语音大模型本来就不如级联系统,二是 Elyza 面向文本大语言模型,不区分书面与口语风格。未胜出项也要说明:只加提示对预训练模型仅从 2.91 到 2.94,提升很小;只做偏好训练不用提示在 SpokenElyza 上为 2.97,同样有限,说明单靠一端不够。
第二个比较问题是表层形式是否真的更适合合成。指标方向都是越低越好,条件是同一 SpokenElyza 输出。下表显示长度、复杂度和不可发音比例的变化。
| 模型条件 | 平均词数 | 依存深度 | 不可发音比例 | 指标方向 |
|---|---|---|---|---|
| 预训练检查点 | 325.91 | 6.38 | 13.46% | 越低越好 |
| 直接偏好优化加监督微调 | 302.15 | 6.42 | 12.65% | 越低越好 |
| 预训练加口语提示 | 65.53 | 5.06 | 3.69% | 越低越好 |
| 直接偏好优化加监督微调加口语提示 | 77.79 | 4.97 | 3.24% | 越低越好 |
表后解释的关键反例是词数不是越少越好。只加提示把词数从 326 压到约 66,但最好组合词数回升到约 78,同时依存深度最小为 4.97,不可发音比例最低为 3.24%。论文的解释是偏好训练鼓励更完整的回答,同时保持口语结构,而单靠提示可能过度截断。这支持用打分加表层指标联合判断,不能只看长度。
换参数位置与损失权重会发生什么?
消融要回答两个操作问题:微调哪里,以及偏好损失占多大比重。先看参数位置。比较条件是除投影层外,分别微调顶层 4 层与微调所有层的键查询加层归一化,评估指标仍是两个基准的平均分,越高越好。下表保留了论文报告的实际可运行策略,没有删除不利基线。
| 参数策略 | Elyza 分数 | SpokenElyza 分数 | 评估满分 | 分数方向 |
|---|---|---|---|---|
| 预训练基线 | 3.97 | 2.91 | 5 | 越高越好 |
| 顶层 4 层 | 3.61 | 2.91 | 5 | 越高越好 |
| 顶层 4 层加口语提示 | 未报告 | 3.38 | 5 | 越高越好 |
| 键查询加层归一化 | 3.78 | 2.97 | 5 | 越高越好 |
| 键查询加层归一化加口语提示 | 未报告 | 3.44 | 5 | 越高越好 |
表后解释是键查询加层归一化在两边都更好:在 Elyza 上相对下降约 5%,小于顶层微调的约 9%;在 SpokenElyza 加提示时为 3.44,高于顶层微调的 3.38。论文用此支持其假设:风格迁移主要需要调整注意力与归一化方式,而非改写事实知识。未胜出项是顶层 4 层,它在 Elyza 上掉得更多,在口语上也没有反超,说明只动顶层不是更好的选择。
口语系统提示 × 偏好训练: 口语系统提示的分工是在推理时用文字指令要求模型说得简短口语化,不改参数;偏好训练的分工是用偏好数据更新参数,改变输出分布。搭配理由是提示见效快但可能过度截断,训练更根本但成本高。组合意义是论文显示两者叠加在 SpokenElyza 上最好,说明提示与参数调整互补。
再看损失权重 w 从 0.5 到 0.99 的影响,阅读曲线时要先确认坐标与分组,再判断好坏。
看图路径: 1. 先看横轴直接偏好优化损失权重从 0.5 到 0.99 的变化方向;2. 再区分蓝色 SpokenElyza 曲线与橙色 Elyza 曲线的总体走向差异;3. 重点观察蓝色虚线中 DeepDialogue 起点最低但上升最陡的那一条
论文图 2。原论文 Figure 2:“Effect of DPO loss weight on LLM-as-Judge scores. Higher DPO weights improve SpokenElyza performance across all datasets.”。
这张图的横轴是直接偏好优化损失权重,纵轴是性能分数。蓝色代表 SpokenElyza,橙色代表 Elyza;不同线型代表全部数据、DeepDialogue、Instruction200k 和 SpeechPref。可以看到蓝色曲线总体随权重增大而上升,橙色曲线则基本持平或在部分数据集上轻微下降。其中 DeepDialogue 的蓝色虚线起点最低,在权重 0.5 时约 2.25,到 0.99 时升到约 3.1,上升最陡。
论文的解释是学习口语与书面风格的对比比单纯模仿口语回答更重要,尤其在闲聊数据上过强的监督微调会损伤指令跟随。限制是 Elyza 侧趋势不一致,用 InstructS2S 与 SpeechPref 时更高权重会把模型推向口语,受到文本导向评测的惩罚,因此需要仔细调平衡。
哪些结论有边界,哪些验证还没有做?
论文直接报告的是:在给定数据与训练预算下,偏好训练加提示提高了 SpokenElyza 分数并改善了表层指标,同时 Elyza 小幅下降。这是报告层面的事实。有限解释是风格迁移主要靠调整注意力与输出分布,这个解释得到参数消融的支持,但没有逐头或逐层机制验证,只能算支持而非证明。未验证推测是该方法能推广到其他语言,论文明确聚焦日语书面口语差异大的特点,未来工作才探索泛化,因此不能承诺跨语言同样有效。
未评测边界需要逐项点名。SpokenElyza 只有 34 个例子,规模小,平均分的波动可能较大,且证据中没有报告统计显著性或多人一致性。听觉验证依赖内部语音合成系统与 1 位母语研究者,没有报告误判率、延迟、推理开销和真实用户听测,因此不能把自动指标改善等同于人工听感改善,也不能承诺延迟降低。训练资源只报告了卡数、步数和轮次,没有给出总时长与成本,部署成本无法核算。总体趋势不等于每组都成立,例如权重 0.95 处 InstructS2S-200K 就出现例外,引用时应保留这个反例。
要复现这条链路,先准备什么,再跑什么?
复现的第一步是准备可运行的基座:语音编码器用 Whisper-large 的编码器部分,大语言模型用日语能力强的 7B 级模型,论文用的是内部 Sarashina-7B 权重,公开处只有类似模型,因此权重完全一致可能无法复现,需要记录实际使用的检查点。第二步是跑模态对齐预训练:冻结编码器与语言模型,只训练投影层,使用 ReazonSpeech 等日语语音文本对,学习率 0.0001 量级。
第三步是构造偏好数据:把指令翻译成日语,用预训练模型采样多回答,用大模型打口语适合度分数,按最高分不低于 90 且拒绝分数乘以 1.5 仍小于选中分数的规则过滤,再合成指令音频。第四步是用直接偏好优化加监督微调训练,学习率 0.000005 量级,训练 2 轮次,对比权重 0.5 到 0.99,并对比顶层微调与键查询加层归一化两种参数策略。
评测复现要同时跑 Elyza 与 SpokenElyza。Elyza 用 36 个书面例子与原始标准,SpokenElyza 用 34 个口语例子与 1 到 5 分听觉量表,裁判模型用 Qwen2.5-32B-Instruct 或明确记录替代模型。表层指标要固定分词器与依存分析版本,否则词数与深度不可比。关键超参数与信息条件都要保留:冻结范围、损失权重、系统提示文本、过滤阈值和合成语音来源。缺失项是内部数据的具体构成与内部合成器的可获得性,若无法获取,应说明用开源替代后结果可能偏移,不把替代结果当成原文数字的重复。
什么时候值得尝试这套做法?
当你的系统是语音大模型加语音合成的级联结构,且用户抱怨回答太长、念出符号或听起来像念稿时,这套做法值得尝试。它的适用条件很具体:输入是语音,输出文本必须可直接合成,日语或类似书面口语差异大的语言收益可能更明显。操作顺序应是先加口语系统提示看表层指标是否改善,再做小规模偏好训练验证打分是否提升,最后才扩大数据与调权重。不应跳过 Elyza 这类通用指令跟随检查,否则可能把变短误当成变好。
常见误解需要澄清。第一,词数下降不等于口语变好,论文中最好模型的词数反而高于纯提示,关键是依存深度与不可发音比例同时下降。第二,更高的偏好权重不总是无代价,它在口语侧普遍有帮助,但在书面侧可能受惩罚,需要按应用场景选点。第三,没有训练不等于没有计算,数据翻译、多回答采样、大模型打分和波形合成都是真实成本。回到中心判断:这篇工作的价值在于用可复述的过滤、重写与听验流程,把适合听的标准固定下来,并证明对比学习比单纯模仿更适合风格迁移,同时保留了书面能力的大部分。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

