英文题目:DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models

会议身份:conference:aaai:2026:conference-paper-id:40663

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#向量量化 #语音识别 #语音合成 #语音翻译

评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Yuanyuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Dongchao Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiwen Shao:机构信息未能从会议 PDF 纯文本可靠映射
  • Hangting Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiankun Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Helen Meng:机构信息未能从会议 PDF 纯文本可靠映射
  • Xixin Wu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

统一语音理解与生成需同时处理语音到文本的语义映射和文本到语音的波形重建,而声学令牌缺语义、语义令牌缺细节的矛盾使单令牌大语言模型难以兼顾。DualSpeechLM先用理解驱动语音分词器将Whisper-medium编码器输出的连续特征经下采样编码器压缩,再经单码本向量量化转为语义令牌,并经适配器送入冻结文本大模型,在语音识别、情感识别与语音问答提示下计算理解损失回传以缩小模态鸿沟,同时用均方误差重建特征以保留细粒度信息。随后文本大模型以语义令牌为输入预测目标语义序列并施加语义监督损失,为理解与生成提供统一语义表示。再由6层因果Transformer构成的AcousticGPT以条件链随机组合提示隐状态与预测语义为条件自回归生成WavTokenizer声学令牌,并经语音解码器合成波形,从而实现端到端双令牌建模。与单码本声学或语义建模及多阶段扩散或流匹配级联不同,该框架以语义令牌负责理解输入、以声学令牌负责生成输出,避免了多码本复杂性与误差累积,使理解与生成数据增加时均能互相促进而非折中。在LibriSpeech测试集clean子集的自动语音识别任务下,DualSpeechLM-USToken的WER为4.22,低于语义基线的5.70。该结论适用边界受限于约4500小时英语为主的朗读与合成数据验证,对噪声、自发对话及多语言外推尚未验证,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?要同时做懂和说难在哪里?

这篇论文的输入是原始语音波形与任务提示,目标是在同一个文本大模型基础上同时完成理解与生成。理解侧包括自动语音识别、语音到文本翻译、语音情感识别与语音问答,输出是文字;生成侧包括文本到语音、语音转换、语音到语音翻译与语音对话,输出是可播放的语音。初学者容易以为只要把语音变成一种离散记号丢给大模型就行,但论文指出的矛盾是:生成需要丰富的声学细节,例如韵律、情感与音色,而理解更需要高层语义。

声学词元重建好但语义弱,语义词元理解好但丢细节。若强行用同一种词元既做输入又做输出,提升一头常会压低另一头。另一个难点是模态鸿沟:语音与文本的表示差异大,把文本大模型改成语音模型往往需要数万到数十万小时的配对数据做微调,小数据下更难对齐。论文的目标就是用更少的配对数据实现更快收敛,并在统一模型里让两类任务互促而非互损。

后续例子均为教学示意,不代表论文数值:例如同样一句带笑意的你好,理解只需知道字面与情绪类别,生成却要还原笑声的时长与音高走向。

同输入同目标的前人走了哪两条路?

按同输入、同目标、同监督来对照,前人大致分两类。第一类是语音分词路线。声学分词为波形重建优化,生成保真好但在识别类任务上弱;语义分词有两条做法,一是对自监督表示做聚类或向量量化,二是在语音识别模型中间层加量化层。它们对理解有帮助,但论文指出它们没有显式考虑与文本大模型模态的对齐。

多码本设计试图用不同码本分别装语义与声学,但接入大模型时更复杂。第二类是语音语言模型路线。有的用声学词元保合成质量,小数据下理解掉点明显;有的用语义词元保理解,但生成质量受损;还有的在词元后外挂扩散或流匹配加声码器做两三段式合成,复杂度与误差累积增加。

论文的差异在于单码本的理解型分词器直接用文本大模型的理解损失来塑造词元,并把输入与输出解耦为双词元端到端建模,而不是同词元进出或外部多阶段拼接。

论文把问题拆成哪两个可验证的判断?

论文把统一建模的困难拆成两个可对照的判断。第一,若语音词元本身就具备与文本更相近的语义共性,则文本大模型向语音的迁移对齐会更容易,表现为小数据下收敛更快、翻译等依赖文本能力的任务保留更好。第二,若输入用语义强的词元、输出用声学强的词元并联合端到端训练,则可以同时满足两类任务的信息需求,表现为增加任一侧数据时两侧性能都不明显受损,甚至双升。反例也在文中出现:只用声学词元的基线在理解数据增多时生成或理解指标可能恶化,说明单词元存在任务冲突。论文用不同数据配比与消融来检验这两个判断,而不是只报一个总分。

双词元全景:一个样本如何走完输入到输出?

先沿一个样本走完全流程。以上排生成任务为例,输入是提示语音的理解型词元与文本提示,文本大模型先自回归预测目标语音的理解型词元序列,再把该序列送入声学 GPT 模块,结合说话人表示自回归生成声学词元,最后由语音解码器转成波形。理解任务更短:输入语音先经理解驱动分词器变成理解型词元,与任务提示一起进入文本大模型,直接生成文字答案。

传统基线是同一种词元既做输入又做输出,而本文是输入固定为理解型词元、输出固定为声学词元,中间由声学 GPT 桥接。文本主干用参数高效的低秩适配做微调,声学词元与语音解码器是模块化的,可用开源编解码模型实现。 为帮助对照分词器的训练结构,先看分词器架构图的整体走向与损失回传位置,再对应下文组件细节。

看图路径: 1. 先沿语音波形经预训练编码器到下采样编码器再到向量量化的主路径走一遍;2. 再看量化向量分出的两条支路:向上经解码器做重建,向下经适配器进大模型做理解监督;3. 确认重建损失与承诺损失的虚线回传分别连回哪两个模块;4. 记录输入输出符号的对应关系:输入为语音,中间为离散词元,适配后为语言模型可用特征

原论文 Figure 2:The architecture of USTokenizer, which can ex- tract high-level semantic features aligned with…

论文图 2。原论文 Figure 2:“The architecture of USTokenizer, which can ex- tract high-level semantic features aligned with text LLMs via an understanding-driven loss.”。

该图显示语音先经预训练编码器得到连续特征,再经下采样编码器与向量量化得到离散词元;量化向量向上经上采样解码器做重建,向下经适配器映射到大模型输入空间做理解任务监督。图中同时标出重建损失与承诺损失的约束位置,以及理解驱动损失从大模型侧回传到分词器的路径。这解释了为何该词元既保留可重建性又更贴近文本语义,为后文双词元分工提供前提。

分词器内部做了什么?三项损失各管什么?

白话先讲术语。向量量化是把连续向量映射到码本里最近的学得向量,从而得到离散编号;适配器是一个投影模块,把量化向量映射到大模型能接受的特征维度;冻结是指参数不更新,只提供表示或监督。

理解驱动语音分词器 × 文本大模型: 理解驱动语音分词器负责把连续语音变成离散的理解型语音词元并保留可被语言模型使用的语义,文本大模型负责提供理解任务的监督信号与推理能力,二者搭配的理由是直接用问答与识别损失回传来缩小语音与文本的模态差距,组合后分词器输出的特征已对齐到大模型输入空间,后续统一建模更容易复用文本能力。

具体计算上,分词器以预训练语音编码器输出为起点。原文用冻结的语音编码器中间表示作为下采样编码器的输入,经 2 倍下采样卷积与残差卷积块得到连续表示,再经单码本向量量化得到离散编号与量化向量。对称的上采样解码器由量化向量重建编码器特征,用均方误差计算重建损失;向量量化侧加承诺损失以稳定训练。

第三路是理解驱动损失:把量化向量经适配器得到语音提示特征,与文字提示一起送入冻结的文本大模型,按生成目标回答的似然取负对数做损失。最终分词器总损失是三项的加权和,权重为超参数。直观理解是:重建项逼模型别丢信息,理解项逼词元好用,承诺项防止量化漂移。

重建损失 × 理解驱动损失: 重建损失负责让编解码路径还原输入的语音编码器特征以保留细粒度信息,理解驱动损失负责让量化后的词元经过适配器后能完成大模型的理解任务以注入高层语义,前者保细节,后者拉对齐,搭配理由是只保细节会加大模态鸿沟、只追语义会丢掉合成所需细节,组合后通过加权求和取得平衡。

双词元如何分工?声学侧如何条件生成?

白话先讲术语。理解型语音词元是分词器输出的、偏语义的离散编号;声学词元是面向波形重建的、偏细节的离散编号;声学 GPT 模块是一个因果变换器,逐个预测声学词元。

理解型语音词元 × 声学词元: 理解型语音词元分工是做大模型的输入,承载高层语义以支撑识别、翻译、情感与问答,声学词元分工是做生成的输出,承载韵律、音色与细节以支撑可懂且自然的波形重建,搭配理由是两类任务需要的信息层级不同,组合意义是输入与输出解耦后不再强迫同一种词元两头兼顾,各自走不同建模路径。

生成时文本大模型先按提示与输入理解型词元预测目标理解型词元序列,该步受语义监督损失约束;随后声学 GPT 以语义隐状态与说话人嵌入为条件逐个生成声学词元,受声学损失约束。声学 GPT 由 6 个因果块堆叠,每块含因果自注意力与多层感知机,并带残差与层归一化以稳定训练。条件链策略进一步做正则:在训练时以相等概率从提示隐状态、预测的理解型词元序列或二者拼接中采样作为声学侧条件,推理时固定用拼接形式。这样即使预测的语义序列有误,模型仍可依赖更稳的提示侧信息,减少误差传递。

条件链策略 × 声学 GPT 模块: 声学 GPT 模块负责自回归地由语义隐状态生成声学词元,条件链策略负责在训练时从提示隐状态、预测的理解型词元序列或二者拼接中随机采样条件,搭配理由是防止模块只依赖某一种条件而过拟合,组合后推理时用拼接条件更稳健,对不准的语义预测也有缓冲。

两阶段如何训练?哪些冻结、哪些更新?

训练分 2 个阶段。第一阶段训练理解驱动分词器,数据来自多个理解任务,包括基于有声书语料的识别、基于情感对话语料的情感识别与基于大模型自动生成的语音问答。语音编码器与文本大模型侧按原文描述为预训练与冻结,更新的是下采样编码器、量化码本、上采样解码器与适配器,监督来自重建、承诺与理解驱动三项损失。第二阶段训练统一的双词元模型,主干文本大模型用低秩适配做参数高效微调,声学 GPT 与主干联合端到端训练。理解任务用预测文字与真值的交叉熵,生成任务用语义损失加声学损失的加权和。

语义监督损失 × 声学损失: 语义监督损失负责约束文本大模型先准确预测目标理解型语音词元序列,声学损失负责约束声学模块在给定语义条件与说话人条件下准确预测声学词元,前者稳住语义,后者管好声音,搭配训练的理由是若语义预测错了声学模块输入就错了,组合后生成损失同时看住两段,避免误差逐级放大。

原文未完整报告优化器类型、学习率、批量大小与权重取值的全部细节,这是复现时需要补看代码或附录的缺项,不能从模型名称推定。基线侧报告了收敛步数差异:声学基线在多任务下需约 160,000 步收敛,其他配置约 60,000 步收敛,侧面支持理解型输入更易对齐的判断,但这只是训练效率证据,不等于推理延迟更低。

数据、基线与指标如何对应?先看公平条件

数据总量约 4500 小时,覆盖 8 个任务。理解侧用有声书语料做识别,用语音翻译语料的英译德子集做语音到文本翻译,用情感语料做情感识别,用由识别文本经对话模型生成的问答做语音问答;生成侧用复原多说话人语料做文本到语音,用语音到语音翻译语料的西英与法英子集做文本到语音翻译的子任务,用大规模有声书子集做语音转换并在多说话人语料上评测,语音对话由问答文本经商用语音合成接口转成语音构建。

对比的 4 个同配置变体是:输入输出均为声学词元的声学基线、输入输出均为自监督语义词元的语义基线、以自监督语义词元为输入加声学输出的双词元版本、以理解型词元为输入加声学输出的完整版本。外部对照包括更大数据与全量微调的统一模型,但数据量与微调方式不一致,只能看趋势不能当同条件胜负。客观指标方向要先记牢:错误率越低越好,翻译质量分、情感准确率、说话人相似度、语音质量分与对话评分越高越好。

主观评测对合成与转换从语音质量与说话人相似 2 维打分。资源状态方面,本次收到的代码链接经校验当前可用,预训练语音编码器链接当前可用,可作为复现起点,但权重与完整脚本仍需以仓库实际内容为准。

主结果:理解与生成能否同时变好?

比较的问题是完整方法相对声学基线与语义基线是否在理解与生成上同时占优,指标方向是否一致。公平条件是后两者共享主干与数据规模,外部大模型仅作规模参照。理解看识别错误率越低越好、翻译与问答分越高越好,生成看相似度与质量分越高越好、合成错误率越低越好。语义输入加声学输出的解耦设计意图是同时保住可懂度与自然度,但音色保持仍受说话人表示与数据影响,不能推广为所有条件下全胜。

为检验数据配比下的互促还是互损,下图在固定一侧为 300K samples 时观察另一侧数据量变化时的错误率趋势,横轴为 Generation Data (x100K) 或 Understanding Data (x100K),纵轴为 Performance,度量为 generated speech WER (%) 与 speech recognition WER (%),越低越好。上排为生成语音错误率,下排为语音识别错误率,蓝色为 Ours,橙色为 Baseline。

看图路径: 1. 先确认上排为生成任务的错误率越低越好,下排为理解任务的错误率越低越好;2. 再对比每组内蓝色本方法柱与橙色基线柱的高低关系;3. 观察固定一类数据为 30 万条时,另一类数据从 3 到 15 变化时两侧柱子的下降趋势;4. 重点看右上基线柱在理解数据增多时反而升高的异常与本方法柱持续下降的差异

原论文 Figure 1:Comparison of baseline and our model on genera- tion and understanding tasks with different…

论文图 1。原论文 Figure 1:“Comparison of baseline and our model on genera- tion and understanding tasks with different ratios of genera- tion and understanding training data.”。

像素显示上排两幅为生成错误率,下排两幅为理解错误率。上排左图在生成数据为 3(x100K)、5(x100K)、10(x100K)、15(x100K) 时,蓝色生成 WER(%) 为 55.3%、22.9%、14.8%、11.2%,橙色生成 WER(%) 为 70.2%、41.0%、30.6%、25.7%。上排右图在理解数据为 3(x100K)、5(x100K)、10(x100K)、15(x100K) 时,蓝色生成 WER(%) 为 55.3%、24.4%、18.8%、15.7%,橙色生成 WER(%) 为 70.2%、58.8%、100.9%、99.6%,其中橙色在 10(x100K) 与 15(x100K) 处升高并停滞。下排左图在生成数据为 3(x100K)、5(x100K)、10(x100K)、15(x100K) 时,蓝色理解 WER(%) 为 6.1%、6.0%、5.8%、5.6%,橙色理解 WER(%) 为 28.5%、30.8%、30.3%、33.6%,其中橙色出现升高。下排右图在理解数据为 3(x100K)、5(x100K)、10(x100K)、15(x100K) 时,蓝色理解 WER(%) 为 6.1%、4.0%、3.8%、3.5%,橙色理解 WER(%) 为 28.5%、21.0%、16.3%、15.0%。这支持双词元缓解任务冲突的判断,但也提醒总体趋势不等于每组都单调,基线的恶化幅度受任务与配比影响。

拿掉哪一块会坏?消融支持什么、反驳什么?

要回答的问题是理解驱动损失、重建损失、语义损失与条件链策略各自是否必要,拿掉后哪类任务先变差。比较条件是同一主干与同一数据,仅去掉目标组件,指标方向与主结果一致,理解侧看识别错误率越低越好、翻译与情感问答越高越好,生成侧看合成与转换三元组与翻译质量变化。

消融条件识别干净集错误率识别难集错误率英译德质量情感准确率问答质量
完整方法4.229.7119.7460.9244.38
去理解驱动损失4.8110.4314.8152.737.67
去重建损失4.7410.4618.545.2146.44
去语义损失4.319.6118.6760.3543.86

上表整理原文理解侧消融结果,去掉理解驱动损失后理解全面下降,问答与翻译掉得最多,支持该损失负责拉近语音与文本语义空间。去掉重建损失后情感明显变差但问答略升,说明重建保细节却可能牵制语义对齐,存在权衡。去掉语义损失后理解仅轻微下降。

下面继续看生成侧消融,重点是合成与转换三元组及翻译质量是否失稳,条件与主干保持一致。

消融条件合成干净集三元组合成难集三元组转换三元组西译英质量法译英质量对话质量
完整方法0.90/9.25/3.860.88/9.88/3.820.80/10.16/3.4626.7723.8216.24
去理解驱动损失0.90/8.59/3.860.88/9.45/3.810.82/9.90/3.3924.0322.7315.59
去重建损失0.83/52.50/3.020.81/54.24/2.960.79/26.08/3.3332.4329.4617.09
去语义损失0.80/167.56/3.850.85/175.11/3.830.80/264.53/3.450.090.070.15

上表整理原文生成侧消融结果,去掉理解驱动损失后翻译与对话下降,支持随机条件之外的语义对齐对依赖文本大模型能力的任务重要。去掉重建损失后合成错误率大升但翻译反而略升,与理解侧权衡一致。

去掉语义损失后合成与转换错误率升至上百且翻译质量接近于零,证明先预测准语义序列是声学生成的前提。去掉条件链策略仅用于合成与转换,原文报告两项均下降,支持随机条件正则有助于稳定声学预测,但该策略未在翻译与对话上验证,不能推广到所有生成任务。

哪些结论还不能下?边界与缺项是什么?

论文直接报告的是在给定中英文混合任务与约 4500 小时数据下的相对提升,有限解释是模态共性与双词元分工带来了互促,未验证的推测不应写成定论。例如更大多语种、跨域噪声与长时对话下的泛化原文未充分展开,未来工作也只计划向更大更多样数据扩展。缺失证据不是技术错误:原文未测量误判率分布、推理延迟、实时率与训练算力成本,因此不能承诺延迟或成本同时改善,收敛步数少也不等于每步更快或显存更少。

指标口径也需注意:问答与对话同时用自动分与模型打分,两者视角不同,不能把自动分当人评;不同指标的差值不能混到同一列比较,百分点与相对百分比含义不同。数据构建上问答与对话部分依赖自动生成与合成语音,可能引入噪声与口音偏差,复现时应单独检查这部分质量。

要复现先做什么?最小可运行链路是什么?

先做可运行性检查。代码仓库当前可用,先确认仓库中的分词器训练、双词元训练与推理脚本是否齐全,再确认预训练语音编码器与声码器权重能否下载,不要把代码可见等同于权重可下载或系统可一键运行。最小链路建议分 3 步走:第一步复现分词器,用小规模识别与问答数据验证理解损失能否下降、重建误差是否收敛;第二步冻结分词器复现理解任务,核对识别错误率与翻译质量的方向。

第 3 步再接声学 GPT 做合成,核对合成错误率、相似度与质量分是否同步改善。关键信息条件要保留:单码本量化、2 倍下采样、六块因果声学模块、低秩适配微调、推理用拼接条件。超参数方面原文只给出损失加权的符号形式而未公开全部取值,复现时以代码默认值为准并记录改动。若要换主干或换声学编解码器,应 1 次只换一处,先在原配比上对齐后再做扩展,避免把多处改动混成一个结论。

何时值得尝试这种双词元思路?

当你的统一模型出现一头好一头坏,且小数据下对齐困难时,值得尝试把输入换成偏语义的理解型词元、把输出换成偏声学的声学词元,并用语义损失先稳住前者、用声学模块加条件链策略稳住后者。分词器侧同时保留重建与理解监督,前者保合成细节,后者保文本能力迁移。若任务更偏推理与翻译,可适当加强语义对齐;若任务更偏情感与音色还原,则不要轻易去掉重建。还需补的验证是跨域、多语种与真实人评,以及延迟与成本的实测,再决定是否上线。记住这不是同一种记号包打天下的故事,而是让懂的负责懂、让说的负责说,再用联合训练把两者连起来。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总