英文题目:Efficient Training for Cross-lingual Speech Language Models
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.642
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#指令微调 #跨语言 #语音 #语音对话系统
评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:模型报告
👥 作者与机构
- Yan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Qingkai Fang:机构信息未能从会议 PDF 纯文本可靠映射
- Yun Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Feng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言语音语言模型以中英文语音指令为输入,需直接输出目标语言语音答复,难点在于语音序列远长于文本且跨语言语音并行数据稀缺,联合建模易退化文本能力。方法链分三步衔接:先以CosyVoice-300M-25Hz离散语音词元扩展Llama-3.1-8B-Instruct词表实现统一建模,其输出词表进入下一步持续预训练。接着用中英ASR与TTS并行数据做跨模态对齐,并以中英MT数据经文本桥接跨语言并辅以单语指令回放,其产出的CSLM-base进入指令微调。最后以块尺寸为7的块级语音文本交错思维链做监督微调,先产出短文本块再即时产出对应语音块并循环推进。与先产出完整文本再产出完整语音的全链相比,该交错机制保持细粒度对齐并允许播放与生成时间重叠,具有低延迟实际意义。在En→Zh语音对话任务下,CSLM的语音GPT得分为2.95,高于full CoM基线的2.92。该结论适用边界受限于中英双语朗读式合成指令及自动转写评分,尚未验证自发对话噪声场景与更多语言外推。交错生成通过播放与生成重叠降低了延迟,原文以延迟与加速比量化了该推理开销差异。
🔗 开源与复现资源
- 代码相关资源:https://github.com/ictnlp/CSLM — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/tatsu-lab/alpaca_eval — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/deepspeedai/DeepSpeed — 链接可访问(HTTP 200)
- 第三方资源:https://keithito.com/LJ-Speech-Dataset/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.data-baker.com/open_source.html — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/saffsd/langid.py — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决的跨语言语音交互是什么?
这篇论文的输入是人说的语音波形,目标是让大模型能听懂并用语音回答,覆盖单语言对话和跨语言对话。作者交代必须保留的信息包括:语音比文本信息量大且数据更稀缺,小语种更严重;直接级联识别模型加文本模型加合成模型会累积误差并增加延迟;只用语音训练的模型难以获得文本模型的通用任务能力;外挂语音编码器加文本模型的路线能理解但生成语音的质量与多样性受限,且缺乏内在的语音文本对齐。
本文的输出是一个基于离散语音符号的跨语言语音语言模型,命名为跨语言语音语言模型,强调同时做跨模态与跨语言对齐,并在中英文上验证。学习时要先建立任务依赖:先理解语音符号化如何让语音与文本同序列建模,再理解持续预训练如何用识别合成与翻译数据搭桥,最后理解交错生成如何降低延迟并保持一致性。
教学例子仅为例子:比如用户用英文语音问天空是什么颜色,模型需要先形成文本理解,再交替给出文本块与语音块,而不是先等整段文本写完再一次性合成。本文不承诺未测量的误判率或通用成本都改善,所有判断回到原文证据。
附带说明:术语与指标方向速查
为刚入门者保留的速查不计入新证据,只是对前文的重述。离散语音符号指把波形量化为整数编号;联合大模型指词表合并后统一建模;跨模态对齐指语音文本同义接近;跨语言对齐指中英同义接近。
链式模态指按文本问题文本答案语音答案的顺序生成;交错块指小块文本与小块语音交替;连接时序分类对齐器指求词到帧边界的动态规划;时长预测器指预测短序列每个符号重复次数的卷积模块;流匹配指生成频谱的生成模型。
声码器指频谱到波形的合成器。指标方向:相似度、内容打分、自然度越高越好;词错率、字错率、语音文本不一致错率、偏离目标语言比例越低越好;加速比越高越好。教学例子均为例子,不添加无源数值,复述时以原文数字与条件为准。
已有路线按同输入同目标如何对照?
按同输入的连续波形、同目标的语音交互、同监督的语音文本平行语料和同运行阶段的自回归生成来对照,论文梳理了 3 条路线。第一条是只用语音的自回归模型,代表是用离散语音单元按文本模型方式预测下一个符号,优点是能建模语音上下文,限制是语音数据量天然少于文本,通用任务能力难以追平文本大模型。
第二条是模块化模型,用预训练语音编码器连接预训练文本模型,再外加合成模型,优点是能快速获得语音理解,限制是生成语音质量多样性不足且缺乏内在对齐。第 3 条是语音文本联合建模,把离散语音符号扩入大模型词表统一建模,优点是能同时理解与生成,限制是已有工作需要海量数据且跨语言对齐能力有限。语音符号化本身也有分支:用聚类或矢量量化得到语义符号,用残差矢量量化得到声学符号,以及用识别模型监督的语义符号兼顾合成质量。
本文选择第 3 条路线,但强调高效:不用数万到上 10000 小时量级的数据,而是用有限平行语料加翻译数据同时打通两种对齐。相关工作对照不把类别差异当同条件胜负,后文实验会保留实际可运行的基线。
附带说明:易混点的论文特有澄清
论文特有的易混点需要单独澄清,避免初学者误读。第一,合并连续重复符号被原文说明主要作用于声学域而不引入语义损失,不能误以为压缩必然丢内容,实际依赖监督语义符号的设计。第二,随机对相似度高达一半以上不是对齐失败,而是共享表示空间的基线,关键看平行与随机的差距以及与基线的对比。第三,交错生成略优于完整链式的解释是数据长度更匹配持续预训练阶段,而不是交错天然更聪明,块过小反而因边界误差而变差。
第四,跨语言不跑偏的关键是保留文本问题与翻译数据,去掉文本问题后跨语言掉点最大,说明桥接发生在文本模态。第五,1% 数据量的说法是与大数据模型的量级对比,不是精确的逐样本相等,比较时需保留数据集、阶段与指标的一致性,不能把不同测试集的数字直接相减排名。
为什么有限数据下两种对齐难以同时做好?
核心矛盾是统一多语言多模态表示通常需要海量数据,但语音平行数据稀缺且多语言扩展成本高。白话说,模型既要听懂语音与文字是同一句话,又要知道中英文同一意思是同一件事,如果两种对应都要靠大量语音平行句来学,数据量会爆炸。英文名是跨模态对齐与跨语言对齐,前者指同一语言内语音与文本的映射,后者指不同语言间语义的映射。
论文的判断是:跨语言语音直接对齐难,但文本翻译数据相对易得,因此可以用文本做桥,先在每种语言内做好语音文本对齐,再靠文本翻译把语言连起来。这样新语言只要有语音文本平行数据与翻译数据就能接入,降低了数据量与训练难度。教学例子明确标为例子:假设中文语音你好与中文文本你好先对齐,英文语音 hello 与英文文本 hello 先对齐,再靠你好与 hello 的翻译对把两路语音间接连通,实际训练仍需按原文的数据配比与指令格式执行。
方法全景如何沿一个样本走通?
沿一个英文语音问题走完输入到输出,有助于建立依赖。输入是天空颜色问题的语音波形,先经语音切分器变为每秒 25 帧的离散符号并合并连续重复符号,再送入语音文本联合大模型。大模型按交错链式模态自回归输出:可选地先转写文本问题,然后交替输出一小块文本答案与对应的一小块语音答案,直到结束。生成的短语音符号先经时长预测器恢复完整长度,再经流匹配模型生成梅尔频谱,最后经声码器合成波形。
由于已生成的语音块可以边播放边继续生成后续块,形成时间重叠,延迟低于等整段文本与整段语音都生成完的方案。持续预训练阶段负责打底对齐,指令微调阶段负责对话能力与细粒度对齐。下面先看对齐策略图,再进入组件细节。
本段提出比较问题:跨语言与跨模态是否必须靠大量跨语言语音平行句才能打通,本文的桥接假设是什么,公平理解条件是左右语言块内都先做语音文本双向映射。
跨模态对齐 × 跨语言对齐: 跨模态对齐负责在单语言内把语音与文本表示拉近,承担语音识别与语音合成的基础映射;跨语言对齐负责在中英文之间建立语义对应,承担跨语言问答不跑偏到错误语言;二者搭配的理由是直接做跨语言语音对齐数据稀缺,而文本翻译数据相对易得,组合后以文本为桥同时实现两种对齐,新增了小数据下的语言可扩展性。
对齐策略的核心是单语言内语音文本互对齐,跨语言靠文本互对齐,图示把两种箭头分开画,避免误以为语音直接跨语言映射。
看图路径: 1. 先看左右两个色块分别代表一种语言,再看块内文本与语音之间的双向箭头;2. 再看横跨左右语言块的横向双向箭头,确认跨语言只连文本;3. 最后沿单语言语音到文本再到另一语言文本的路径走一遍对齐链路
论文图 1。原论文 Figure 1:“Alignment strategy of CSLM.”。
该图左侧蓝色块与右侧黄色块各代表一种语言,每块内文本条与语音条之间有纵向双向箭头,表示同一语言内的跨模态对齐,横跨两块的横向双向箭头只连两个文本条,表示跨语言靠文本翻译连接。像素上可见文档图标代表文本、麦克风图标代表语音,箭头均为双向,说明对齐是双向学习而非单向投影。这一结构直接对应后文训练数据的 3 类配比:语音到文本、文本到语音、文本到文本翻译。
三个组件各自算什么,如何连成可运行系统?
系统由语音切分器、联合大模型、语音解码器组成。白话解释,语音切分器是把声音波形变成整数编号的装置,英文名是语音切分器;联合大模型是能同时读文本编号与语音编号的语言模型,英文名是语音文本联合大模型;语音解码器是把语音编号变回波形的装置,英文名是语音解码器。
切分器采用监督语义符号方案,词表为 4096 个符号,包含卷积增强的编码器与矢量量化模块,输入梅尔频谱,输出离散向量,连续重复符号合并后送入大模型,原文说明该合并主要作用于声学域而不引入语义损失。联合大模型以指令微调过的 7,000,000,000 参数级文本模型为起点,把语音词表并入原词表实现联合建模。解码器包含两层卷积的时长预测器、条件流匹配模型与高保真声码器,时长预测器预测每个短符号应重复几次,还原完整序列后再生成频谱与波形。
离散语音 token × 语音文本联合大模型: 离散语音 token 负责把连续波形压缩为可与文本同序列建模的离散符号,承担声学语义的量化与去重;语音文本联合大模型负责把语音词表并入文本大模型词表后做统一自回归建模,承担跨模态上下文推理;二者搭配是因为只有离散化后语音才能复用文本模型的知识与指令能力,组合后新增了语音问答与语音续写的直接生成能力。
组合机制紧接说明:切分器解决长度与模态统一问题,联合模型解决知识复用与推理问题,解码器解决波形重建问题,三者搭配后语音问答成为同一自回归过程的不同符号输出,而非外挂合成。
本段提出组件级观察问题:在统一自回归下文本块与语音块如何交替、解码器如何分步还原,公平条件是同一语音问题输入与同一符号频率。
看图路径: 1. 从左下语音波形经语音切分器进入中间联合大模型的向上箭头看输入路径;2. 沿顶部自回归大箭头看文本问题文本答案语音答案交替输出的顺序;3. 再看右侧语音解码器内时长预测器流匹配声码器的自下而上堆叠与回路
论文图 2。原论文 Figure 2:“Model architecture and inference process of CSLM.”。
该图左侧绿色波形经语音切分器向上进入橙绿渐变的联合大模型,顶部绿色自回归箭头向右指示生成方向,中间依次出现文本问题、文本答案、语音答案、文本答案、语音答案的方块,其中文本问题为虚线表示可选转写,右侧蓝色梯形内自下而上为时长预测器、流匹配、高保真声码器,分别向上输出两段已合成的绿色波形。像素可见文本答案块为浅粉色、语音答案块为浅绿色,且语音块与前一文本块之间有连线,表示块级对应。解释是:模型不是先写完整文本再写完整语音,而是写一小段文本就写对应语音,解码器对每段语音独立做时长恢复与合成,从而支持边播边生成。
连接时序分类对齐器 × 时长预测器: 连接时序分类对齐器负责在构造微调数据时给出每个文本词对应到语音帧的时间边界,承担切分交错块的依据;时长预测器负责在推理时把合并去重后的短语音 token 序列恢复为完整长度,承担送入流匹配与声码器的长度还原;二者搭配是因为训练要压缩效率而合成要恢复韵律,组合后新增了高效训练与高质量波形重建的兼顾。
该桥接强调数据构造侧的对齐器与推理侧的时长预测器分工不同但互补,前者用语音编码器表示与连接时序分类动态规划求最优路径,后者用卷积预测重复次数,二者共同保证压缩训练与完整合成的一致性。
两阶段训练与交错数据如何构造?
训练分持续预训练与监督微调 2 个阶段。第 1 阶段从已做指令微调的文本模型出发,合并语音词表,用跨模态、跨语言、单语言文本 3 类数据训练得到基础模型。跨模态数据一半做语音到文本的识别任务,一半做文本到语音的合成任务;跨语言数据用中英翻译双向数量相同且长度中等的样本;单语言指令数据用于减少文本能力退化。
第二阶段在基础模型上用文本指令与语音到语音对话数据训练得到微调模型,同时回放单语言文本指令与翻译数据。关键创新是语音文本交错的链式模态:原方案是语音问题到完整文本问题到完整文本答案到完整语音答案,本文改为只生成一小块文本答案就立即生成对应语音块,循环直到结束。块大小取 7,含义是切分文本时在标点处切开,除非段短于 7 词。
构造时先把文本指令与回答用合成模型变为语音,指令用随机音色,回答用固定音色保证一致,再用连接时序分类对齐器得到词级时间边界,按边界组织成块级交错序列。英文用自监督语音编码器做对齐器,中文用另一语音模型做对齐器。推理时大模型持续输出交错符号,解码器同步合成。
本段提出构造问题:交错块的切分依据从何来、不同音色如何分工,公平条件是同一文本指令与回答对。
链式模态 × 语音文本交错块: 链式模态负责规定生成顺序为先文本问题再文本答案再语音答案,承担让模型先想清楚再开口的过程监督;语音文本交错块负责把长答案切成约 7 词的小块并按文本块语音块交替输出,承担细粒度对齐与边生成边播放;二者搭配是因为整段先文本后语音延迟大且长序列难对齐,组合后新增了低延迟流式合成与更稳的语音文本一致性。
该组合说明链式顺序提供过程监督,交错块提供细粒度与低延迟,二者缺一不可,过小的块会因边界误差累积而损坏性能。
看图路径: 1. 先看左侧指令经随机音色合成变为语音指令的纵向分支;2. 再看右侧回答经单音色合成后与原文一起进入对齐器生成交错回答;3. 最后看两路汇入底部语音到语音微调数据集的箭头确认数据闭环
论文图 3。原论文 Figure 3:“The construction process of the SFT dataset.”。
该图左侧蓝色指令堆经随机说话人合成变为绿色语音指令,右侧蓝色回答堆经单说话人合成变为绿色语音回答,文本回答与语音回答同时进入黄色对齐器模块生成绿色交错回答,最终两路汇入底部渐变色语音到语音微调数据集。像素可见指令与回答为文档图标堆叠,合成模块为黄色圆角矩形,对齐器与合成并列,箭头方向均为自上而下再向中间汇聚。解释是:指令侧追求说话人多样性以增强鲁棒性,回答侧追求音色固定以保证合成一致性,对齐器是连接文本与语音回答的唯一桥梁,其输出的块序列直接决定微调时的监督粒度。
实验用什么数据、基线、指标与硬件?
持续预训练数据全部为开源数据。跨模态英文用多语言有声书子集与大规模语音识别语料,中文用大规模识别语料与语音合成语料;跨语言用翻译评测数据的中英方向子集并筛选长度;单语言指令用包含中英单轮多轮的指令集。监督微调的单语言语音到语音数据用英文指令集及其 machine 翻译的中文版合成得到,跨语言语音到语音数据用双语对照的指令集合成得到,总量为 10 万量级。
评测分基础任务与对话任务。基础任务为识别与合成,英文用词错率、中文用字错率,合成先经时长预测器与解码器成波形再经识别模型转写后算错率。英文识别用大词汇识别模型,中文识别用并行识别大模型。对话任务分单语言与跨语言语音到语音,单语言英文用过滤后的指令跟随评测集共 199 条语音指令,中文从中文评测集选 250 条适合语音对话的指令合成得到。指标有 4 类:内容质量用大模型打分分别评生成文本与语音转写。
语音质量用平均意见分预测模型评自然度;语音文本一致性用识别错率;语言准确性用偏离目标语言比例,文本侧用语言识别工具,语音侧用语音模型检测。基线保留实际可运行的同类离散符号模型与大数据的双语语音模型,以及专用小识别与合成模型。训练用深度学习并行框架的零冗余第 1 个阶段,在 24 张大显存图形处理器上进行。
语音识别 × 语音合成: 语音识别负责把语音转写为文本,承担理解侧对齐的度量;语音合成负责把文本转为语音波形,承担生成侧对齐的度量;二者搭配是因为只测一侧无法证明双向对齐,组合后在持续预训练中以一半样本做识别一半做合成,新增了对跨模态双向映射的完整检验。
该桥接说明识别与合成在持续预训练中各占一半样本,监督来源互为逆过程,梯度路径均经过联合大模型,从而双向约束同一表示空间。
主结果在什么条件下测出,支持什么判断?
主结果按基础对齐与对话能力组织,比较时注意数据集、模型阶段、指标与聚合对象是否一致。基础任务上,本文基础模型与微调模型优于同量级平行数据的同类模型,并接近使用数十到上 100 倍语音文本对的大数据模型,也接近专用小模型。原文报告所用语音量约为大数据模型的 1% 量级,支持小数据同时做好两种对齐的判断,但限制是未在大规模语料上验证上限。
对话任务上,单语言英文与中文的语音到语音评测显示,本文模型语音自然度最好,语音文本一致性好且偏离目标语言比例极低,内容评分好于同量级模型但低于大数据双语模型。跨语言任务上,英到中与中到英仍保持极低偏离率,内容质量相比单语言退化不大,支持跨语言对齐有效的判断。人类评测的总体趋势与自动打分一致,进一步支持自动指标的可靠性,但人类评测只比较内容平均意见分与声学平均意见分,不应把自动指标当成人评的替代。
下面用有逐字证据的相似度表呈现细粒度对齐的直接证据,该表保留必要基线与实际可运行策略。
本段提出比较问题:在同一有声书测试集上,谁的平行语音文本表示更接近、随机配对是否也被拉近,指标方向为相似度越高越好,公平条件为同集合同层平均句级相似度。
| 条件 | 指标 | 本方法 | 比较对象 A | 比较对象 B |
|---|---|---|---|---|
| 平行语音文本对 | 句级表示相似度 | 72.5% | 39.4% | 1.2% |
| 随机语音文本对 | 句级表示相似度 | 56.7% | 未报告 | 未报告 |
| 测试集 | 有声书干净测试集 | 本方法 | 大数据双语模型 | 同量级模型 |
表后解释需要至少 25 个汉字:平行对上本方法明显高于大数据双语模型与同量级模型,支持细粒度跨模态对齐成立;代价或反例是随机对上本方法也有 56.7% 的较高基线,原文解释为持续预训练形成稠密的语言与模态无关嵌入使表示共享,但平行与随机的差距仍大,结合优于基线才能 affirm 特异性对齐,未胜出项是随机对的绝对值并不低,不能单看平行值就断言无共享偏差,未评测边界是该相似度只在英文有声书上报告,未覆盖中文与噪声场景。
反证是否说明翻译数据与交错形式不可少?
消融按去掉翻译数据与改变链式模态形式组织。去掉持续预训练中的翻译数据后,跨语言语音对话的内容质量下降,语音内容错率变差,支持翻译数据对跨语言对齐有贡献的判断,但原文未报告去掉后单语言基础任务的完整变化,不能推广为所有任务必然下降。改变链式模态形式时,块大小为 4 的模型表现差,原文指出低精度对齐会严重损坏性能;完整链式模态模型在内容与一致性上略低于交错模型,且平均带来约 2.93 倍加速的反向对比,即交错更快。
去掉文本问题的模型在所有任务尤其跨语言上大幅下降,支持跨语言对齐发生在文本模态的解释。延迟数字的含义是生成时间对比,交错因可边播边生成而更快,但训练资源、推理开销、输出帧率与实际延迟需分别讨论,总体趋势不等于每步都快。未胜出项是块过小与无文本问题均为负结果,说明细粒度需要准确边界与文本桥梁,缺一不可。
本段提出训练条件问题:2 阶段的批量、学习率、序列长度与轮数如何设置,公平复现需要哪些超参数。
| 阶段 | 批量大小 | 最大学习率 | 最大序列长度 | 训练轮数 |
|---|---|---|---|---|
| 持续预训练 | 288 | 6e-5 | 2048 | 1 |
| 监督微调 | 48 | 1e-5 | 4096 | 1 |
| 预热与调度 | 3% 预热 | 余弦调度 | 未报告 | 零冗余 1 个阶段 |
表后解释需要至少 25 个汉字:该表给出可直接复用的优化设置,持续预训练用大批量短序列学对齐,微调用小批量长序列学对话;代价是原文只报告一轮训练与固定学习率,未报告不同调度下的敏感性,也未报告时长预测器之外的冻结更新细节,复现时应先按此设置跑通,再补学习率与轮数扫描,未测成本时不承诺更快收敛。
哪些边界尚未验证,不能承诺什么?
论文明确的局限是受数据资源与计算资源限制,未在更大规模语音与文本数据上训练,充分潜力暂时未验证。作为跨语言语音模型,仍需扩展到更多语言以拓宽应用。区分直接报告、有限解释与未验证推测:直接报告的是中英文基础与对话任务上的数字;有限解释的是随机对高相似度源于共享表示空间、跨语言对齐发生在文本模态。
未验证推测是扩展到新语言只需平行语音文本与翻译数据的可扩展性,原文给出可能性论述但未实际展示第三语言的完整训练与评测,因此用可能待验证表达。缺失证据不是技术错误,相关性不是因果。未测量每步延迟分布、误判率分解或部署成本时,不承诺这些量都改善。不同指标的差值不能混放,百分点与相对百分比不同,自动打分不能当人类评分。复现时若发现表头与正文冲突,应明确标注冲突而不自行编造划分来圆一致。
复现先做什么,需要哪些可运行条件?
复现先做三件事。第一,准备基座与符号器:获取指令微调过的文本基座模型与监督语义符号器的切分器,词表扩展 4096 个语音符号,合并连续重复符号,最大序列长度按阶段分别设为 2048 与 4096。第二,准备 3 类持续预训练数据:跨模态的识别与合成各半、双向数量相同的翻译数据并筛选长度中等、单语言指令数据防退化,批量与学习率按上表设置,用并行框架在多卡上训练一轮。
第三,构造交错微调数据:文本指令与回答分别用随机音色与固定音色合成,对齐器对英文与中文分别选用对应语音编码器求时间边界,按 7 词块在标点处切分组织成交错序列,再加文本指令与翻译回放训练一轮。时长预测器单独在英文与中文标准语料上训练多轮。
代码当前可用,官方仓库链接状态为可用且返回成功,第三方评测、并行框架、语音数据集与语言识别工具链接同样可用,但要区分代码开源、权重下载与系统可运行:有仓库不等于权重与合成音色可直接运行,需按附录核对模型版本与数据划分。还需补的验证是第三语言接入、噪声与多轮长对话、以及时长恢复后的韵律稳定性。
何时值得尝试,如何一句话记住方法?
当只有有限语音平行数据但有翻译数据,且需要同时做语音理解与语音生成并支持跨语言对话时,值得尝试以文本为桥的持续预训练加交错块微调。一句话记住:单语言内语音文本双向拉近,跨语言靠文本翻译连接,生成时小块文本带小块语音边想边说。复述方法时沿样本走:波形变离散符号去重,联合模型交错输出文本块语音块,时长预测器还原长度,流匹配加声码器成波形,边播边生成降延迟。
适用条件是能获得对齐精度足够的块边界与固定回答音色,否则过小块或无文本问题会明显掉点。不适用时不要强求:若无平行语音文本或无可靠对齐器,细粒度交错难以成立,应先补数据与对齐工具。最终判断回到证据:小数据下两种对齐可同时建立且对话保持低偏离率,但更大规模与更多语言仍待验证。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
另有 10 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses




