英文题目:TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
会议身份:
conference:interspeech:2026:conference-paper-id:cui26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多模态学习 #多通道 #语音 #全双工语音交互 #轮次切换
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Wenqian Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiao-Hui Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihan Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Haoli Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Irwin King:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
端到端全双工语音语言模型(Full-Duplex Speech Language Models,FD-SLMs)需同时建模用户与助手双通道音频,输入为连续双流语音标记,输出为可随时被打断与重叠的助手语音,难点在于长语音序列稀释语义且文本插入易破坏双通道时间对齐。TurnGuide 先用语音活动检测(Voice Activity Detection,VAD)与停顿合并得到幕间停顿单元(Inter-Pausal Units,IPUs),再用自动语音识别(Automatic Speech Recognition,ASR)获取词级时间戳并容差对齐为回合级图文对。接着在 GLM-4-Voice 主干上做通道级块交织以保留双流交互,同时在助手回合起点交织文本块引导后续语音块生成。相比 Moshi 式按发音时刻逐词插入文本,该回合级聚合保留了完整语义并明确了插入时机与长度。在 Fisher 测试集无条件生成下 TurnGuide 平均 GPT 得分达 8.61,明显高于语音块交织基线(Speech Chunk Interleaving,SCI)的 6.94。结论限于 120 秒电话闲聊延续与离线转写评测,未验证噪声、强重叠与实时流式声码器(vocoder)下的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/jianfch/stable-ts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么值得做?
本文的输入是真实双通道电话对话音频,一路是用户,一路是助手,两路在时间上并行,允许同时说话、抢话、短停顿与简短应答。目标是让一个语音语言模型直接读入并生成这两路语音,既能保持随时可打断的交互节奏,又能说出连贯有意义的内容。输出是延续的双通道语音波形及其对应的离散语音 token,在 TurnGuide 中还包括每轮助手文本作为中间规划。
对刚入门的同学,白话是这样:全双工就是电话两头都可以随时开口,不用等对方说完。全双工语音语言模型就是想学会这种随时听与随时说的能力。端到端的意思是不用人手写如果听到停就说之类的规则,而是把双通道音频一起喂给 Transformer,让它自己从真实对话里学。
必须保留的关键信息是任务边界。论文只研究基于真实双通道数据的端到端路线,不研究靠合成数据与预定义状态切换的级联路线,也不把只做单轮问答的半双工语音助手当作直接对照。学习依赖是先理解双通道时间对齐为何脆弱,再理解文本插入的时机与长度为何关键,最后才能看懂切轮与交错的每一步。
本文解读的输出是一套可核对的复述:数据如何切成 120 秒片段,语音如何变成 token,文本在何处以何种块大小插入,训练与推理条件如何设置,评价如何从音频到文本再到打分。所有数字与条件均以论文原文为准,教学举例会明确标为例子。
有哪些相关路线,它们在同输入下如何对照?
第一条路线是级联式全双工模型。它的输入同样是双通道语音,但中间多了一个状态预测器,负责判断下一刻该开始说还是停止说,语音模型只在被允许时生成。论文提到这类方法的例子包括用开始说与停止说两个状态控制生成,或用是否被打断决定继续说还是保持听。这类路线在处理简单打断时有效,但状态是人事先定义的,学不到真实对话中更细的犹豫、重叠与协作补全。
第二条路线是端到端全双工模型。它的输入就是双通道音频本身,没有显式状态机。论文回顾了用两个 Transformer 分别处理两路再用交叉注意力交互的做法,也回顾了把两路音频交错成一个统一序列用单个大模型建模的做法,以及每步同时预测两路下 1 token 的做法。TurnGuide 属于这一路线,骨干选用 GLM-4-Voice。
第三条路线是文本引导的语音生成。先通过语音识别与语音合成任务把文本与语音表示对齐,再在回答时先生成文本再生成语音,把文本模型的语义能力迁移过来。论文指出在端到端全双工上唯一可比的已有做法是 Moshi 的按发音时刻逐 token 插入文本,但这种做法把语义切得过碎,提升有限。TurnGuide 的不同在于按轮聚合语义再插入。
端到端全双工语音语言模型 × 级联式全双工语音语言模型: 端到端全双工语音语言模型负责同时建模用户与助手两路音频并从真实对话中学习打断、重叠与 backchannel 等行为,级联式全双工语音语言模型负责用独立状态预测器把对话切成有限状态再指挥语音模型何时说与何时停,二者搭配的理由是前者追求自然交互后者追求可控切换,TurnGuide 选择端到端路线并在其上加文本引导,组合意义是在保留自然声学流的同时补足语义规划能力。
下面这张图把前两条路线的输入输出关系画了出来,左侧是带状态预测器的级联结构,右侧是直接建模双通道波形的端到端结构,阅读时注意状态箭头与波形重叠的对应关系。
看图路径: 1. 先看左侧级联分支中状态预测器指向语音模型的两个状态箭头;2. 再看右侧端到端分支上下两条波形如何同时出现重叠与停顿;3. 对照两侧蓝色标注的并行说话与平滑接话等事件名称
论文图 1。原论文 Figure 1:“Illustration of the two types of FD-SLMs.”。
这张图左侧显示下方用户波形先出现介绍伦敦与停止等片段,上方助手波形回应伦敦是首都等内容,中间状态预测器用两个方块表示开始说与停止说。右侧显示上下两路波形并行,标注了并行说话、平滑接话、backchannel、碎片语音与协作补全等事件。它的教学价值是帮你建立判断标准:级联只解决何时开口,端到端还要解决重叠时说什么与如何收尾。论文因此把交互自然度拆成多个细粒度事件评价,而不是只看整体困惑度。
文本插入为什么会破坏双通道对齐?
论文把困难归纳为插入时机与插入长度两个方面。插入时机是文本必须恰好在助手开口时出现。如果插得太早,助手还没听全用户上下文就开始规划,容易产生幻觉。如果插得太晚,助手语音已经先出来了,文本就失去引导作用,变成事后解释。
插入长度是每次插入多少文本也关键。如果 1 次塞入过长文本,助手会自顾自说很久,期间无法及时响应用户新的打断。如果切得过短,语义被打碎,文本规划变成零散词,同样带不动语音质量。论文引用已有全双工文本语音工作说明过短会削弱引导效果。
举例说明,注意这是教学例子而非论文数值:假设助手要说伦敦很好但多雨,若把整句文本提前 4 秒插入,模型可能在用户还没说完问题时就开讲。若把文本拆成每次两个词插入,模型每步只能看到碎片,难以组织因果。TurnGuide 的解决思路是先按合理表达长度切出话轮,再在每轮内按块交错,让文本刚好领先语音一小步。
因此后文方法要回答 3 个可核对动作:如何从音频得到轮边界,如何把词对齐到轮,如何把轮文本排进双通道序列。缺少任一步,时机与长度的结论都无法复述。
TurnGuide 全景:先切轮再交错生成
TurnGuide 分为两个框架。第一个是动态轮切分与对齐框架,负责从原始双通道音频造出文本语音对齐的训练数据。第二个是文本引导的全双工对话建模框架,负责把双通道语音与轮文本排成一个可训练的 token 序列。
沿一个助手样本走完全程有助于建立依赖。输入是一段助手通道音频。先做语音活动检测得到碎片,再按停顿阈值合并成停顿间单元。同时用语音识别得到词序列并提取每个词的起止时间,再把词按时间分到所属单元,形成文本语音对。接着把双通道语音分块交错,把每轮文本分块并插到对应语音块之前,最终得到模型要预测的长序列。目标是让模型在每轮先生成文本块再生成语音块。
下图是全文最重要的方法总览,上半部分是切分与对齐,下半部分是交错与最终序列,阅读时按从波形到 token 的箭头顺序看。
看图路径: 1. 先看上半部分从波形分叉到语音识别与语音活动检测的两条路径;2. 再看词时间戳如何被分组到合并后的停顿间单元下方;3. 最后看下半部分彩色 token 块中文本块插在助手语音块之前的位置
论文图 2。原论文 Figure 2:“Illustration of the TurnGuide approach.”。
这张图上半部分显示顶部波形分别走向语音识别与语音活动检测,左侧识别出英文句子并提取每个词的时间区间,右侧先得到多个小语音框再合并成较大的停顿间单元,下方把词按时间分组到 4 个框中。下半部分显示用户与助手波形经切词后变成蓝色与绿色语音 token,紫色文本 token 按轮插到助手语音块之前,底部是带用户标识与助手标识的最终交错序列。它的教学价值是把时机与长度具象化:时机由轮起始时间戳决定,长度由每轮文本块数与每块 5 个文本 token 控制。
切轮组件:检测、合并、对齐如何计算?
切分从语音活动检测开始。记输入音频为连续波形,检测输出是一组起止时间二元组,每个表示一段有声片段。论文使用 pyannote 库实现这一步。由于直接输出过碎,论文把停顿小于阈值的相邻片段合并为停顿间单元,构造阈值取 0.5 秒。合并后每个单元对应一段连续说话,记为语音段。
对齐需要词级时间戳。论文用 Whisper medium 同时做语音识别与时间戳提取,并用 whisper-timestamped 包提升稳定性。识别输出词序列,时间戳提取输出每个词的开始与结束时间。分组时按词开始时间判断它属于哪个停顿间单元,并引入 0.6 秒容差,把单元起始时间整体前移一点再比较,以纠正第一个词错配到前一单元的常见漂移。最终输出是文本段与语音段一一对应的集合。
话轮 × 停顿间单元: 停顿间单元负责把语音活动检测输出的碎片按停顿阈值合并成可发音的连续段,话轮负责把这些段与词级时间戳对齐成表达完整意图的文本语音对,二者搭配的理由是仅靠声学停顿不够语义完整、仅靠文本又无时间锚点,组合意义是为文本插入提供既不过早也不过晚、长度合理的边界。
需要指出的缺项是论文未报告语音活动检测的帧长与后处理阈值细节,也未给出词时间戳在 Fisher 全量数据上的错配率。因此复现时只能先按 0.5 秒与 0.6 秒两个阈值原样实现,再在验证集上检查轮平均时长是否合理,不宜自行改动阈值并声称等价。
建模组件:两类交错如何排成一个序列?
骨干是 GLM-4-Voice,它包含语音分词器、语言模型与声码器,原文强调其语音文本对齐较强,适合做文本引导。建模时有两类交错。通道级交错负责双通道时间关系,文本语音交错负责单轮语义引导。
通道级交错采用块级而非 token 级。记用户与助手语音 token 序列,先按每块 5 个 token 切分。骨干帧率为 12.5 Hz,因此每块对应 400 毫秒音频。排布时轮流放置用户块与助手块,并在每块开头插入说话人标识 token 以区分通道。论文报告块级在实验中优于逐 token 交错,因此选块级。
文本语音交错只做在助手通道。每轮文本先按每块 5 个文本 token 切分,并在文本块末尾追加结束块 token 以学习动态轮边界。然后按轮首词时间戳算出该文本块应插在第几个语音块,从该轮第一个语音块开始交错。最终序列按用户块、助手块交替,但在有文本块时助手位置变为文本块加语音块。文本与语音块数比取 5 比 5,保证文本生成领先语音生成。
通道级交错 × 文本语音交错: 通道级交错负责把用户与助手两路语音按块轮流排成一个序列以保留跨通道交互,文本语音交错负责在助手通道每轮起始处先排文本块再排语音块以实现先想后说,二者搭配的理由是前者管双人时间关系后者管单轮语义引导,组合意义是让模型同时学会何时接话与说什么内容。
教学例子:假设某轮有 10 个文本 token 与 10 个语音 token,按块大小 5 切分后得到 2 个文本块与 2 个语音块,序列中先出现文本块 1 再出现语音块 1,再出现文本块 2 再出现语音块 2,而不是把 10 个文本 1 次性前置。这就是长度受控的含义。
训练如何组织,损失权重与推理如何对应?
训练数据是 Fisher 双通道电话对话语料,论文称其约 2000 小时,按 120 秒片段预处理,并划分训练、验证与测试集。训练时在 Fisher 上微调 GLM-4-Voice,训练 2 轮,全局批量 256,学习率 4e-6,余弦调度,无权重衰减,热身 20 步。论文还尝试把文本与语音 token 的损失权重从 1 比 1 调到 2 比 1 与 3 比 1,发现更重视文本时语义更好。
推理分两种模式。无条件生成在双通道都加文本引导下训练,推理时同时生成双通道 90 秒延续,可用于双人播客式生成。条件生成只在助手通道加文本引导下训练,推理时给定用户通道音频只生成助手通道,可用于实时交互。两种模式的训练数据构造不同,不能混用。
关于冻结与更新,论文未明确说明骨干哪些参数冻结、梯度是否截断、声码器是否参与训练,因此只能报告它是在 GLM-4-Voice 骨干上按上述超参数训练了全双工交错序列,不从模型名称推定全参数或高效微调。复现时应先按论文超参数跑通 1 比 1 损失,再试 2 比 1。
实验条件:数据、基线、采样与指标方向如何固定?
数据与采样条件需要先固定,否则数字不可比。训练用 Fisher 全量切分后的 120 秒片段,推理从 Fisher 测试集抽 1000 个音频片段,前 30 秒作提示,后 90 秒由模型延续。评价分无条件与条件两种,温度取 0.8、0.9、1.0、1.3 四档。基线包括 dGSLM 双 Transformer 结构、语音 token 交错、语音块交错、按 Moshi 策略逐发音时刻插入文本的复现,以及原始 Moshi 7B。论文说明多数其他端到端模型未完全开源,因此以这几项为主要对照。
无条件生成 × 条件生成: 无条件生成负责让模型同时生成双通道的 90 秒延续以检验双人对话的自持能力,条件生成负责给定用户通道真实音频只生成助手通道以检验听懂再答的能力,二者搭配的理由是前者看长期连贯后者看即时响应,组合意义是分别对应播客式生成与实时交互两种部署形态。
语义评价用 GPT-4o 打分。流程是先用 stable-ts 加 Whisper-large-v3 把双通道音频转写为带句子时间戳的文本,再按时间合并两路文本,最后让 GPT-4o 按 0 到 5 量表打分。由于 GPT-4o 打分偏保守,Fisher 真值文本平均约 3.3 分,论文把 0 到 3.3 线性重缩放到 0 到 10。条件评价又分看双通道全文与只看助手通道两种,后者更聚焦助手自身连贯性。困惑度评价用 Fisher 文本微调模型、GLM-4-Voice 与 Llama-3.1-8B-Instruct 3 个模型对同一转写文本算困惑度,越低表示越像自然对话。
交互评价用 Full-Duplex-Bench 看停顿处理、backchannel、平滑接话与用户打断 4 个事件,指标方向不同,轮次占用率在停顿时越低越好,在平滑接话时越高越好,频率越高越好,分布差异越小越好,延迟越小越好。语料级评价用出现次数、累计时长与平均时长的 Pearson 相关衡量生成延续是否像提示,越高越好。
下表把训练与推理的运行条件整理成可核对清单,阅读时注意批量与学习率只管训练,前 30 秒与后 90 秒只管推理采样。
| 条件 | 指标 | 训练阶段值 | 推理采样值 | 适用对象 |
|---|---|---|---|---|
| 训练轮数与批量 | 轮数、批量大小 | 2 轮、256 | 不适用 | Fisher 微调 |
| 优化设置 | 学习率、热身步数 | 4e-6、20 步 | 不适用 | 余弦调度、无权重衰减 |
| 音频切分与提示 | 片段长、提示长 | 120 秒 | 30 秒提示、90 秒延续 | 训练用前者、推理用后者 |
| 采样规模与温度 | 片段数、温度档 | 不适用 | 1000 个、0.8、0.9、1.0、1.3 | 测试集延续 |
| 交错块大小 | token 数、时长 | 5 个、400 毫秒 | 5 个、400 毫秒 | 双通道与文本块 |
上表说明训练成本由轮数与批量决定,推理行为由提示长度与温度决定,块大小同时约束训练序列构造与推理延迟。它的代价是 120 秒长序列训练显存开销大,复现时需按 256 全局批量折算梯度累积,不宜直接缩小批量并声称同条件。
主结果:语义提升了多少,交互保住了吗?
先看语义主结果要回答的问题是:在相同 Fisher 微调与相同转写打分流程下,按轮插入文本是否优于纯语音交错与逐时刻插入。公平条件是同一骨干、同一测试提示、同一 GPT-4o 流程,指标方向是 0 到 10 分越高越好。下表取代表性温度下的无条件、条件全部与条件助手三列平均附近的值,完整四温度见原文。
| 条件 | 指标 | 语音块交错 | Moshi 逐时刻插入 | TurnGuide |
|---|---|---|---|---|
| 无条件平均 | GPT 评分,0-10 越高越好 | 6.94 | 6.76 | 8.61 |
| 条件全部平均 | GPT 评分,0-10 越高越好 | 5.85 | 5.33 | 6.76 |
| 条件助手平均 | GPT 评分,0-10 越高越好 | 4.94 | 4.67 | 6.48 |
| 总体平均 | GPT 评分,0-10 越高越好 | 5.91 | 5.58 | 7.27 |
| 损失加权变体 | GPT 总体,越高越好 | 5.91 | 5.58 | 7.70,7.79 |
上表显示 TurnGuide 在三列全面领先语音块交错与逐时刻插入,总体从约 5.9 提升到约 7.27,加大文本损失到 2 比 1 与 3 比 1 后进一步到约 7.70 与 7.79。论文报告相对提升超过 30%,且在更大规模预训练的原始 Moshi 面前仍有超过 20% 增益。主要代价是高温 1.3 下纯语音块交错反而最好,说明文本引导在低中温度更稳,高随机性下优势收窄。未胜出项是条件助手列绝对分仍低于无条件列,说明听懂再答比自由延续更难。
语义连贯性 × 轮次转换行为: 语义连贯性负责评价转写后对话是否有意义与上下文衔接,轮次转换行为负责评价停顿处理、平滑接话、打断与 backchannel 是否像真人,二者搭配的理由是只看语义会忽略交互节奏、只看节奏会忽略内容质量,组合意义是同时要求说得对与接得自然。
困惑度曲线进一步支持语义结论,阅读时注意上下排分别为条件与无条件,评估模型分三列。
看图路径: 1. 先确认每子图横轴为温度、无条件与条件生成分上下两排;2. 再比较绿色 Ours 曲线与蓝色与橙色基线在各评估模型下的高低;3. 注意右上子图高温处绿色曲线上扬这一个例外位置
论文图 3。原论文 Figure 3:“Perplexity evaluation of FD-SLMs across tempera- tures using Fisher-text-only, GLM-4-Voice, and Llama-3.1-8B- Instruct as evaluation models.”。
这张图共 6 个子图,上排为条件生成,下排为无条件生成,横轴为温度,纵轴为困惑度。绿色 Ours 曲线在多数子图处于最下方,尤其在 Fisher 文本模型与 GLM-4-Voice 下优势明显,说明生成文本更符合对话分布。需要指出的例外是右上 Llama 评估在 1.3 处绿色上扬,说明跨模型泛化并非每点都成立,不能把末点推广为全程。
交互方面,论文在 Full-Duplex-Bench 上报告 TurnGuide 在多数事件优于基线,温度 1.3 时轮次表现最佳,但在平滑接话占用率与用户打断延迟上有未胜出项。语料级 Pearson 相关上 TurnGuide 与基线接近,说明加入文本流未显著改变对话节奏统计。这支持了既提升语义又保住交互的判断,但延迟是离线评价,不代表端到端流式延迟。
插得太早太晚太长太短会怎样?
该节要回答文本插入时机与长度是否真有因果影响。论文构造 4 种可运行扰动:每文本块 20 个 token 表示太长,每块 2 个 token 表示太短,整体提前 4 秒表示太早,整体推后 4 秒表示太晚,其余训练与评价不变,指标为条件全部 GPT 评分越高越好。
| 条件 | 指标 | 正常 TurnGuide | 太长 | 太短 | 太早 | 太晚 |
|---|---|---|---|---|---|---|
| 0.8 温度 | GPT 评分越高越好 | 6.24 | 5.73 | 6.06 | 4.88 | 5.27 |
| 0.9 温度 | GPT 评分越高越好 | 6.58 | 5.97 | 6.52 | 5.06 | 5.76 |
| 1.0 温度 | GPT 评分越高越好 | 7.09 | 6.30 | 6.73 | 5.64 | 6.06 |
| 1.3 温度 | GPT 评分越高越好 | 7.15 | 6.52 | 6.70 | 6.88 | 6.70 |
| 平均 | GPT 评分越高越好 | 6.76 | 6.12 | 6.52 | 5.61 | 5.94 |
上表显示 4 种扰动全面掉分,太早与太晚掉得最多,平均从 6.76 掉到 5.61 与 5.94,太长掉到 6.12,太短掉到 6.52。这支持时机比长度更敏感的解释:错位让文本与语音失去领先引导关系,过长则让助手 overspeak 而无法响应新输入。限制是这只是固定偏移与固定块大小的对照,未测量连续扫参曲线,也未报告误判率与延迟变化,因此只能说在该扰动下成立。
另一项反证是问答能力保持。论文在 Web Questions、Llama Questions 与 TriviaQA 上比较 TurnGuide 与 GLM-4-Voice,报告两者接近,说明 Fisher 闲聊微调未摧毁原有问答能力。但备注说明这是半双工推理模式,因训练集缺问答数据,全双工模式下仍会生成 Fisher 式闲聊,不能把该保持结论推广到全双工问答。
哪些结论有限制,不能直接推广?
第一,有效性主要在 Fisher 电话对话上验证。Fisher 虽大但风格单一,不能代表会议、客服与嘈杂现场等更复杂场景。论文明确这是局限,补救需要开源更多真实双通道数据,而非仅靠合成数据。
第二,语义评价重度依赖 GPT-4o 自动打分。论文做了 30 对成对比较与 40 条绝对评分的人听实验,报告成对一致 25 比 30,平均意见分上 TurnGuide 仍领先,支持自动分与人判断大体一致。但在分差仅 1 分时一致降到 10 中 7,说明小分差不可靠,不能把 0.1 量级差距当作胜负。
第三,延迟分析是理论计算而非实测端到端。论文按 5 个 token 一块估算分词 0.01 秒、模型 0.3 秒、解码 0.38 秒合计 0.69 秒,并指出声码器至少需 10 个 token 才稳,0.16 秒的 token 级理论延迟只是对照。未测量真实流式首包音频延迟与误打断率,因此不能承诺延迟已优化。
第四,总体趋势不等于每组都成立。高温与跨评估模型下存在例外,语料级相关也只是接近而非超越,阅读时应把最强结论限定为中低温度下的语义提升与多数交互事件保持。
复现先做什么,需要哪些信息条件?
先准备数据与工具。下载 Fisher 双通道音频,按 120 秒切分,划分训练验证测试。用 pyannote 做语音活动检测,用 Whisper medium 加 whisper-timestamped 做识别与词时间戳。资源状态是正文开源声明的唯一依据,本次核对中转写工具 stable-ts 链接当前可用,地址为 https://github.com/jianfch/stable-ts,可用于复现转写打分流程。
再实现切分与对齐。按 0.5 秒合并停顿间单元,按 0.6 秒容差分组词到单元,输出文本语音对。检查每轮平均时长是否能承载完整短句,过碎则先查检测后处理而非改阈值。
再实现交错训练。把语音按 5 个 token 一块、400 毫秒一块交错并加说话人标识,把每轮文本按 5 个 token 一块加结束块 token,按轮首时间戳插入对应语音块之前。骨干用 GLM-4-Voice,按 2 轮、批量 256、学习率 4e-6、余弦调度、热身 20 步训练,先跑 1 比 1 损失再试 2 比 1。推理按前 30 秒提示生成后 90 秒,温度扫 0.8 到 1.3。
还需补的验证是小分差的人听、真实流式延迟与非电话场景泛化。论文未报告检测阈值细节、冻结策略与声码器训练方式,这些缺项应在复现报告中明确标出,不从模型名称推定实现。
何时值得尝试,如何一句话记住它?
当你的全双工语音模型能随时接话但常说空话,且你有真实双通道音频可做词级对齐时,值得尝试 TurnGuide 的按轮先写后说。它用停顿合并定边界,用词时间戳定位置,用块交错保证文本领先语音一小步,从而把文本模型的规划能力搬到语音交互中。
记住它的适用条件:需要可靠的语音活动检测与词时间戳,需要接受块级带来的首包延迟,需要在中低温度下解码以发挥语义优势。若数据全是合成单轮,或部署要求极低延迟逐 token 输出,则应先补数据与声码器再评估。
回到中心矛盾:自然声学流要求双通道严格对齐,语义智能要求文本提前规划,TurnGuide 的回答是把规划粒度从逐时刻放大到轮,让对齐只在轮边界对 1 次,轮内用固定块保持领先。这就是它既提升连贯性又保住轮次行为的原因,也是复现时最不应改动的一点。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


