英文题目:F-Actor: Controllable Conversational Behavior in Full-Duplex Models
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.242
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#指令微调 #大语言模型 #语音 #全双工语音交互 #轮次切换
评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:模型报告
👥 作者与机构
- Maike Züfle:机构信息未能从会议 PDF 纯文本可靠映射
- Ondrej Klejch:机构信息未能从会议 PDF 纯文本可靠映射
- Nicholas Sanders:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Niehues:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandra Birch:机构信息未能从会议 PDF 纯文本可靠映射
- Tsz Kin Lam:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理全双工口语对话,输入为用户与系统双路音频流及文本指令与说话人身份,输出为系统侧语音及其对应文本,难点在于边听边说时需实时处理重叠、主动发起、反向通道与打断并按指令计数控制。首先冻结NanoCodec编码器将双路音频量化为离散声学单元并求和接入主干,保留双流时序对齐。然后将说话人嵌入与叙事加行为计数指令拼接为前缀,送入Llama3.2-1B主干联合建模用户与系统双流,为预测提供指令约束。接着以并行线性头同时预测双流码本且推理仅采样系统流合成波形,词级对齐文本流附加音频延迟使文本先行规划语音。在Behavior-SD测试集双实例自对话评测设置下,最佳配置的Narrative分数为2.78,高于Lower Baseline的1.26。与既有仅被动应对用户重叠的方法不同,该模型显式建模系统侧主动反向通道与打断并可计数控制,具有可复现的指令跟随意义。适用边界为英语合成对话、低打断密度与分块离线推理,尚未验证真实噪声、多语言与流式编码,训练成本为4卡A100硬件上约46至48小时。
🔗 开源与复现资源
- 代码相关资源:https://github.com/MaikeZuefle/f-actor — 链接可访问(HTTP 200)
- 模型相关资源:https://github.com/MaikeZuefle/f-actor — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/google/gemma-1 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
自然对话难在哪:为什么要同时听和说?
输入是这篇论文的原文证据与两张官方原图像素,目标是让刚进入语音音频领域的研究生能核对并复述方法,输出是 1 篇按学习依赖展开的中文解读。本文只讲论文实际做的可控全双工语音对话,不引入外部数值。必须保留的信息包括数据规模与硬件、冻结与训练边界、文本对齐与延迟设置、4 类指令评估与关键数字。自然对话的关键性质是全双工,用白话说就是边听边说。英文名是 full-duplex interaction。
人类会重叠说话,会在对方没说完时插入简短的应答声,英文是 backchannel,例如嗯、对,也会打断抢话轮,英文是 interruption。传统轮流式系统一次只处理一方,说完再回,难以复现这种动态。论文要解决的是系统侧主动行为:不仅能鲁棒处理用户的重叠,还要自己按指令决定何时应答、何时打断、由谁先说、用谁的声音、围绕什么话题说。理解这一点后,才能看懂后文为什么用双流建模、为什么要测行为次数相关性、为什么文本流和延迟如此重要。
已有路线如何处理重叠语音与指令?
按同输入、同目标、同监督来对照,论文梳理了 3 条路线。第一是级联式,输入也是双人音频,目标是显式管理轮次,常用分块状态预测、额外预测器或控制词元,行为是可设计的但端到端自然度受限。第二是端到端双流式,以 Moshi 为代表,把用户流和系统流分别编码成离散声学单元,每步都发射含静音的码,再把两路嵌入相加送入语言模型主干,输出再经声码器变回波形,天然支持重叠。
第三是单流交织式,把用户和系统块交替排成一个序列加说话人标记,优点是简单,但受块大小和序列变长限制,不适合真打断。指令跟随方面,BeDLM 用提示和特殊词元控制叙事与说话行为但生成双人而非只系统侧,MinMo 用嵌入控制情感方言语速音色但只在语音合成设置评估,Voila 用文本人物设定加可学习说话人嵌入控制音色与人格但未系统评估且均未开源。
F-Actor 的定位因此是第一个开源、可指令跟随、只生成系统侧、且在学术资源下可训练的全双工模型,并系统评估行为可控性。
论文把可控性拆成哪四个可测问题?
论文把像演员听导演指令这个比喻落成 4 个显式输入。第一是说话人音色,用一段语音的嵌入指定系统听起来像谁,但限制在封闭说话人集合内以防克隆任意真人。第二是对话话题或叙事,给定一段从系统视角改写的故事,要求生成对话贴合该情境。第三是对话行为,用精确计数值指定本段对话中系统应产生的应答声次数和打断次数,例如应答 2 次、打断 1 次,计数与比例可互换,目的是跨模型可比。第四是对话启动,指定由系统先说还是等用户先说。
评估时让 2 个模型实例各带自己的指令互相对话,而不是复述测试集原文,因此文本与音频一致性只在生成内部比较。举例说明:若指令写系统先说为假而对方为真,期望是对方先起话;若双方都设为先说,人工检查显示会出现重叠起话;若双方都不先说,会出现约 1 秒停顿后再有人开口。这 4 个问题把自然度拆成可执行、可计数的检查项。
只训语言模型的全景:输入如何变成双路语音?
沿一个样本走完输入到输出。输入有三部分:系统提示文本指令、系统音频流、用户音频流。表示阶段分 3 路:说话人样本经说话人嵌入模型得到向量再经线性投影,指令文本经语言模型分词器与嵌入层得到提示嵌入,双路音频经冻结的编解码器编码器得到每帧 4 码本的离散单元再经专用音频嵌入层得到音频嵌入。
组件阶段把说话人嵌入、提示嵌入与双路音频嵌入拼接求和作为主干输入,主干是 Llama3.2-1B-Instruct,顶上接 8 个线性音频头分别预测用户 4 码本与系统 4 码本,另保留原语言建模头预测系统文本流。目标是下一步多通道预测,推理时只用 4 个系统音频头采样再经解码器合成波形。训练边界是只更新语言模型与音频头,其他冻结,单阶段完成。
说话人嵌入 × 指令提示: 说话人嵌入负责携带目标音色身份,由 5 秒语音经 ECAPA-TDNN 提取再投影到词空间,指令提示负责携带叙事、起话方和应答打断次数等文本要求;二者搭配是因为音色无法用文字说清而行为数量无法用声纹表达,组合后拼在音频流之前统一作为生成前缀,模型据此前缀决定像谁说和说什么。
本图是模型总览,左侧为输入区,中间为嵌入与主干,右侧为多通道预测放大与解码回路,阅读时先定主路径再看文本与音频分支的汇合与偏移。
看图路径: 1. 先从底部输入区找到系统提示、系统音频流和用户音频流三路输入;2. 再向上看说话人嵌入、提示嵌入与双路音频嵌入如何求和进入主干语言模型;3. 观察右侧放大部分文本先行、音频偏移 2 步以及 4 码本并行的对应关系;4. 最后跟踪音频头经解码器回到波形的闭环箭头
论文图 1。原论文 Figure 1:“Overview of our controllable full-duplex model, which can be prompted to control (i) speaker voice, (ii) conversation topic, (iii) conversational behaviour (e.g., backchanneling…”。
从像素可见底部黄色区并排 3 路输入,绿色说话人支路经线性投影向上,蓝色指令支路经分词嵌入向上,紫色双路音频支路经编码器与音频嵌入向上,三者在求和条处合并进入顶部主干;右侧放大框显示文本行先行、音频行滞后 2 步且每帧有 4 码本,下方小框示例叙事与行为计数,紫色箭头从音频头经解码器指回波形,完整呈现前缀控制与双流生成闭环。
编码器、嵌入与输出头各自算什么?
先讲白话。离散声学单元英文是 discrete acoustic units,简称 DAU,是把波形压成每帧若干整数码的表示,可直接当词预测也可解码回声。主干用 NanoCodec,帧率 12.5 帧每秒,每帧 4 个独立码本、每本 4032 个码,优势是有限标量量化带来码本独立,可并行预测而不需要深度变换器逐层预测,且在语音合成上表现好。用户流与系统流各有自己的一套码本嵌入矩阵,目的是可靠区分说话人,嵌入维度与语言模型词嵌入一致,四码本加双流求和得到每步输入向量。
输出侧每个码本一个线性头,共 8 个,把最后位置隐状态映射到 4032 维对数几率。文本流是可选的系统侧文本通道,先把文本与音频按词或按句对齐填充,再把文本嵌入加到系统语音流上,用原语言建模头预测下一个文本词。音频延迟指文本先走、音频填充等待,例如延迟 2 表示音频生成晚 2 步启动,目的是先定语义再定声。
全双工 × 离散声学单元: 全双工负责同时听和说两条语音流的并发建模,离散声学单元负责把每帧波形压缩成可当词预测的离散码;二者搭配的原因是语言模型只能处理离散序列,组合后模型每步同时读用户流和系统流的单元并预测下一系统单元,从而实现可重叠、可打断的实时对话。
有限标量量化 × 残差向量量化: 有限标量量化把每帧的多个码本做成相互独立的子空间,残差向量量化让后层码本逐层量化前层的残差误差;前者分工是简化建模允许并行预测,后者分工是保真但带来层间依赖,F-Actor 选前者搭配多头并行输出就是为了省掉深度变换器仍能 1 次预测全部码本。
文本流 × 音频延迟: 文本流负责在系统侧同步生成可读文本以稳定语义,音频延迟负责让文本先行 2 个词元再开始生成音频码;搭配理由是语音码信息密度高直接生成易漂移,组合后语言模型先定词再定声,显著降低生成文本与合成语音转写之间的词错误率。
论文报告显示文本流把困惑度从纯音频的较高水平降到 21 到 23 区间,词级对齐加延迟 2 把生成文本与合成语音转写之间的词错误率降到约 7% 点多,而语音自然度保持在 3.4 到 3.5 附近,说明语义先行主要改善一致性而非简单提升音质。
单阶段训练到底冻结什么、监督什么?
训练安排的理由是省资源。做法是语音编码器冻结,只训练语言模型主干与线性音频头,不做大规模预训练也不做多阶段优化。监督来源是 Behavior-SD 的合成双人对话,含叙事、应答与打断标注,训练时把标注的应答打断次数、是否由系统启动、改写后的系统视角叙事拼成指令前缀放在音频流前。损失有两种:只算系统角色或同时算用户与系统角色。文本对齐有词级与句级两种,延迟取 0 到 2,还试验在应答与打断前加特殊词元以帮助计数。
优化在 4 卡 40 吉显存上早停,单模型约 2 天。推理采样温度影响显著,论文以 0.9 为默认报告点。未报告的缺项是梯度是否截断文本头与音频头的联合权重细节、特殊词元在推理时由谁触发的具体解码规则,原文未给出则不猜。下表整理训练成本与数据规模的原文证据,阅读时注意区分总数据量与单模型耗时。
| 条件 | 指标 | 基线或说明 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 训练数据与策略 | 数据量与预训练依赖 | 不依赖大规模预训练与多阶段优化 | 约 2000 小时 | 单阶段微调 |
| 训练硬件与时长 | 耗时 | 4 卡 A100-40 GB | 约 48 小时每模型 | 早停控制 |
| 序列与批量 | 最大长度与批量 | 每卡批量 1 累积 8 步 | 2048 词元 | bfloat16 训练 |
| 参考真值 | 语音质量与一致性 | 真值对话 | 自然度 3.78,词错误率 4.5% | 后续生成对比用 |
表前问题是单阶段低资源方案的成本边界是什么,公平条件是同一数据集与同一硬件类型,指标方向是耗时越短越好、真值分数越高越好。
表后解释是该方案把可复现门槛压到学术实验室可承担的 2 天 4 卡量级,代价是仍需约 2000 小时标注对话且合成数据带有声学局限,真值分数只是上限参考而非可部署承诺,低词错误率 4.5% 来自真值语音而非模型输出。
数据、改写、检测器如何保证可比?
数据用 Behavior-SD,英文多轮双人对话 2164 小时,带叙事、应答与打断标注,用 CosyVoice 合成。论文指出大规模宽带全双工真人数据不存在,尤其缺行为标注,故用合成是务实选择。构造上做三件事。第一是图文对齐,用 Kaldi 强制对齐做词级与句级文本语音对齐,剔除合成偏离转写的不匹配后保留原训练集约 74.4%。第二是指令前缀,把系统视角叙事、启动要求、次数要求拼成提示。
因约 85% 原始叙事以先说话者开头,模型会绕过启动指令只看叙事,因此用 Gemma 改写训练集叙事、用高质量模型改写测试集,把系统名换成你以消除偏置。第三是说话人嵌入,只用数据集中 52 个封闭说话人,防止用于克隆。评估分通用能力与指令跟随两类,前者看语音与文本困惑度、UTMOS 自然度、双人说话时长差、生成文本与语音转写词错误率,后者看启动准确率、音色余弦相似与漂移、叙事贴合度、指令与生成行为数的相关性。
行为计数用 Parakeet 时间戳经网格搜索阈值得到, split 阈值 0.565,打断阈值 0.405,重叠容忍 0.435,在测试集上平均每段仅漏 1.0 个应答与 0.5 个打断。
应答声 × 打断: 应答声指对方说话时插入的短确认如嗯对,打断指抢占话轮改变说话人;前者分工是维持参与感而不夺话轮,后者分工是切换主导权,F-Actor 把二者都写成每段对话的精确计数指令并用检测器回测生成数与指令数的相关性,从而把主动对话行为变成可控可测的变量。
未胜出项是 Silero 与 Vosk 在默认阈值下易错分短应答与重叠,论文因此未采用默认 FD-Bench 设置,这是公平性细节。
主结果:文本流与延迟带来什么收益与代价?
本节测通用建模与 4 类指令跟随,比较对象包括真值对话、低基线、Moshi 与 dGSLM 的轮次统计,以及不同对齐与延迟配置,条件是同一双模型互相对话协议与同一 Parakeet 转写与 UTMOS 流程。指标方向是困惑度与词错误率越低越好,UTMOS 与启动准确率、音色相似、叙事分、行为相关越高越好。核心发现是加文本流全面改善,词级加延迟 2 在系统单角色损失下取得最低困惑度 21.45 与接近最低词错误率 7.59%,语音自然度稳定。
启动准确率从纯音频的接近随机 54% 跃升到 99% 以上,音色相似达 0.54 且漂移不高于真值,叙事分随延迟增加而提升,行为相关中应答约 0.54、打断约 0.25。 下图是人工评估界面截图,展示叙事贴合度的人评如何操作,阅读时注意它只评话题一致而不评流畅度。
看图路径: 1. 先看顶部评分说明只评话题相关性而不评流畅度;2. 再看中部并排的多个对话转写卡片与说话人轮次;3. 观察每张卡片下相关性、一致性、忠实性三条滑动条的刻度
论文图 5。原论文 Figure 5:“Screenshot of the instructions and interface for the human evaluation.”。
像素显示顶部是 3 条标准:是否反映叙事情境、人物事件语气是否一致、是否避免矛盾无关内容,明确只评话题对齐;中部是多个说话人轮次卡片,下方各有相关性、一致性、忠实性滑动条并显示 1 到 5 分,例如左侧卡片三项均为低分而中间卡片出现 4/5 与 3/5 与 4/5,说明标注是逐对话细粒度打分而非整体印象,这支撑后文用人评验证大模型裁判排序的可靠性。 下表是原文 eligible 数字矩阵的直接选择,呈现截断但可核对的局部证据,阅读时需结合后文完整引文表理解全貌。
| a small degradation in narrative | adherence, likely ment with each other, with a | mean Kendall’s τ of |
|---|---|---|
| because the model does not explicitly represent | 0.517 | 240 |
| the interlocutor’s turns, making it more difficult to and a τ = | 1.00 | 3 |
该表后需要说明:原表选择受像素矩阵宽度限制只能呈现三列,完整比较依赖下两张引文整理表;可见片段支持叙事建模中缺显式对方表示会带来小幅下降,人评与机评在系统级排序一致而条目级为中等一致,提示自动分可用于排序但不可替代逐条人评。
| 配置 | 词错误率 | 语音质量 |
|---|---|---|
| 词级对齐延迟 2 系统单角色 | 7.59% | 3.41 |
| 词级对齐延迟 2 系统加用户 | 13.93 秒时长差 | 3.40 自然度 |
| 无说话人嵌入对照 | 13.77 秒时长差 | 3.47 自然度 |
| 真值参考 | 4.5% | 3.78 |
| RVQ 对照 | 11.12 秒时长差 | 2.50 自然度 |
表前问题是最佳可运行配置相对真值与变体有何收益,公平条件是同一互相对话与同一转写评分流程,指标方向是困惑度词错误率越低越好、准确率自然度越高越好。
表后解释是词级加延迟 2 是收益主要来源,去掉说话人嵌入会小幅提升自然度到 3.47 但失去音色控制,RVQ 并行预测虽保持行为相关却把自然度拉低到 2.5,这是为验证架构通用性付出的音质代价,真值仍全面领先故模型未达真值水平。
消融与反证:哪些设置没赢、温度改变了什么?
按问题组织消融。第一问文本是否必要:无文本流时启动准确率仅 54% 接近随机,叙事分 1.50 接近随机叙事基线 1.26,说明文本是启动与叙事的关键。第二问对齐粒度:句级词错误率超 23% 与 17%,词级加延迟 2 降到 8% 左右,支持细粒度对齐。第三问损失范围:只训系统侧困惑度最低但叙事略降,因缺少对方轮次显式表示难以维持连贯。第四问特殊词元:在应答打断前加标记主要改善打断相关到 0.28,应答相关略降,属有限改进。
第五问编码器:FSQ 与 RVQ 行为相近但 RVQ 音质与音色相似明显差,报告为待验证的编解码器影响。温度反证显示 0.6 到 1.0 升高时对话更动态、应答打断更多、说话更均衡、叙事更好,但自然度轻降、词错误率轻升,0.9 为折中。轮次统计上模型每分钟 IPU59.3 秒、停顿 10.4 秒、间隙 3.0 秒、重叠 5.4 秒,接近训练真值与 Moshi,停顿长于间隙符合真实对话统计。
| 行为 | 指标 | 检测可靠性 | 最佳相关 | 稀有性解释 |
|---|---|---|---|---|
| 应答声 | 生成数与指令数相关 | 每段漏 1.0 个,正确率 79.4% | 0.54 | 相对高频故可学 |
表前问题是行为可控的上限与测量误差来自哪里,公平条件是同一 Parakeet 加网格阈值检测器,指标方向是漏检越少越好、相关越高越好。
表后解释是检测器已是最优但仍漏检短事件,0.54 与 0.25 的相关均显著但打断因稀有只能做方向信号而非精确计数,论文局限部分明确生成数系统性少于请求数,训练更高密度数据可能改善但尚未验证。
边界在哪:数量不精确与实时性缺口?
论文直接报告三点局限。第一是行为数量不精确,模型能按指令多则多、少则少,但 consistently 少于请求数,提示词只是方向信号而非强制计数,主因是训练中应答与打断稀有。第二是所用 NanoCodec 暂不支持流式编码器推理,限制部署只能分块而非完全在线生成,总体趋势的离线分数不等于实时延迟已解决。第三是仅验证英语,跨语言配方是否有效待验证,因其他语言缺同类训练数据。
伦理上采取封闭说话人池、纯合成训练语音带合成痕迹、仅研究发布三项缓解,仍强调真实部署需额外保障。复现时不应把低词错误率误读为人评自然度,也不应把系统级排序一致推广为条目级完全一致,条目级 Kendall 相关约 0.507,人评者间约 0.517,系统级为 1.00。
要复现先做什么:代码、权重与关键超参?
资源状态是正文开源声明的唯一依据,当前可用才能写已公开。本次收到的官方资源中代码与模型链接本次可达,第三方 Gemma-1 链接本次未能确认可达,因此只确认 F-Actor 代码与模型当前可用,第三方基座链接状态另行核对。复现先做三件事。第一是取开源仓库的单阶段脚本,确认冻结编码器、只训语言模型与音频头的参数名,避免误解冻。第二是准备 Behavior-SD 并跑强制对齐与系统视角改写,注意保留 74.4% 过滤逻辑与 85% 偏置的改写原因,测试集改写质量更高。
第三是用网格阈值复现行为计数,再跑双模型互相对话评估 4 类指令。关键超参是学习率 5e-5、最大长度 2048、每卡批量 1 累积 8 步、早停耐心 10、推理温度 0.9、top-k40。硬件预算是 4 卡 A100 约 48 小时每模型。若第三方链接不可达,应先用本地已有分词器与对齐模型完成流程,不从模型名推定实现。
何时值得尝试这种做法?
当目标是学术资源下做可控双向语音对话,且需要同时控制音色、话题、应答打断频率与起话方时,值得尝试冻结编码器加词级文本流加 2 步音频延迟的单阶段方案,预期获得接近随机的启动到 99% 以上的跃升与文本语音一致性的大幅改善。若应用要求精确到个数的打断控制、完全在线低延迟或非英语,目前证据不支持直接部署,还需补高密度行为数据、流式编解码与跨语言验证。
重提结果时新增的适用条件是:文本流是必要项而非可选项,延迟是低成本改进,去说话人嵌入换音质是以失去控制为代价,RVQ 并行可行但音质代价大。下一步验证应固定检测器阈值后测行为计数的误判率与延迟,并公开温度之外的采样稳定性分析。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 12 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

