Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue

📄 何时闭嘴何时开口分开学:用真实重叠教会状态机的全双工配方 英文题目:Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue 一句话:针对合成带学不会真实打断与重叠时序的问题,该工作用人人语音学轮次、用可配人机文本保语义并以事件规则与来源感知损失缝合,在受控词量下轮次 F1 提升约 0.31、放量后语义距基座仅差 0.09,代价是单带仍压缩连续时间与副语言。 标签:#语音交互 | #大语言模型 | #流式处理 | #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yihang Li:Kyoto University Chenhui Chu:Kyoto University 💬 毒舌点评 把轮次控制与语义解耦、用真实人人对话学打断的思路切中了神经有限状态机合成数据的要害,事件引导的规则序列化做得扎实可扩展。但合成基线复现自由度偏大且语义评估口径不对等,暂停处理的激进策略也暴露了单带序列化压缩连续时间的固有代价。 📌 核心摘要 全双工对话需要同时处理打断、反向通道和地板争夺,而神经有限状态机将状态转换与回复生成序列化到单条因果带上,却依赖大语言模型合成难以还原真实声学时序的训练带。本文提出解耦数据方法,用真实人人口语对话学习轮次控制,用可配置的人机文本对话塑造语义,并以全规则的事件引导变换加来源感知校准损失实现联合训练。在控制训练token量的对比中,该方法在轮次F1与VoiceBench上均大幅超越合成基线,扩大到按比例上采样混合后语义基本恢复至基座模型零样本水平。实际意义在于为基于有限状态机的全双工系统提供了可扩展到任意人人语料且无需大语言模型标注的配方。主要边界是单带离散化必然损失连续时间与副语言信息,且当前仅覆盖双人问答场景。 🔗 开源与复现资源 代码: 仓库链接为 https://github.com/Liyht/def-fsm 模型权重: 论文中说明模型与代码均在 https://github.com/Liyht/def-fsm 获取,未提及独立HuggingFace或ModelScope权重链接 数据集: 采用Switchboard语料和Fisher语料作为人人口语对话,未提及获取链接,采用ShareGPT52K数据集作为人机对话,链接为 https://huggingface.co/datasets/RyokoAI/ShareGPT52K,另用GPT-4-Turbo生成1500个合成对话作为基线,未提及公开链接 Demo: 论文中未提及 复现材料: 基础模型为Qwen3-4B,人人与人机按1比1 token量混合,Fisher与Switchboard按4比1混合,来源感知校准损失设置tau为1且alpha为0.6,上下文长度为1024 token,峰值学习率为1.0e-5且warmup比例为0.03,token匹配设置训练至多300步,放量混合设置训练至多700步,细节见Appendix B.1和Appendix D 论文中引用的开源项目: Faster-Whisper,链接为 https://github.com/SYSTRAN/faster-whisper,Kokoro TTS,链接为 https://github.com/hexgrad/kokoro,另提及Whisper-Turbo和SimulStreaming和Silero VAD和Qwen3-32B,未提及对应链接 资源可达性验证:code=temporarily_unreachable;model=temporarily_unreachable;dataset=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 人为什么能边听边想边插话? 想象你和朋友争论金星和火星哪个更大,你刚说到一半,对方轻轻嗯了一声,你自然继续讲下去。可当对方突然提高声音纠正你,你会立刻停下让对方说完。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 879 words

DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

📄 说了像本人,不等于接得住话:角色暗示里的时机考验 英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents 一句话:论文用同一段用户语音对比显式规则与人设暗示下的接话时机,发现全双工模型推断代价最高达 9.7 个百分点,而内容像角色的模型仍做不出打断与附和,且安全冲突下仅一例过半守住安全侧。 标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Puneet Mathur:University of Maryland College Park, USA Dinesh Manocha:Project Page: 💬 毒舌点评 把显式打断规则换成悲伤辅导员与911接线员的人设暗示来考全双工话轮控制,这个切口抓得准且泄漏控制做了实事。遗憾在于6个系统绝对指令遵从率普遍低于50%,近零差距模型的细排名在阈值抖动下并不稳,安全层级结论更多是30例小样本警示而非定论。 📌 核心摘要 全双工语音智能体需要根据角色推断何时倾听、附和、打断、让出或保持话轮,现有评测多只给显式话轮指令。论文提出DuplexSpeechBench-IFEval(DSB-IFEval,隐式指令遵循评测),用同一用户音频搭配5种条件协议对比显式执行与人设暗示执行。方法上以8个行为对比角色、6类会话探针、程序化合成与双通道实时编排为流水线,以确定性指令遵从分数Instruction Adherence Score(IAS,指令遵从分数)与大语言模型评价的人设内容分数Persona Adherence Score(PAS,人设遵从分数)解耦内容与时机。6系统实验显示全双工架构的蕴含差距Entailment Gap(蕴含差距)达9.7个百分点,而回合制系统内容跟随强但打断与附和几乎为0。安全冲突下仅MiniCPM-o-4.5在语义层60.0%选择安全侧,且IAS非零者仅2个系统。该基准为角色化实时语音部署提供了可复现的层级检验,但局限在英语双轮合成语音与小规模安全集。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 790 words

Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations

📄 想练好一句难开口的话,机器得先学会怎么“演人”:Conversation Coach 的延迟与演技取舍 英文题目:Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations 一句话:为让管理者在真实开口前完成高保真语音演练,Conversation Coach 在同一批合成场景下对比端到端与级联两种语音架构,用 3 倍时延与 8 倍成本优势换来对人格一致性的显著让步,并在 4 万名管理者的半年部署中验证了面向困难对话的选择性使用。 标签:#语音交互 | #端到端 | #语音合成 | #大语言模型 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Fanyou Wu:机构信息未在 arXiv HTML 中可靠披露 Suraj Maharjan:机构信息未在 arXiv HTML 中可靠披露 Ainur Yessenalina:机构信息未在 arXiv HTML 中可靠披露 Dennis Xu Chen:机构信息未在 arXiv HTML 中可靠披露 Rahul Srivastava:机构信息未在 arXiv HTML 中可靠披露 Srinivasan H. Sengamedu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把端到端语音到语音与级联流水线的取舍放在真实的4万人规模部署中验证,并给出可复用的时延、成本与角色一致性量化对比。短板是核心评估依赖148个合成场景与大语言模型作为评委,且未开源任何代码、模型或数据,导致外部几乎无法复现或检验其声称的人格一致性优势。 ...

2026-09-02 · 更新于 2026-09-04 · 6 min · 1120 words

Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

📄 别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读 英文题目:Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation 一句话:论文把 TTS 友好文本生成定义为偏好对齐问题,用仅 40 个权重的可解释特征线性奖励 FaRM 替代数十亿参数黑盒奖励模型,在仅 10 个样本时仍保持稳定,并在启发式、TTS→ASR 往返与人工听感三重验证下取得最均衡的友好度与有用性权衡,代价是输出偏长且目前仅验证英语双域单引擎。 标签:#语音合成 | #强化学习 | #语音交互 | #大语言模型 | #数据集 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Thibaut Thonet:机构信息未在 arXiv HTML 中可靠披露 Jos Rozen:机构信息未在 arXiv HTML 中可靠披露 Laurent Besacier:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把语音合成(Text-to-Speech,TTS)友好文本生成显式定义为可度量的偏好对齐问题,并用可解释特征线性奖励替代黑盒奖励模型,在仅 10 个样本的低数据 regime 下仍能维持稳定提升,工程链路完整且验证了廉价启发式与昂贵链路及人工听感的一致性。短板是数据集均为合成或半合成且仅覆盖英语咖啡点单与菜谱两域,启发式权重与 TTS→ASR 链路均高度依赖单一引擎与正则设计,输出偏长问题仅做单点权重干预,外推到真实多引擎、多语言部署的可信度不足。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1309 words

Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework

📄 会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来 英文题目:Enabling Proactive Spoken Turns via a Generalized Style-Aware Full-Duplex Framework 一句话:为解决全双工对话中抢话时机与回答质量难以兼得的问题,论文用轻量控制器 LPS-TC 显式解耦时序与内容、并以风格指令控制打断与附和,在 WildTurn 真实对话上显著提升主动交互的时机与质量,但中间风格与跨语种泛化仍有明显代价。 标签:#语音交互 #语音大模型 #流式处理 #数据集 #基准测试 评分:7.3/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Tianrui Pan:机构信息未在 arXiv HTML 中可靠披露 Qinglin Zhang:机构信息未在 arXiv HTML 中可靠披露 Chong Deng:机构信息未在 arXiv HTML 中可靠披露 Luyao Cheng:机构信息未在 arXiv HTML 中可靠披露 Qian Chen:机构信息未在 arXiv HTML 中可靠披露 Wen Wang:机构信息未在 arXiv HTML 中可靠披露 Jie Tang:机构信息未在 arXiv HTML 中可靠披露 Gangshan Wu:机构信息未在 arXiv HTML 中可靠披露 Jie Liu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用轻量解耦控制器 LPS-TC 把 timing 与 content 生成分离,并配套 2981 小时真实对话的 WildTurn 与 chunk/turn 双层评测,解决了全双工里“抢话时机 vs 回答质量”长期 trade-off 的工程痛点;短板是核心贡献高度依赖 GPT-5.2 生成的风格指令与词表匹配的 BC 标注,跨语种和合成数据泛化证据薄,且通篇未给出代码、权重与数据集获取方式,可信度与复现性被开源缺失拖累。 ...

2026-09-01 · 更新于 2026-09-04 · 2 min · 261 words

Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness

📄 0.76 分里的诚实:当语音失灵时,眼睛如何泄露下一句话的时机 英文题目:Predicting Turn-Taking Outcomes in Multi-Party Conversation: Interpretable Modelling of Speech and Gaze Dynamics with Interpersonal Closeness 一句话:在四人自由对话中用转折前 3 秒的响度与符号化注视预测间隙还是重叠,论文以弹性网络逻辑回归证明注视能在噪声下提供稳定但幅度有限的互补增益,代价是刻意稀疏的语音特征与小样本实验室数据把天花板压在了 0.76 的 ROC AUC。 标签:#语音交互 #可解释性 #模型评估 评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5 👥 作者与机构 Mark Dourado:Research & Exploration, GN Store Nord, Ballerup, Denmark;Department of Architecture, Design and Media Technology, Aalborg University, Copenhagen, Denmark Karim Haddad:Research & Exploration, GN Store Nord, Ballerup, Denmark Henrik G. Hassager:Research & Exploration, GN Store Nord, Ballerup, Denmark Stefania Serafin:Department of Engineering Technology and Didactics, Technical University of Denmark, Kongens Lyngby, Denmark 💬 毒舌点评 用可解释的注视二元组 bigram 熵与寻址权重在真实四人自由对话上验证了视觉线索的噪声鲁棒性,设计克制且主动放弃用未来说话人响度作弊;短板是语音侧仅用响度 Phon 单一特征且全程依赖弹性网络逻辑回归,在无现代时序模型对比、代码闭源的背景下 0.76 的 ROC AUC 难以判断是任务天花板还是模型容量不足,小样本实验室数据的泛化说服力有限。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 1059 words

When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI

📄 听错一句,机器就敢动手:语音误差如何撬开具身智能的安全锁 英文题目:When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI 一句话:这篇论文把具身越狱的风险源从文本对抗后缀前移到语音识别环节,用 GPT-4 模拟的四类语言误差与 CHIME-6 文本插入的四档噪声去冲击 POEX 与 SafeAgentBench,发现声学替换与重度噪声能让有害指令的接受率明显抬升,但代价是所有误差都不是真实声学解码产生的。 标签:#语音交互 #大语言模型 #语音识别 #鲁棒性 评分:5.1/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Sihan Jia:School of Mathematical and Computer Sciences Heriot-Watt University Edinburgh, United Kingdom {o.lemon@hw.ac.uk} Oliver Lemon:School of Mathematical and Computer Sciences Heriot-Watt University Edinburgh, United Kingdom {o.lemon@hw.ac.uk} 💬 毒舌点评 亮点在于把自动语音识别(Automatic Speech Recognition,ASR)误识别问题首次系统映射到具身智能(Embodied AI,EAI)的安全失效上,问题意识切中语音控制落地痛点。短板是所谓 ASR 误差几乎全靠 GPT-4 凭提示词脑补而非真实语音解码产生,CHIME-6 噪声也只是文本片段插入,与真实声学混淆相距甚远,导致结论的因果链条难以令人信服。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 872 words

A Safety-Gated Multimodal AI Backend for Mental-Health Support: Hierarchical State Representation, Conservative Risk Fusion, and Controlled Generation in Anian

📄 先分清状态,再决定能不能说话:Anian 如何把生成关进安全笼子 英文题目:A Safety-Gated Multimodal AI Backend for Mental-Health Support: Hierarchical State Representation, Conservative Risk Fusion, and Controlled Generation in Anian 一句话:面向围产期心理支持的高风险对话,Anian 用 L1-L4 分层表征与最高风险优先的保守融合把生成模型置于门控下游,在约 85 万条弱标签原型上学会了路由、在 233 例受控压力测试上拦住了高风险,但代价是依赖内部标签闭环且尚未经过真实临床与语音鲁棒性检验。 标签:#语音交互 #Transformer #内容审核 #鲁棒性 评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Lei Wang:机构信息未在 arXiv HTML 中可靠披露 Xiao Wang:机构信息未在 arXiv HTML 中可靠披露 Lei Li:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把安全门控(Safety-Gated)与保守风险融合(Conservative Risk Fusion)做成显式架构约束,生成模型被强制置于下游,设计理念比单纯调提示词更符合高风险场景的工程直觉。短板是全部性能都建立在约85万条弱标签与规则衍生标签的内部闭环以及233例预设压力测试上,缺乏独立人工金标、外部分布验证和消融支撑,却包装成完整系统报告,临床与现实安全性外推几乎为零。 ...

2026-08-29 · 更新于 2026-09-04 · 3 min · 621 words

Soft Active Electromyography Interface for Machine Learning-Enabled Silent Speech Recognition

📄 把嘴边的电极收回指尖:按需贴合如何让无声语音既可用又不打扰隐私 英文题目:Soft Active Electromyography Interface for Machine Learning-Enabled Silent Speech Recognition 一句话:面对无声语音需要在无声条件下稳定传意却难以兼顾可穿戴与隐私的难题,该工作选择把采集权交还给用户,用指尖按需接触配合液态金属可拉伸互连与 MFCC 加轻量 DNN,在 30 词受试者内取得 97.2% 的分类准确并跑通无人机闭环,代价是小样本闭集与个体化训练的边界尚未打开。 标签:#语音识别 #端到端 #语音交互 #低资源 评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuta Kurotaki:机构信息未在 arXiv HTML 中可靠披露 Shusuke Yamakoshi:机构信息未在 arXiv HTML 中可靠披露 Reitaro Yoshida:机构信息未在 arXiv HTML 中可靠披露 Yutaka Isoda:机构信息未在 arXiv HTML 中可靠披露 Tamami Takano:机构信息未在 arXiv HTML 中可靠披露 Yuji Isano:机构信息未在 arXiv HTML 中可靠披露 Yusuke Miyake:机构信息未在 arXiv HTML 中可靠披露 Kentaro Kuribayashi:机构信息未在 arXiv HTML 中可靠披露 Hiroki Ota:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把液态金属(Liquid Metal,LM)互连与弹性体(Ecoflex)封装做成了可按需贴合口周的指尖式主动肌电(active Electromyography,active EMG)采集形态,用物理隔离解决了连续贴脸方案的隐私与社交接受度痛点并配合梅尔频率倒谱系数(Mel-frequency Cepstral Coefficients,MFCC)+ 深度神经网络(Deep Neural Network,DNN)跑通了实时无人机控制。短板是仅3名受试者、30个孤立词、受试者内划分的小样本闭集分类难以支撑泛化与抗干扰声明,且关键复现材料仍停留在“计划公开”阶段。 ...

2026-08-29 · 更新于 2026-09-04 · 3 min · 622 words

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

📄 听错一个字就全盘皆输:SpeechGym 把语音智能体的失败变成可训练的梯度 英文题目:SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 一句话:针对语音智能体在纯语音多轮工具调用中因听错槽位值而级联失败的问题,SpeechGym 用本地音频闭环与过程奖励将稀疏的终局成功信号稠密化,使开放 30B 模型在独立语音管线上成功率从 24% 翻倍至 53%,代价是任务域与声学多样性仍局限于客服场景。 标签:#语音交互 #强化学习 #音频交互 #语音大模型 #基准测试 评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Jiajun Fan:机构信息未在 arXiv HTML 中可靠披露 Jingyuan Li:机构信息未在 arXiv HTML 中可靠披露 Prashanth Gurunath Shivakumar:机构信息未在 arXiv HTML 中可靠披露 Jia-Hong Huang:机构信息未在 arXiv HTML 中可靠披露 Qi Luo:机构信息未在 arXiv HTML 中可靠披露 M. Maruf:机构信息未在 arXiv HTML 中可靠披露 Ivan Bulyko:机构信息未在 arXiv HTML 中可靠披露 Ge Liu:机构信息未在 arXiv HTML 中可靠披露 Roger Ren:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语音智能体从只能测量的 API 级联中解放出来,用本地原生音频闭环让强化学习真正跑通,并以跨管线翻倍的成功率证明感知缺陷可被训练弥补。短板是所有训练与评估仍围绕 τ2-bench 这类客服数据库任务展开,且开源与复现材料几乎空白,让人难以判断该收益能否外推到更嘈杂、更开放的真实语音场景。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 834 words