沉默与重叠都不是错:轮换时机要按说话人意图打分
论文针对固定窗口把延迟与重叠一律判错的问题,用六类意图后验与人类轮换偏移分布加权连续打分,在 9728 个回合上显示最强系统综合分 0.47 远低于人类 0.86 且与人评一致性更高,但代价是需要多标注者意图标注与分人群拟合的参考分布。
论文针对固定窗口把延迟与重叠一律判错的问题,用六类意图后验与人类轮换偏移分布加权连续打分,在 9728 个回合上显示最强系统综合分 0.47 远低于人类 0.86 且与人评一致性更高,但代价是需要多标注者意图标注与分人群拟合的参考分布。
Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。
该研究用同一话题下只换触发句并压缩停顿的配对独白,检验五个模型家族何时抢话,结果显示被直接提问和静音可靠地触发开口,而错误事实与危险行为几乎不触发,且把话轮交出去后纠错与警告比例仍很低。
ECHO 把插入文本固定而重写前文对话来区分打断与非打断重叠,用必须两成员全对的配对指标报告了三系统重度让出偏置与仅 MiniCPM-o 4.5 相对均衡,代价是合成语音与受控声学带来的生态效度损失。
论文把在干净视频会议数据上训练的预测性轮次模型放到高重叠鸡尾酒会数据上检验,发现多模态加权 F1 从干净域掉到新域约三分之一,微调能提升多模态约三成但伴随原域遗忘,而纯音频分支几乎无法适应。
该文在约 400 小时面对面双人对话上把注视、头部、身体手部与面部动作单元接入语音活动投影模型,最优结构以交叉注意力加三帧差分与早期门控把语音活动投影损失从 2.166 降到 2.100,面部动作单元是最强的单一视觉组但全量组合仍最好,代价是需要多模态特征提取与更大的推理开销且划分不是按会话对隔离。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究以自报听力困难的老年听者为对象,用自然、增强末尾重读音节 f0 峰、压低 f0 峰并提前下降三种问句条件做在线按键预测,发现压低条件比增强条件更快更准,而增强峰反而损害预测,同时主观努力与信心因天花板效应未能区分条件。
MP-Bench 用合成四人语音与显式、隐式、消极三类轮次条件测语音智能体,12 个系统的最强证据是带完美说话人标签的文本上限接近满分而实时语音系统在游戏轮次上徘徊于随机水平,代价是完全受控合成、无重叠与单决策点评估。
针对离线轮替标注中暂停打断与重叠打断样本过少导致韵律学不会的问题,论文比较声学扰动、删尾重组及其组合三种增广,用随机森林在阿根廷西班牙语任务对话上把开发集 PI 从 0.36 提到 0.45、I 从 0.41 提到 0.48,代价是平滑转换与重叠转换的 F1 轻微下降且留出集宏平均未提升。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对助听器要在多人同场中判断助听器用户想和谁交谈的问题,论文提出只用每人二值语音活动流的多人贝叶斯最小重叠间隙框架,用会话对齐分数刻画群体轮替,并在真实 2、3、4 人对话上分别报告 97.1%、90.1% 和 90.4% 的平均伙伴识别准确率,代价是需要数十秒到数百秒的积分窗口才能观察到充分轮替。
针对多人交互中只建模说话或只建模双人的不足,PolySLGen 用过去全组语音与动作为条件联合生成目标人的文本、语音风格、身体动作和说话状态分,证据是动作与说话状态预测上优于多个基线,代价是推理约 5 帧每秒且说话状态预测仍困难。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
AV-Dialog 针对多人干扰下跟丢目标说话人与抢话时机错乱问题,用声学码加唇部视觉做流式理解与轮次预测,在干扰下把轮次预测准确率从 54% 提升到 79%,代价是双模型并行与视觉前视带来的额外延迟与显存开销。
针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。
F-Actor 用冻结音频编码器加只微调语言模型的单阶段方案,在约 2000 小时数据上实现对音色、话题、打断与应答和起话方的指令跟随,最佳配置以词级文本对齐加 2 步音频延迟取得低困惑度和高起话准确率,但打断等稀有行为仍只能给出方向性控制且语音自然度未达真值。
该文把语音智能体的文化能力重新定义为事件限定的交互能力,用语音事件与交互契约约束韵律时机与参与管理,并以附录的事件卡与最小对诊断补足词错率与平均意见分测不到的得体性,代价是增加人工判断与规范界定负担且不提供新数据集验证。
论文用同一轻量三流分类器穷举声学、韵律、文本七种组合,发现声学加韵律在相同训练下取得最平衡的准确与延迟,而加入文本只增加抢话误报且不能提升性能。