论文解读

计时稳定、内容易偏:法语全双工基准如何分离两种能力

论文用真实法语对话构造 CALLFC-FDB 与 MEDIA-FDB 并复用 FDB v1.0 四类任务,显示基于语音活动的计时指标跨语言基本稳定,而用户打断评分等内容指标在语言失配时明显下降,人-人对话则说明一味优化指标会损失自然度。

 · 更新于 2026-09-24 · 约 18 分钟 · 9008 字 阅读 →
论文解读

边说边听不断线:用自动考官逼出多轮全双工对话的掉线与失忆

针对全双工语音智能体多轮一致性缺乏可复现评测的问题,该文用合成语音自动考官加分阶段语义目标与快慢两种节奏做流式多轮交互,并以轮换流畅度、多轮指令遵循和任务专属三维打分报告了三系统随时间下滑且修正与实体跟踪最难的证据,代价是仅覆盖英语四类任务并依赖转写加模型打分。

 · 更新于 2026-09-24 · 约 20 分钟 · 9960 字 阅读 →
论文解读

深层共用参数为何同时拖累语义与声音:Lychee-FD 的分层解耦解读

论文把全双工语音模型的知识退化归因于深层语义与声学梯度冲突,用共享浅层加并行深层头与语义对齐通道来分离优化,主证据是口语问答平均提升 7.4% 与 FullDuplexBench 1.5 提升 28.5%,代价是约 10B 参数与专用三通道训练数据依赖。

 · 更新于 2026-09-24 · 约 18 分钟 · 8909 字 阅读 →
论文解读

多轮边听边说为何难测:用切轮与历史固定把全双工对话逐轮考住

针对多轮全双工评测中轮边界模糊与上下文不一致问题,论文用切轮加逐轮固定历史组织会话特征、对话质量、指令遵循与安全四个维度评测,报告显示随轮数与特征叠加成功率下滑且端到端模型语义保持更难,而高延迟级联方案则因回答不完整付出代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9077 字 阅读 →
论文解读

一句话偏好要管住多维度对话:多奖励 RLAIF 如何同时对齐语义与声音

该文针对语音进语音出对话只用单轮语义奖励的问题,用四路独立偏好数据加单 DPO 目标联合训练,在保持轮次与块级解码兼容的同时,以语义与声学指标的联合提升为证据,代价是情感与可懂度之间出现轻微竞争。

 · 更新于 2026-09-24 · 约 17 分钟 · 8420 字 阅读 →
论文解读

边听边想:SHANKS 用分块未说出推理实现中途打断与提前工具调用

SHANKS 针对等说完再思考导致无法中途打断和工具延迟的问题,采用固定时长语音分块交替生成未说出思考,在数学打断与旅行工具对话中提前完成推理和调用,但提前行动伴随成功率下降需与听完再调用组合使用。

 · 更新于 2026-09-24 · 约 15 分钟 · 7483 字 阅读 →
论文解读

拒答之后仍可被插话:全双工语音模型生成中安全的松动

论文针对边听边说的全双工语音模型,用固定无关语音研究有害请求后的打断能否抬高整轮有害率,以固定延迟与拒答触发两种可执行时机在四个开源模型和 720 条请求上验证,PersonaPlex 系最高上升约 39 个百分点,但效果随模型、措辞和时机剧烈变化且 BayLing 出现下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9092 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34318 字 阅读 →
论文解读

从纠缠录音到可控双轨:分离、重建与扩展如何分工保留对话时序

针对全双工对话需要保留轮转、重叠与反馈时序但真实录音纠缠不清的问题,ConversationalVoice 用质量校验的分离、词面固定的重建与上下文约束的扩展三阶段产出共享格式的双轨数据,并在自动评估中保持 0.983 至 0.991 的同说话人相似度与正向区分度,同时以重建提升预测音质而扩展维持相近交互密度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10184 字 阅读 →
论文解读

噪声越大越要看嘴型:AV-STE 在冻结对话模型前修复语义口令

针对全双工语音对话在背景噪声和重叠说话下语义口令损坏的问题,AV-STE 用流式视听编码器加噪声自适应融合在冻结 Moshi 之前恢复第一码本语义口令,同数据集多人干扰下 GPT-4o 连贯性平均从 1.42 提到 1.91,代价是干净语音存在口令失配且依赖可靠唇部视频。

 · 更新于 2026-09-24 · 约 22 分钟 · 10743 字 阅读 →
论文解读

把打断、等待与做任务放进同一个流:Gander 如何用块展平与小脑-大脑分工实现可打断的全双工 Omni 智能体

针对语音视觉文本连续输入下既要低延迟可打断对话又要长程工具执行的问题,Gander 用小脑负责流式交互与块级控制、大脑免训练负责长程推理并通过编排运行时协同,在 Full-Duplex-Bench 上以 100% 合时接管与 8.0 抢话率取得交互最优,同时在 SpokenQA 上保持 75.60 与 59.30 的流式问答能力,代价是 WorldSense …

 · 更新于 2026-09-24 · 约 29 分钟 · 14523 字 阅读 →
论文解读

序列不等长就保不住语义:TASTE2 用一词一隐变量走向可打断对话

TASTE2 把每个文本词元配一个连续音频隐变量使序列长度严格等于文本,用 56.3% 对 57.3% 保留 98.2% 文本问答能力并以 0.060 秒停下响应用户打断,代价是流畅接话需 1.207 秒、部署首音频 2701 毫秒且显式副语言控制不稳定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9448 字 阅读 →
论文解读

打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。

 · 更新于 2026-09-24 · 约 24 分钟 · 11696 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 93 分钟 · 46170 字 阅读 →