论文解读

打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。

 · 更新于 2026-09-24 · 约 24 分钟 · 11696 字 阅读 →
论文解读

流式识别不是等多久,而是每个字该等多久:X2Streaming-ASR 的位置相关提交

针对单遍硬提交流式中文识别,X2Streaming-ASR 用监听与解码交替的等待或提交决策加三阶段训练,在五个测试集上报告平均字符提交延迟为 27 毫秒到 84 毫秒,并在 AISHELL-1 和 AISHELL-3 上取得参评流式系统中最优字符错误率,代价是部分测试集离线能力上限弱于基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8680 字 阅读 →
论文解读

在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍

GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10716 字 阅读 →
论文解读

语音上下文不能只存文字:用有界编排同时管住说什么、怎么说和何时打断

llmovoice 把语音交互的上下文拆成语义、副语言与环境三状态,用 VoicePage/VoiceThread 组织记忆并在预算内投影到上下文窗口,再让服务模型联合推理生成运行时指令,在丢包下把误打断率从 46.0% 降至 0.9%、每轮成本最高降低 24.9 倍,代价是编排调用时约 790 ms 的额外决策延迟与摘要压缩带来的细节丢失。

 · 更新于 2026-09-24 · 约 25 分钟 · 12248 字 阅读 →
论文解读

轮到谁说话,标签说了算:因果监督如何拆掉流式端点的假权衡

论文把回合结束判断搬进识别器,用语义完整加已观测静音的因果标注训练小 LoRA,在部署一致回放上以 0.97 边界召回、0.39 s 中位延迟、每语音分钟 0.3 次误触发超越全部静音超时,代价是统一多任务后精度回落与离线词错率小幅上升。

 · 更新于 2026-09-24 · 约 18 分钟 · 8771 字 阅读 →
论文解读

把级联状态机装进大模型:TurnFSM 如何串行做提交与拒绝

TurnFSM 把语义 VAD 与 utterance 级拒绝写成先提交后接受或拒绝的有限状态转移并用一阶依赖实现流式预测,在内部语义 VAD 上报告成功率 82.41% 与成功延迟 80.9 ms,在拒绝上报告 FAR 3.35% 与 FRR 16.04%,代价是仍需两阶段对齐与大模型推理开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9518 字 阅读 →
论文解读

只抄最后一层表示:预量化潜变量蒸馏压缩流式音频前端

该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9661 字 阅读 →
论文解读

轮次向真实语音学,语义向可配文本学:有限状态机全双工的解耦数据路线

针对合成文本同时学轮次与语义不可靠的问题,该工作用真实人与人语音学轮次、用可改写的人与智能体文本保语义,配合规则化事件转磁带与来源感知校准损失,在等量 token 下把轮次 F1 从约 0.34 提升到约 0.65 并把语义恢复到接近基座上限,代价是暂停处理仍弱于保守系统且单带离散化会丢信息。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-24 · 约 17 分钟 · 8454 字 阅读 →
论文解读

边听边分清谁在说:把长历史留下来做说话人归属

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4402 字 阅读 →
论文解读

会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来

语音交互 | 7.3/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2608 字 阅读 →
论文解读

相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10215 字 阅读 →
论文解读

别只看那一刻有多自信,要看一路有多摇晃:TRACE 用轨迹来判断情感是否可信

音视频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9757 字 阅读 →
论文解读

咳嗽不是噪声:让对话智能体在轮次间听见呼吸

音频事件检测 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7497 字 阅读 →
论文解读

边播边改:当音视频生成从片段走向持续世界

音频生成 | 8.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8087 字 阅读 →
论文解读

不只给一个抑郁概率:把声音拆成四条可审计的 DSM-5 线索

语音情感识别 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7092 字 阅读 →
论文解读

让声码器也理解方向:CSAVocoder 把空间线索留在最后一公里

空间音频 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4970 字 阅读 →
论文解读

别等整句说完:把数字人的手势变成一条受因果约束的数据流

音视频交互 | 6.9/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4260 字 阅读 →
论文解读

语音助手的记忆为什么要分脑:VoiceMem 用 134 ms 换来 top-5 的长期理解

语音交互 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6205 字 阅读 →
论文解读

Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamination in Streaming Emotion Understanding

语音情感识别 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4535 字 阅读 →