边听边想:SHANKS 用分块未说出推理实现中途打断与提前工具调用
SHANKS 针对等说完再思考导致无法中途打断和工具延迟的问题,采用固定时长语音分块交替生成未说出思考,在数学打断与旅行工具对话中提前完成推理和调用,但提前行动伴随成功率下降需与听完再调用组合使用。
SHANKS 针对等说完再思考导致无法中途打断和工具延迟的问题,采用固定时长语音分块交替生成未说出思考,在数学打断与旅行工具对话中提前完成推理和调用,但提前行动伴随成功率下降需与听完再调用组合使用。
针对语音对话中停顿与轮次结束难以区分的问题,论文构建含合成与真实对话的 OpenETD 数据集并提出 SpeculativeETD 两级协作推理,用端侧轻量模型逐块判有声无声、只在静音段触发服务端大模型判暂停还是结束,在混合训练下真实集上取得更好分割效果,代价是服务端调用与传输延迟仍需计入部署预算。
论文把同时语音翻译拆成停顿切分与离线多模态大模型增量翻译,用等待块数与每轮生成上限控制延迟,在开发集上以五折交叉验证显示优于级联基线,但大模型推理开销与误差累积仍是代价。
该工作在 SeamlessM4T 编码器每层加入预测未来帧数的调度器并用滑动窗口重翻译与改造版 StreamAtt 进行验证,最强证据是改造版 StreamAtt 在英德 4 秒块取得 1976 毫秒延迟比基线快 817 毫秒,主要代价是两种策略下翻译质量均系统性低于未修改基线。
ZipCodec 针对流式语音 token 序列过长问题,用因果 log-mel 前端加 16 帧组块把帧率压到 6.25 Hz 与 0.80 kbps,再以约 94000 小时英文语音上的 WavLM 第 6 层蒸馏加标量球面量化保持重建与下游表征质量,代价是 842M 参数与严格的流式因果约束。
针对同声传译需在部分语音下增量输出的问题,EASiST 用多延迟语义分块构造单调交错数据、全单向语音编码器加 LLM 与轻量读写策略头经三阶段训练实现自适应低重算推理,在 MuST-C 与 Europarl-ST 英德英西上取得更好的延迟质量权衡,但自适应增益依赖分块对齐质量与阈值调节。
该文用同一组流式识别与流式说话人日志模型派生出级联、掩码输入、词级串行输出和日志条件四种架构,对比多说话人准确率、单说话人退化、内存占用与训练代价,并以排列不变动态时间规整解决短片段训练标签对齐问题,其中日志条件精度最好但需要微调与多实例代价。
针对同传要在质量与延迟之间选读或写的问题,REINA 用完整音频与截断音频下对数概率之差估计信息增益来训练独立策略网络,在 MUST-C 与 CVSS-C 上提升归一化流效率,但截断适配训练与单调约束不可缺且德语高延迟点仍有反例。
针对同声传译需在流式语音下联合决定何时翻译与翻译什么的问题,SASST 用句法感知分块加目标侧重排构造含等待符号的流式监督并统一到冻结 Whisper 编码器加解码器大模型中,在 CoVoST2 英德英中英日上以 2 到 4 秒级延迟取得质量优势,其代价是依赖句法分析器与额外的对齐预处理。
StreamAlign 针对离线文本对齐切分必须等整句和词级复制丢失细节的问题,用词级流式识别引导字符级 RNN-T 对齐再聚合成大模型子词单元,在 LibriSpeech 上报告重建 WER 4.41 和 UTMOS 4.23,同时主动词边界判断把延迟从 560 ms 降到 270 ms,代价是说话人相似度等相似性指标未占优且仅在英语朗读类数据上验证。
该文把随语音手势生成改成随音频推进的滚动扩散窗口,用逐帧递增的噪声排布和一次性解码多帧的梯子加速,在 ZEGGS 与 BEAT 上提升连贯性与多样性,代价是梯子步长增大时在表现力强的数据上会出现平滑与抖动问题。
针对整序列扩散在超长语音上泛化下降与延迟随长度增长的问题,该文用固定窗口历史运动加当前音频生成动态条件,再用单层扩散头逐帧去噪,在 BIWI 长序列与消融对照上显示出同步与稳定优势,但短序列口型开合仍有可比基线。
UniStream 针对 48 kHz 因果流式语音、音乐与环境声共用一套残差码本容量不足的问题,用多专家残差向量量化扩大每层量化容量并靠已解码状态确定性复现路由,用训练期最优传输条件流匹配正则化量化隐空间,在 12 kbps Top-1 和 22.5 kbps Top-2 两档下以 ViSQOL、Mel 失真和消融证明多专家是主要增益来源,而流正则只带来语 …
增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。
针对全双工语音对话在背景噪声和重叠说话下语义口令损坏的问题,AV-STE 用流式视听编码器加噪声自适应融合在冻结 Moshi 之前恢复第一码本语义口令,同数据集多人干扰下 GPT-4o 连贯性平均从 1.42 提到 1.91,代价是干净语音存在口令失配且依赖可靠唇部视频。
针对语音视觉文本连续输入下既要低延迟可打断对话又要长程工具执行的问题,Gander 用小脑负责流式交互与块级控制、大脑免训练负责长程推理并通过编排运行时协同,在 Full-Duplex-Bench 上以 100% 合时接管与 8.0 抢话率取得交互最优,同时在 SpokenQA 上保持 75.60 与 59.30 的流式问答能力,代价是 WorldSense …
针对方言、动态实体、口语不流利和长上下文的生产转写问题,该报告用混合专家大语言模型解码器统一控制语言、热词、历史与润色,并在中英文与多语基准及工业集上给出可核对的误差率与延迟对照,其代价是依赖大规模数据管线与指令组合训练。
针对严格因果实时伴奏中自回归节奏漂移问题,Silent Metronome 用与生成音频无关的外部节拍相位加速度拍子条件做逐帧锚定并辅以未来词元预测塑形表示,在 Slakh2100 上把 Beat-F 从 0.133 提升到 0.432 并超过 1 秒前视的非因果参照,代价是参数量增加与分布保真度的轻微回落。
TASTE2 把每个文本词元配一个连续音频隐变量使序列长度严格等于文本,用 56.3% 对 57.3% 保留 98.2% 文本问答能力并以 0.060 秒停下响应用户打断,代价是流畅接话需 1.207 秒、部署首音频 2701 毫秒且显式副语言控制不稳定。
TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。