瓶颈不断搬家:从 CosyVoice 到 Qwen-Audio-3.0-TTS 的接口契约与分阶段对齐
该回顾把四代系统的进步归因于规划器与渲染器之间接口契约的四次搬迁,用同篇消融支持表示与归属判断,以分阶段联合训练解决低码率与跨模块协同问题,代价是更长的训练流水线与更复杂的条件控制。
该回顾把四代系统的进步归因于规划器与渲染器之间接口契约的四次搬迁,用同篇消融支持表示与归属判断,以分阶段联合训练解决低码率与跨模块协同问题,代价是更长的训练流水线与更复杂的条件控制。
针对开放泰语识别被离线模型主导而真流式时崩溃的问题,论文用缓存感知编码器恢复流式能力并在解码时做浅融合来引导词汇,在 1 秒前视下把字符错误率降低约 4.5 倍并把关键词召回从 16.6% 提升到 20.7%,额外开销不足 3%。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。
针对强混响重叠与残留回声下的实时目标语音提取问题,该工作用分区多输出前端加在线波束形成再加跨波束细化的三段流水线,在十九点八七五毫秒延迟约束下把开发集可懂度和感知质量从基线附近明显抬高,而第二阶段更干净的主观听感反而在受污染近讲参考下出现客观分下降。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。
该文在严格分块流式条件下检验 Conformer-Transducer 编码器中的自注意力,发现其退化为对角局部模式,进而用一维可变形卷积替换或直接删除自注意力,在 LibriSpeech 与 TEDLIUM-2 上保持词错误率基本不变并显著降低实时率与参数量。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该文在因果多通道 TF-GridNet 基线上把复谱回归改为有界幅度掩蔽加混合相位复用并配多分辨率谱损失,方法 2 再把全局 FiLM 换成 16 个说话人令牌的交叉注意力 FiLM,在 CHiME-9 开发集上以频率加权信噪比下降为代价换取 Csig 感知质量提升且保持 20 毫秒算法延迟。
针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。
针对离散语音 token 到梅尔谱的低延迟合成问题,论文用梅尔空间重参数化的平均流把 2 到 3 步推理的声学目标直接化,并用层选择的分块掩码把每包计算限定在滑动窗内,代价是需要未来块的前视延迟和多步细化开销。
该研究把文本转音乐从一次生成波形改为持续解析为 34 字段可读合成器配置,用后台解析加前台交叉淡出的实时生成器维持不断声,最强证据是 200 条提示下嵌入检索后端全部成功且配置生成约 0.3 秒而外部大模型后端成功 178/200 且需约 5.6 秒,代价是音色泛化弱于神经音频且检索覆盖不足时会出现语义错配。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。
LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。
针对高密度蜂窝网络下数百部手机难以维持双向同步的问题,千机采用单向广播加无状态对时与离线空间乐谱,把连接存活放在相位精度之前,用 421 部手机的公演与 2000+ 连接的压测验证连续性,代价是放弃逐设备交互与现场定量同步数据。
针对语音驱动说话人像需要同时满足实时流式、高保真和大范围躯干动态的问题,该工作用参考图引导的因果视频 VAE 把压缩率做到 768 并用块自回归整流流 Transformer 生成潜变量,在单卡实现 512×512 下 42 FPS,代价是强依赖参考图质量与训练数据分布且本次未能确认代码模型可达。
该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。