论文解读

瓶颈不断搬家:从 CosyVoice 到 Qwen-Audio-3.0-TTS 的接口契约与分阶段对齐

该回顾把四代系统的进步归因于规划器与渲染器之间接口契约的四次搬迁,用同篇消融支持表示与归属判断,以分阶段联合训练解决低码率与跨模块协同问题,代价是更长的训练流水线与更复杂的条件控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8722 字 阅读 →
论文解读

全上下文能听准却不能边听边写:缓存感知与解码时浅融合如何让泰语流式识别可用

针对开放泰语识别被离线模型主导而真流式时崩溃的问题,论文用缓存感知编码器恢复流式能力并在解码时做浅融合来引导词汇,在 1 秒前视下把字符错误率降低约 4.5 倍并把关键词召回从 16.6% 提升到 20.7%,额外开销不足 3%。

 · 更新于 2026-09-24 · 约 18 分钟 · 8769 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

先看到的不等于已证实:用未来可验声明管住流式音视记忆

针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。

 · 更新于 2026-09-24 · 约 24 分钟 · 11690 字 阅读 →
论文解读

二十毫秒内先分区再跨波束提纯:多级多输入多输出目标语音提取如何兼顾延迟与感知质量

针对强混响重叠与残留回声下的实时目标语音提取问题,该工作用分区多输出前端加在线波束形成再加跨波束细化的三段流水线,在十九点八七五毫秒延迟约束下把开发集可懂度和感知质量从基线附近明显抬高,而第二阶段更干净的主观听感反而在受污染近讲参考下出现客观分下降。

 · 更新于 2026-09-24 · 约 23 分钟 · 11425 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

小块流式缺未来信息时,用过去帧蒸馏出的语义向量增强当前帧

针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。

 · 更新于 2026-09-24 · 约 15 分钟 · 7077 字 阅读 →
论文解读

流式约束下自注意力退化为局部算子:去掉它为何词错误率几乎不变

该文在严格分块流式条件下检验 Conformer-Transducer 编码器中的自注意力,发现其退化为对角局部模式,进而用一维可变形卷积替换或直接删除自注意力,在 LibriSpeech 与 TEDLIUM-2 上保持词错误率基本不变并显著降低实时率与参数量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8799 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不估相位、只控增益:有界掩蔽与交叉注意力如何在 20 毫秒内做目标说话人提取

该文在因果多通道 TF-GridNet 基线上把复谱回归改为有界幅度掩蔽加混合相位复用并配多分辨率谱损失,方法 2 再把全局 FiLM 换成 16 个说话人令牌的交叉注意力 FiLM,在 CHiME-9 开发集上以频率加权信噪比下降为代价换取 Csig 感知质量提升且保持 20 毫秒算法延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7751 字 阅读 →
论文解读

装得进低功耗音频芯片的实时音乐分离:预算先行,深滤波补精度

针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。

 · 更新于 2026-09-24 · 约 21 分钟 · 10127 字 阅读 →
论文解读

把平均速度换成梅尔预测:少步数与有界上下文如何同进一个解码器

针对离散语音 token 到梅尔谱的低延迟合成问题,论文用梅尔空间重参数化的平均流把 2 到 3 步推理的声学目标直接化,并用层选择的分块掩码把每包计算限定在滑动窗内,代价是需要未来块的前视延迟和多步细化开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8291 字 阅读 →
论文解读

不断声的文本乐器:用可读参数把语言模型的等待藏进演奏里

该研究把文本转音乐从一次生成波形改为持续解析为 34 字段可读合成器配置,用后台解析加前台交叉淡出的实时生成器维持不断声,最强证据是 200 条提示下嵌入检索后端全部成功且配置生成约 0.3 秒而外部大模型后端成功 178/200 且需约 5.6 秒,代价是音色泛化弱于神经音频且检索覆盖不足时会出现语义错配。

 · 更新于 2026-09-24 · 约 22 分钟 · 10585 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

用极值点间距决定拼接长短的关键帧时间拉伸

该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。

 · 更新于 2026-09-24 · 约 21 分钟 · 10422 字 阅读 →
论文解读

零前视下全身协调:LiveGesture 用分区域专家加因果融合做流式手势

LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

不断线比对得准更重要:千机用单向广播把数百部手机变成古琴共鸣体

针对高密度蜂窝网络下数百部手机难以维持双向同步的问题,千机采用单向广播加无状态对时与离线空间乐谱,把连接存活放在相位精度之前,用 421 部手机的公演与 2000+ 连接的压测验证连续性,代价是放弃逐设备交互与现场定量同步数据。

 · 更新于 2026-09-24 · 约 21 分钟 · 10433 字 阅读 →
论文解读

把长相交给参考图:参考引导深度压缩如何让说话人像视频实时可流式生成

针对语音驱动说话人像需要同时满足实时流式、高保真和大范围躯干动态的问题,该工作用参考图引导的因果视频 VAE 把压缩率做到 768 并用块自回归整流流 Transformer 生成潜变量,在单卡实现 512×512 下 42 FPS,代价是强依赖参考图质量与训练数据分布且本次未能确认代码模型可达。

 · 更新于 2026-09-24 · 约 20 分钟 · 9937 字 阅读 →
论文解读

把离线 Canary 搬进同传:AlignAtt 截断如何换来口袋模型的低延迟

该文把 1B 参数离线直译模型 Canary-1B-v2 用 AlignAtt 策略改成同声传译,在计算无感知的英语到德语和意大利语高延迟档报告超过 4 和 6 个 BLEU 点的提升,代价是低延迟档德语 BLEU 仍落后基线且强制前缀加领域上下文会卡死。

 · 更新于 2026-09-24 · 约 17 分钟 · 8024 字 阅读 →