论文解读
长时音视频为何不能只靠分块拼接:Encore 用参考锚点与自适应信号路由维持一致性
针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。
针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。
llmovoice 把语音交互的上下文拆成语义、副语言与环境三状态,用 VoicePage/VoiceThread 组织记忆并在预算内投影到上下文窗口,再让服务模型联合推理生成运行时指令,在丢包下把误打断率从 46.0% 降至 0.9%、每轮成本最高降低 24.9 倍,代价是编排调用时约 790 ms 的额外决策延迟与摘要压缩带来的细节丢失。
音频理解 | 6.9/10
语音识别 | 7.4/10
语音交互 | 6.6/10
空间音频 | 7.9/10
音频理解 | 7.8/10
语音识别 | 8.6/10
语音识别 | 7.3/10
音视频生成 | 10.0/10
音视频生成 | 8.9/10
语音交互 | 9.4/10
语音交互 | 6.5/10
音频理解 | 6.8/10
音频理解 | 7.7/10
语音识别 | 6.7/10
音频理解 | 6.1/10
音频编码 | 7.7/10
语音分离 | 4.9/10
音频事件检测 | 5.5/10