论文解读

长时音视频为何不能只靠分块拼接:Encore 用参考锚点与自适应信号路由维持一致性

针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。

 · 更新于 2026-09-24 · 约 24 分钟 · 11802 字 阅读 →
论文解读

语音上下文不能只存文字:用有界编排同时管住说什么、怎么说和何时打断

llmovoice 把语音交互的上下文拆成语义、副语言与环境三状态,用 VoicePage/VoiceThread 组织记忆并在预算内投影到上下文窗口,再让服务模型联合推理生成运行时指令,在丢包下把误打断率从 46.0% 降至 0.9%、每轮成本最高降低 24.9 倍,代价是编排调用时约 790 ms 的额外决策延迟与摘要压缩带来的细节丢失。

 · 更新于 2026-09-24 · 约 25 分钟 · 12248 字 阅读 →
论文解读

会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒

音频理解 | 6.9/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12384 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10440 字 阅读 →
论文解读

语音助手的记忆为什么要分脑:VoiceMem 用 134 ms 换来 top-5 的长期理解

语音交互 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6205 字 阅读 →
论文解读

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

空间音频 | 7.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

音频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6380 字 阅读 →
论文解读

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

语音识别 | 8.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6295 字 阅读 →
论文解读

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

语音识别 | 7.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4845 字 阅读 →
论文解读

EchoWM: Open and Enterable Omnimodal World Models

音视频生成 | 10.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5157 字 阅读 →
论文解读

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

音视频生成 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4722 字 阅读 →
论文解读

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

语音交互 | 9.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5062 字 阅读 →
论文解读

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3159 字 阅读 →
论文解读

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

音频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7525 字 阅读 →
论文解读

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

音频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6697 字 阅读 →
论文解读

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

语音识别 | 6.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5685 字 阅读 →
论文解读

From Continuous Deployment to Queryable Dataset: Terabyte-Scale AIS-Aligned Passive Acoustic Labelling

音频理解 | 6.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6337 字 阅读 →
论文解读

Qwen-Audio-VAE Technical Report

音频编码 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8347 字 阅读 →
论文解读

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

语音分离 | 4.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8227 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 5.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6370 字 阅读 →