论文解读

Speech World Model: Causal State–Action Planning with Explicit Reasoning for Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5550 字 阅读 →
论文解读

Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow

动作生成 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4802 字 阅读 →
论文解读

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

生成模型 | 8.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5619 字 阅读 →
论文解读

MirrorTalk: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3679 字 阅读 →
论文解读

Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic Event Classification

音频事件检测 | 8.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3902 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 87 分钟 · 43144 字 阅读 →
论文解读

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

1. **问题**:现有视频扩散模型在生成人机交互(HOI)视频时,常出现手/脸结构崩溃和人机物理穿透等问题,根源在于模型缺乏对3D空间关系和交互结构的理解。 2. **方法核心**:提出CoInteract框架,核心是“空间结构化协同生成”范式。在一个共享的DiT骨干中联合训练RGB外观流和辅助的

 · 更新于 2026-09-24 · 约 11 分钟 · 5017 字 阅读 →
论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

这篇论文旨在解决对多语言、多模态句子嵌入(如SONAR, LaBSE)的可解释性问题。核心方法是提出一种称为因子化线性投影(FLiP)的模型,通过将嵌入向量线性投影到词汇表空间来提取关键词,以此作为理解嵌入内容的代理任务。与之前非因子化的线性探测方法(如LiP)和SpLiCE相比,FLiP在关键词提

 · 更新于 2026-09-24 · 约 8 分钟 · 4001 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-23

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 73 分钟 · 36076 字 阅读 →
论文解读

CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing

本文针对电影配音(视觉语音克隆)中音色保真度与唇形同步难以兼得的痛点,提出了一种基于流匹配的认知同步扩散Transformer(CoSyncDiT)框架。该方法受专业配音员认知过程启发,将噪声到语音的

 · 更新于 2026-09-24 · 约 12 分钟 · 5835 字 阅读 →
论文解读

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

本文旨在解决当前语音代理评估中过度关注被动响应,而忽视其主动交互能力的问题。为此,作者提出了首个专门评估主动语音代理的基准测试框架 **ProVoice-Bench**。该框架包含四个新颖的任务,用以

 · 更新于 2026-09-24 · 约 8 分钟 · 3948 字 阅读 →
论文解读

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

本文首次提出了“聆听深度伪造检测”这一新任务,旨在识别视频中人物在倾听状态下(非说话时)的伪造反应,弥补了现有研究主要集中于“说话”场景的不足。为解决此任务数据稀缺的问题,作者构建了首个专门数据集Li

 · 更新于 2026-09-24 · 约 9 分钟 · 4253 字 阅读 →
论文解读

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

这篇论文深入探讨了在端到端音频语言模型中,将视觉信息融入音频分词器时普遍存在的“理解提升但重建质量下降”的核心矛盾。作者通过系统性实验,揭示了三个关键发现:融合位置(在量化前还是量化后)至关重要;在离

 · 更新于 2026-09-24 · 约 10 分钟 · 4838 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-19

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 94 分钟 · 46668 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 276 分钟 · 137848 字 阅读 →