每日研究速递

语音/音乐/音频论文速递 2026-05-18

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 48 分钟 · 23894 字 阅读 →
论文解读

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

音视频分割 | 7.2/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11356 字 阅读 →
论文解读

ViMU: Benchmarking Video Metaphorical Understanding

基准测试 | 8.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7731 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-17

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 9 分钟 · 4469 字 阅读 →
论文解读

IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

语音提取 | 6/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8685 字 阅读 →
论文解读

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

多模态模型 | 3.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7378 字 阅读 →
论文解读

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

语音合成 | 5.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8691 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-15

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 83 分钟 · 41092 字 阅读 →
论文解读

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

几何推理 | 7.0/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7034 字 阅读 →
论文解读

Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

音视频 | 7.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8769 字 阅读 →
论文解读

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

动机访谈编码 | 6.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6770 字 阅读 →
论文解读

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

生成模型 | 6.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7708 字 阅读 →
论文解读

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

模型评估 | 8.0/10

 · 更新于 2026-09-06 · 约 22 分钟 · 10630 字 阅读 →
论文解读

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

多模态模型评估 | 5.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9061 字 阅读 →
论文解读

jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition

多模态检索 | 7.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8909 字 阅读 →
论文解读

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8863 字 阅读 →
论文解读

AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State

音乐视频生成 | 4.8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8053 字 阅读 →
论文解读

EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

音频事件检测 | 5.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9380 字 阅读 →
论文解读

Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition

意图识别 | 7.0/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9463 字 阅读 →
论文解读

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

基准测试 | 6.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8876 字 阅读 →