论文解读

When Vision Speaks for Sound

音视频 | 7.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9514 字 阅读 →
论文解读

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

音频安全 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9033 字 阅读 →
论文解读

Audio-Image Cross-Modal Retrieval with Onomatopoeic Images

音频检索 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6984 字 阅读 →
论文解读

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

多模态模型 | 8.6/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10221 字 阅读 →
论文解读

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

音视频 | 7.3/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9061 字 阅读 →
论文解读

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

医学图像重建 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8537 字 阅读 →
论文解读

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

对话情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6752 字 阅读 →
论文解读

Sound Sparks Motion: Audio and Text Tuning for Video Editing

视频编辑 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5597 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-18

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 48 分钟 · 23894 字 阅读 →
论文解读

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

音视频分割 | 7.2/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11356 字 阅读 →
论文解读

ViMU: Benchmarking Video Metaphorical Understanding

基准测试 | 8.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7731 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-17

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 9 分钟 · 4469 字 阅读 →
论文解读

IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

语音提取 | 6/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8685 字 阅读 →
论文解读

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

多模态模型 | 3.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7378 字 阅读 →
论文解读

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

语音合成 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8691 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-15

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 83 分钟 · 41092 字 阅读 →
论文解读

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

几何推理 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7034 字 阅读 →
论文解读

Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8769 字 阅读 →
论文解读

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

动机访谈编码 | 6.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6770 字 阅读 →
论文解读

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

生成模型 | 6.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7708 字 阅读 →