论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4257 字 阅读 →
论文解读

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

音频分类 | 9.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6625 字 阅读 →
论文解读

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4899 字 阅读 →
论文解读

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

机器人操作 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5562 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4966 字 阅读 →
论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4951 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

视频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4282 字 阅读 →
论文解读

TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO- DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN- FERENCE ON BATTERY-POWERED SMALL DEVICES

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4229 字 阅读 →
论文解读

TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction

脑编码 | 9.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4604 字 阅读 →
论文解读

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

视频摘要 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5060 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5314 字 阅读 →
论文解读

VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Video

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4193 字 阅读 →
论文解读

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

音频检索 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4709 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3728 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4010 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6983 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20229 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

生成模型 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3762 字 阅读 →