论文解读

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

音视频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8197 字 阅读 →
论文解读

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

音频事件检测 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5752 字 阅读 →
论文解读

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6787 字 阅读 →
论文解读

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

音视频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6485 字 阅读 →
论文解读

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

音视频问答 | 5.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5449 字 阅读 →
论文解读

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

音频编码 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6157 字 阅读 →
论文解读

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7842 字 阅读 →
论文解读

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

音乐理解 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6497 字 阅读 →
论文解读

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

语音识别 | 5.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7337 字 阅读 →
论文解读

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

音频检索 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6459 字 阅读 →
论文解读

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

音视频理解 | 4.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6424 字 阅读 →
论文解读

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8815 字 阅读 →
论文解读

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

语音质量评估 | 7.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6446 字 阅读 →
论文解读

Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

音乐生成 | 5.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7478 字 阅读 →
论文解读

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

音视频问答 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6710 字 阅读 →
论文解读

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

多模态模型 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6568 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-14

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 36 分钟 · 17828 字 阅读 →
论文解读

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

语音合成 | 6.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6735 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6671 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-13

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 56 分钟 · 27887 字 阅读 →