论文解读

Gemma 4 Technical Report

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8126 字 阅读 →
论文解读

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

语音交互 | 9.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8435 字 阅读 →
论文解读

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

音乐检索 | 5.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6172 字 阅读 →
论文解读

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

语音翻译 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5932 字 阅读 →
论文解读

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

音频事件检测 | 8.2/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12620 字 阅读 →
论文解读

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

音视频理解 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6394 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 41962 字 阅读 →
论文解读

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

音频理解 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7796 字 阅读 →
论文解读

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7082 字 阅读 →
论文解读

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

音视频问答 | 5.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6882 字 阅读 →
论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3294 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 176 分钟 · 87928 字 阅读 →
论文解读

VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval

音视频交互 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6871 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-06

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 3 分钟 · 1340 字 阅读 →
论文解读

ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9724 字 阅读 →
论文解读

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8042 字 阅读 →
论文解读

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

音频生成 | 5.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7545 字 阅读 →
论文解读

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

音视频理解 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5942 字 阅读 →
论文解读

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

音视频理解 | 9.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6378 字 阅读 →
论文解读

BFCL Audio: An Audio Function Calling Evaluation for Large Language Models

语音交互 | 7.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7260 字 阅读 →