论文解读

TinyMU: A Compact Audio-Language Model for Music Understanding

音乐理解 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5011 字 阅读 →
论文解读

Towards Effective Negation Modeling in Joint Audio-Text Models for Music

音乐理解 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4421 字 阅读 →
论文解读

Towards Multi-View Hierarchical Video-to-Piano Generation with MIDI Guidance

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4459 字 阅读 →
论文解读

Tpeformer: Temporal Patch Embedding Transformer

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4746 字 阅读 →
论文解读

Training-Free Multimodal Guidance for Video to Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4470 字 阅读 →
论文解读

Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation

音视频 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4803 字 阅读 →
论文解读

UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4909 字 阅读 →
论文解读

UVT-LM: Unifying Visual and Tactile Perception with Language Model

跨模态 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4823 字 阅读 →
论文解读

VMSP: Video-to-Music Generation with Two-Stage Alignment and Synthesis

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4643 字 阅读 →
论文解读

VT-Heads: Voice Cloning and Talking Head Generation from Text Based on V-DiT

视频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3563 字 阅读 →
论文解读

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3527 字 阅读 →
论文解读

When Audio Matters: A Lightweight, Hierarchical Fusion Model for Speech and Non-Verbal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4926 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4244 字 阅读 →
论文解读

β-AVSDNET: A Novel End-To-End Neural Network Architecture For Audio-Visual Speaker Diarization

说话人分离 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5853 字 阅读 →
论文解读

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

音频问答 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4036 字 阅读 →
论文解读

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

跨模态 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4377 字 阅读 →
论文解读

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

音频大模型 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5044 字 阅读 →
论文解读

Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge

语音对话系统 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3585 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 41 分钟 · 20102 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

机器人技能学习 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3742 字 阅读 →