论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4323 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5484 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4966 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO- DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN- FERENCE ON BATTERY-POWERED SMALL DEVICES

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4229 字 阅读 →
论文解读

Towards True Speech-to-Speech Models Without Text Guidance

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5080 字 阅读 →
论文解读

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

语音翻译 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4434 字 阅读 →
论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5385 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20229 字 阅读 →
论文解读

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6017 字 阅读 →
论文解读

Can Speech LLMs Think while Listening?

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4627 字 阅读 →
论文解读

Closing the Gap Between Text and Speech Understanding in LLMs

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8119 字 阅读 →
论文解读

Confident and Adaptive Generative Speech Recognition via Risk Control

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5063 字 阅读 →
论文解读

DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations

语音对话系统 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Instilling an Active Mind in Avatars via Cognitive Simulation

数字人生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4161 字 阅读 →
论文解读

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5342 字 阅读 →
论文解读

LLM2Fx-Tools: Tool Calling for Music Post-Production

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4397 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

音频问答 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6263 字 阅读 →
论文解读

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

音频分类 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5010 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6243 字 阅读 →