论文解读

MusiChat: Vibe Composing for Music Creation

音乐生成 | 5.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6218 字 阅读 →
论文解读

MyMentorLLM: A psychotherapy GenAI environment with multimodal voice/text patients, trainees and experts for deliberate practice

语音交互 | 5.9/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9675 字 阅读 →
论文解读

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

音视频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9455 字 阅读 →
论文解读

Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

声源定位 | 7.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8573 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-29

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 83 分钟 · 41435 字 阅读 →
论文解读

Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach

音视频交互 | 5.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7206 字 阅读 →
论文解读

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

音视频生成 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6160 字 阅读 →
论文解读

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10244 字 阅读 →
论文解读

Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability

语音情感识别 | 5.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5152 字 阅读 →
论文解读

Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating

语音交互 | 6.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7083 字 阅读 →
论文解读

StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech

语音属性识别 | 8.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8263 字 阅读 →
论文解读

Towards High-Level Semantic Intelligence

音视频理解 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding

语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9351 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 39 分钟 · 19087 字 阅读 →
论文解读

OPOD: On-Policy Omni Distillation

多模态模型 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6936 字 阅读 →
论文解读

SCoPE: Shift-Aware Speaker-Conditioned Priors for Emotion Recognition in Conversations

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7064 字 阅读 →
论文解读

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6446 字 阅读 →
论文解读

X^3-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

音频理解 | 7.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8383 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-24

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28385 字 阅读 →
论文解读

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7635 字 阅读 →