论文解读

MusiChat: Vibe Composing for Music Creation

音乐生成 | 5.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6218 字 阅读 →
论文解读

MyMentorLLM: A psychotherapy GenAI environment with multimodal voice/text patients, trainees and experts for deliberate practice

语音交互 | 5.9/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9675 字 阅读 →
论文解读

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10244 字 阅读 →
论文解读

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

语音交互 | 6.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5166 字 阅读 →
论文解读

Towards High-Level Semantic Intelligence

音视频理解 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

大语言模型 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5047 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 39 分钟 · 19087 字 阅读 →
论文解读

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

数据集 | 5.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7447 字 阅读 →
论文解读

Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

语音交互 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4430 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-24

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28385 字 阅读 →
论文解读

RIME: Enabling Large-Scale Agentic Post-Production

大语言模型 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6524 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-23

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 34984 字 阅读 →
论文解读

AI_LectureNote: A Retrospective Pilot Study of a Post-ASR Workflow for English-Script Rendering and Semantic Drift in Korean-English Medical Lectures

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6277 字 阅读 →
论文解读

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

语音合成 | 6.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6532 字 阅读 →
论文解读

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

语音转换 | 6.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7105 字 阅读 →
论文解读

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

提示学习 | 8.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10446 字 阅读 →
论文解读

Qwen-Music Technical Report

音乐生成 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7232 字 阅读 →
论文解读

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

音视频理解 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8333 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 51 分钟 · 25294 字 阅读 →
论文解读

Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8091 字 阅读 →