论文解读

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

音视频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3309 字 阅读 →
论文解读

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

音视频理解 | 7.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5996 字 阅读 →
论文解读

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

语音合成 | 9.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4189 字 阅读 →
论文解读

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

语音交互 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3159 字 阅读 →
论文解读

On computational approaches to Pop music culture

音乐理解 | 6.1/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2903 字 阅读 →
论文解读

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

语音交互 | 6.8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4044 字 阅读 →
论文解读

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

语音情感识别 | 8.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3361 字 阅读 →
论文解读

Target Speaker Identification: A Low-Latency Streaming Pipeline

说话人验证 | 5.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5075 字 阅读 →
论文解读

The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report

语音伪造检测 | 6.6/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8140 字 阅读 →
论文解读

Uncertainty-Aware Decision Making in Multimodal Large Language Models

音频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3533 字 阅读 →
论文解读

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

音乐理解 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7579 字 阅读 →
论文解读

Why GPT-Style Models Do Not Directly Transfer to Symbolic Music: Compression in the Wrong Coordinate System

音乐生成 | 6.7/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3187 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-19

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 40 分钟 · 19678 字 阅读 →
论文解读

A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement

语音增强 | 5.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6438 字 阅读 →
论文解读

A Parameter-Free Few-Shot Evaluation for Elephant Vocalisation Classification

音频分类 | 5.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5571 字 阅读 →
论文解读

A survey of AI-generated voices and their detection

语音伪造检测 | 6.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4920 字 阅读 →
论文解读

ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning

音频字幕生成 | 7.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8571 字 阅读 →
论文解读

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

语音克隆 | 6.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7652 字 阅读 →
论文解读

An Analytical-Prior Framework for Data-Efficient Prediction of Sound-Reduction Frequencies in Rectangular Side-Branch Helmholtz Resonators

预训练 | 5.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7170 字 阅读 →
论文解读

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

音视频语音合成 | 6.7/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7543 字 阅读 →