论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7769 字 阅读 →
论文解读

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6978 字 阅读 →
论文解读

Learning When to Think While Listening in Large Audio-Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2186 字 阅读 →
论文解读

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

音频生成 | 6.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5779 字 阅读 →
论文解读

LongCat-Video-Avatar 1.5 Technical Report

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7471 字 阅读 →
论文解读

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8339 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5492 字 阅读 →
论文解读

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

语音合成 | 7.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6239 字 阅读 →
论文解读

Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

语音识别 | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6387 字 阅读 →
论文解读

Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1800 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-27

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 121 分钟 · 60546 字 阅读 →
论文解读

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

语音情感识别 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6117 字 阅读 →
论文解读

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

音频生成 | 7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4951 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 6.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4440 字 阅读 →
论文解读

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

语音编辑 | 8.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6408 字 阅读 →
论文解读

Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

语音增强 | 5.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5587 字 阅读 →
论文解读

Toward Native Multimodal Modeling: A Roadmap

多模态模型 | 10/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4994 字 阅读 →
论文解读

Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

大语言模型 | 5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6830 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-26

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 70 分钟 · 34648 字 阅读 →
论文解读

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

音视频 | 7.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6541 字 阅读 →