论文解读

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5387 字 阅读 →
论文解读

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

语音生成 | 9.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6224 字 阅读 →
论文解读

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

语音情感识别 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5028 字 阅读 →
论文解读

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4782 字 阅读 →
论文解读

Why We Need Speech to Evaluate Speech Translation

语音翻译 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6500 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-28

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 42014 字 阅读 →
论文解读

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

多模态模型 | 7.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6784 字 阅读 →
论文解读

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

多模态模型 | 9.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6285 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7769 字 阅读 →
论文解读

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6978 字 阅读 →
论文解读

Learning When to Think While Listening in Large Audio-Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2186 字 阅读 →
论文解读

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

音频生成 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5779 字 阅读 →
论文解读

LongCat-Video-Avatar 1.5 Technical Report

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7471 字 阅读 →
论文解读

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8339 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5492 字 阅读 →
论文解读

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

语音合成 | 7.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6239 字 阅读 →
论文解读

Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6387 字 阅读 →
论文解读

Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1800 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-27

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 121 分钟 · 60546 字 阅读 →
论文解读

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

语音情感识别 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6117 字 阅读 →