论文解读

Explicit and Stable Pseudospectral Time-Domain Method for the Föppl-von Kármán Equations

音频理解 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6256 字 阅读 →
论文解读

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

语音交互 | 7.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6937 字 阅读 →
论文解读

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7408 字 阅读 →
论文解读

KVAE: Family of Tokenizers for Multimodal Generative Models

音频编码 | 8.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7110 字 阅读 →
论文解读

LILAC: An Idempotent Neural Speech Codec

语音编码 | 8.1/10

 · 更新于 2026-09-06 · 约 12 分钟 · 6008 字 阅读 →
论文解读

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

音视频生成 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5522 字 阅读 →
论文解读

Rethinking Automatic Music Mixing as Sequential Stem Blending

音乐生成 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5496 字 阅读 →
论文解读

The interface of intonation and lexical tone: Boundary phenomena in Mandarin varieties

语音属性识别 | 5.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4830 字 阅读 →
论文解读

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

音视频生成 | 7.4/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4241 字 阅读 →
论文解读

Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence

声源定位 | 6.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6953 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-07

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 57 分钟 · 28125 字 阅读 →
论文解读

A Dual Evaluation for Music Transcription

音乐转录 | 7.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8387 字 阅读 →
论文解读

Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation

音频理解 | 7.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7542 字 阅读 →
论文解读

Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions

语音质量评估 | 6.0/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9539 字 阅读 →
论文解读

AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation

音频生成 | 6.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

语音翻译 | 8.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7762 字 阅读 →
论文解读

C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

音视频理解 | 4.1/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8343 字 阅读 →
论文解读

Crowdsourced Multilingual Speech Intelligibility Testing

语音质量评估 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5390 字 阅读 →
论文解读

Deep Learning for Real-Time Sound Order Recognition in Human-Robot Interaction

音频事件检测 | 5.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5506 字 阅读 →
论文解读

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

音视频交互 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7757 字 阅读 →