论文解读

Speaker-Disentangled Remote Speech Detection of Asthma and COPD Exacerbations

医疗音频 | 7.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8869 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-09-10 · 约 23 分钟 · 11116 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 语音合成 | 6.7/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7824 字 阅读 →
论文解读

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

语音识别 | 7/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7835 字 阅读 →
论文解读

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

对话情感识别 | 7.4/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6752 字 阅读 →
论文解读

Voice ''Cloning'' is Style Transfer

语音克隆 | 7/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8857 字 阅读 →
论文解读

WavFlow: Audio Generation in Waveform Space

音频生成 | 6.7/10

 · 更新于 2026-09-10 · 约 24 分钟 · 11712 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-19

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 128 分钟 · 63905 字 阅读 →
论文解读

ARIA: A Diagnostic Framework for Music Training Data Attribution

音乐生成 | 6.1/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9163 字 阅读 →
论文解读

Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues

音频分类 | 6.5/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7338 字 阅读 →
论文解读

Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction

语音生物标志物 | 6/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8390 字 阅读 →
论文解读

Can We Trust AI-Inferred User States. A Psychometric Framework for Validating the Reliability of Users States Classification by LLMs in Operational Environments

模型评估 | 6/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7392 字 阅读 →
论文解读

From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation

语音翻译 | 6.9/10

 · 更新于 2026-09-10 · 约 36 分钟 · 17909 字 阅读 →
论文解读

Improving Automatic Speech Recognition for Speakers Treated for Oral Cancer using Data Augmentation and LLM Error Correction

语音识别 | 6/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8703 字 阅读 →
论文解读

Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization

语音识别 说话人分离 | 7.2/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8034 字 阅读 →
论文解读

Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation

音乐生成 | 8.1/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8739 字 阅读 →
论文解读

Perforated Neural Networks for Keyword Spotting

关键词检测 | 5/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7432 字 阅读 →
论文解读

Real-time Speech Restoration using Data Prediction Mean Flows

音频修复 | 7.5/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7597 字 阅读 →
论文解读

Scalable neuromorphic computing from autonomous spiking dynamics in a clockless reconfigurable chip

音频分类 | 7.8/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8807 字 阅读 →
论文解读

Sound Sparks Motion: Audio and Text Tuning for Video Editing

视频编辑 | 5.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5597 字 阅读 →