论文解读

Motor, Cognitive, or Corpus? What Survives Cross-Lingual Transfer in Speech-Based Parkinsons Disease Detection

语音属性识别 | 6.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6657 字 阅读 →
论文解读

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

多模态模型 | 7.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6568 字 阅读 →
论文解读

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

音频生成 | 8.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6649 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-14

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 36 分钟 · 17828 字 阅读 →
论文解读

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

语音合成 | 7.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5681 字 阅读 →
论文解读

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

语音合成 | 6.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6735 字 阅读 →
论文解读

Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones

语音增强 | 5.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6920 字 阅读 →
论文解读

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

音视频生成 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5281 字 阅读 →
论文解读

Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping

音乐生成 | 6.8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8231 字 阅读 →
论文解读

DonorRank: Donor Language Selection for Low-Resource Cross-Lingual Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4656 字 阅读 →
论文解读

Easper: An Accessible ASR Pipeline for Language Documentation

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5955 字 阅读 →
论文解读

Luna-TTS Family Technical Report

语音合成 | 6.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7839 字 阅读 →
论文解读

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7722 字 阅读 →
论文解读

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

音频质量评估 | 6.5/10

 · 更新于 2026-09-06 · 约 6 分钟 · 3001 字 阅读 →
论文解读

On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2303 字 阅读 →
论文解读

Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6892 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6671 字 阅读 →
论文解读

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

语音增强 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5494 字 阅读 →
论文解读

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

音频事件检测 | 6.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5766 字 阅读 →
论文解读

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

语音增强 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6600 字 阅读 →