论文解读

Diffusion Timbre Transfer via Mutual Information Guided Inpainting

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4273 字 阅读 →
论文解读

Direct Preference Optimization For Speech Autoregressive Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4779 字 阅读 →
论文解读

Dual Data Scaling for Robust Two-Stage User-Defined Keyword Spotting

语音活动检测 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5107 字 阅读 →
论文解读

Emilia-NV: A Non-Verbal Speech Dataset with Word-Level Annotation for Human-Like Speech Modeling

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4512 字 阅读 →
论文解读

Emo-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4628 字 阅读 →
论文解读

Emotional Dimension Control in Language Model-Based Text-To-Speech: Spanning a Broad Spectrum of Human Emotions

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec

语音转换 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4319 字 阅读 →
论文解读

GLAP: General Contrastive Audio-Text Pretraining Across Domains and Languages

音频检索 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4462 字 阅读 →
论文解读

Group Relative Policy Optimization for Text-to-Speech with Large Language Models

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →
论文解读

Hierarchical Discrete Flow Matching For Multi-Codebook Codec-Based Text-To-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3910 字 阅读 →
论文解读

It Is Personal: The Importance of Personalization for Recognizing Self-Reported Emotion

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4215 字 阅读 →
论文解读

Language-Infused Retrieval-Augmented CTC with Adaptive Soft-Hard Gating for Robust Code-Switching ASR

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3170 字 阅读 →
论文解读

Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Leveraging prediction entropy for Automatic prompt weighting in Zero-Shot Audio-Language Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4393 字 阅读 →
论文解读

MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion with Increased Controllability via Multiple Guidances

语音转换 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5363 字 阅读 →
论文解读

MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

语音转换 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5574 字 阅读 →
论文解读

MeanVoiceFlow: One-Step Nonparallel Voice Conversion with Mean Flows

语音转换 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4492 字 阅读 →
论文解读

MELA-TTS: Joint Transformer-Diffusion Model with Representation Alignment for Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5124 字 阅读 →
论文解读

MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large Audio-Language Model

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4330 字 阅读 →
论文解读

Mispronunciation Detection and Diagnosis Without Model Training: A Retrieval-Based Approach

语音评估 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4234 字 阅读 →