论文解读

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6661 字 阅读 →
论文解读

Data Augmentation for L2 English Speaking Assessment using TTS

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7246 字 阅读 →
论文解读

ECHOv2: Two-Level Band-Splitting Representation Learning for Anomalous Sound Detection

音频事件检测 | 8.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8793 字 阅读 →
论文解读

Evaluating SSL and ViViT Architectures for Cross-Corpus Audio MOS Prediction via LODO Validation

语音质量评估 | 8.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7355 字 阅读 →
论文解读

Evidence Subspace Projection: Measuring How Much Evidence Explains Deepfake Detection in Self-Supervised Speech Models

语音伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
论文解读

GigaAM Multilingual: Foundation Model for Underrepresented Languages

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6967 字 阅读 →
论文解读

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

音视频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6464 字 阅读 →
论文解读

Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction

语音克隆 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6792 字 阅读 →
论文解读

Local Multimodal Music Alignment from Global Supervision

对比学习 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7732 字 阅读 →
论文解读

MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8118 字 阅读 →
论文解读

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

语音合成 | 5.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4932 字 阅读 →
论文解读

Phone Segmentation and Recognition through Phonological Activation Mapping

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8145 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7616 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7365 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

多模态模型 | 5.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8394 字 阅读 →
论文解读

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

语音属性识别 | 5.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8539 字 阅读 →
论文解读

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7188 字 阅读 →
论文解读

Why Do You Say It Like That? A Phoneme-Level Framework for Explainable Speech Deepfake Detection

语音伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6461 字 阅读 →
论文解读

Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning

语音交互 | 8.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7653 字 阅读 →
论文解读

Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese

语音识别 | 4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7485 字 阅读 →