论文解读

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

音频伪造检测 | 9.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5822 字 阅读 →
论文解读

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

语音质量评估 | 8.2/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4504 字 阅读 →
论文解读

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

语音情感识别 | 8.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4585 字 阅读 →
论文解读

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

音频分离 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4945 字 阅读 →
论文解读

Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4731 字 阅读 →
论文解读

Self-Supervised Speech Representations Track Spoken Language Convergence to Adult Models in Infants and Children Who Are Deaf/Hard-of-Hearing

语音属性识别 | 9.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4955 字 阅读 →
论文解读

Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations?

音频理解 | 5.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

音频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5976 字 阅读 →
论文解读

The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report

语音伪造检测 | 6.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8140 字 阅读 →
论文解读

A survey of AI-generated voices and their detection

语音伪造检测 | 6.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4920 字 阅读 →
论文解读

Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding

语音合成 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6339 字 阅读 →
论文解读

Iterative Self-Learning for Expressive Text-to-Speech Synthesis

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7178 字 阅读 →
论文解读

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7842 字 阅读 →
论文解读

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

音视频语音分离 | 6.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5443 字 阅读 →
论文解读

Using the Mimi codec for metalinguistic representations

语音编码 | 4.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5440 字 阅读 →
论文解读

What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models

音乐理解 | 7.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 8007 字 阅读 →
论文解读

AT-ADD: All-Type Audio Deepfake Detection Challenge Summary

音频伪造检测 | 6.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7256 字 阅读 →
论文解读

Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5887 字 阅读 →
论文解读

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

音频分类 | 7.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8815 字 阅读 →
论文解读

Motor, Cognitive, or Corpus? What Survives Cross-Lingual Transfer in Speech-Based Parkinsons Disease Detection

语音属性识别 | 6.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6657 字 阅读 →