论文解读

Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R

音频理解 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8024 字 阅读 →
论文解读

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

语音编码 | 9.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8587 字 阅读 →
论文解读

Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6832 字 阅读 →
论文解读

Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models

说话人验证 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8389 字 阅读 →
论文解读

Is One Score Enough? Assessing Singing Quality of Songs with Temporal Score Curves

音乐理解 | 7.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7120 字 阅读 →
论文解读

NABEATs: Noise-Aware Audio Representation Learning

音频理解 | 6.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8604 字 阅读 →
论文解读

Pseudo-label distillation for discriminative anomalous sound detection

音频事件检测 | 9.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7353 字 阅读 →
论文解读

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

音频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7986 字 阅读 →
论文解读

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

音视频理解 | 5.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7410 字 阅读 →
论文解读

Constrained Hebbian Learning Supports Efficient Representational Allocation under Structural Constraints

音视频理解 | 6.7/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14475 字 阅读 →
论文解读

MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music

音乐生成 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8189 字 阅读 →
论文解读

Video = World + Event Stream

音频理解 | 4.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6888 字 阅读 →
论文解读

Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match?

语音情感识别 | 6.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8730 字 阅读 →
论文解读

Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation Scoring

音频理解 | 7.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6639 字 阅读 →
论文解读

AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9598 字 阅读 →
论文解读

Investigating the Integration of Spatial Information in Foundation-Model-Based Speaker Diarization

说话人日志 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6032 字 阅读 →
论文解读

PolarBM: Complex-valued Boltzmann Machine for Modeling Audio Signals in Polar and Log-polar Coordinates

语音增强 | 5.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5817 字 阅读 →
论文解读

ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music

自监督学习 | 7.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7552 字 阅读 →
论文解读

BeatEdit: Symbolic Music Generation as Explicit Editing

音乐生成 | 8.9/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13087 字 阅读 →
论文解读

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

语音识别 | 5.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7257 字 阅读 →