论文解读

Optimizing Speech Language Models for Acoustic Consistency

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4747 字 阅读 →
论文解读

Phonological Tokenizer: Prosody-Aware Phonetic Token Via Multi-Objective Fine-Tuning with Differentiable K-Means

语音表示学习 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Polynomial Mixing for Efficient Self-Supervised Speech Encoders

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Position-Invariant Fine-Tuning Of Speech Enhancement Models With Self-Supervised Speech Representations

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4224 字 阅读 →
论文解读

QE-XVC: Zero-Shot Cross-Lingual Voice Conversion via Query-Enhancement and Conditional Flow Matching

语音转换 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4561 字 阅读 →
论文解读

RASD-SR: A Robust Anomalous Sound Detection Framework with Score Recalibration

异常声音检测 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5155 字 阅读 →
论文解读

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5113 字 阅读 →
论文解读

Recovering Performance in Speech Emotion Recognition from Discrete Tokens Via Multi-Layer Fusion and Paralinguistic Feature Integration

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4949 字 阅读 →
论文解读

Representation-Based Data Quality Audits for Audio

数据集 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4054 字 阅读 →
论文解读

Representation-Diverse Self-Supervision for Cross-Domain Bioacoustic Learning in Low-Resource Settings

生物声学 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5415 字 阅读 →
论文解读

Residual Tokens Enhance Masked Autoencoders for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5021 字 阅读 →
论文解读

Robust Accent Identification via Voice Conversion and Non-Timbral Embeddings

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3282 字 阅读 →
论文解读

Robust Deepfake Audio Detection via Multi-Level Intermediate Feature Fusion

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3781 字 阅读 →
论文解读

S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4416 字 阅读 →
论文解读

SA-SSL-MOS: Self-Supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment

语音质量评估 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5780 字 阅读 →
论文解读

Scaling Spoken Language Models with Syllabic Speech Tokenization

语音理解 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4144 字 阅读 →
论文解读

SED: Structural Entropy Based Speech Discretization for Discrete Token-Based ASR

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4993 字 阅读 →
论文解读

Self-Supervised Note Tracking and Multi-Pitch Estimation Via Reconstruction-Based Learning

多音高估计 音符跟踪 | 8.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9289 字 阅读 →
论文解读

Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-Scale Dataset Cleansing

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4546 字 阅读 →
论文解读

SingMOS-Pro: An Comprehensive Benchmark For Singing Quality Assessment

歌唱语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3984 字 阅读 →