论文解读

Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5808 字 阅读 →
论文解读

Simple Language Normalization Wins: Cross-Lingual Speaker Verification for the TidyVoice 2026 Challenge

说话人验证 | 6.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6547 字 阅读 →
论文解读

Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English

语音合成 | 6.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7963 字 阅读 →
论文解读

Phonetic forced alignment for low-resource language varieties: Model training and evaluation on Chengdu Mandarin

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7221 字 阅读 →
论文解读

AI_LectureNote: A Retrospective Pilot Study of a Post-ASR Workflow for English-Script Rendering and Semantic Drift in Korean-English Medical Lectures

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6277 字 阅读 →
论文解读

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

说话人日志 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6496 字 阅读 →
论文解读

Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion

语音转换 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8922 字 阅读 →
论文解读

Traceback Translators Against Forgetting in Continual Fake Speech Detection

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7695 字 阅读 →
论文解读

Teaching Speech Enhancement Models to Sing: Domain Adaptation from Speech Enhancement to Singing Voice Separation

音乐源分离 | 6.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9285 字 阅读 →
论文解读

Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

语音识别 | 8.8/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9313 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7527 字 阅读 →
论文解读

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

语音分离 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5723 字 阅读 →
论文解读

MMGenre: Benchmarking Singing Voice Synthesis across Multiple Musical Genres

基准测试 | 8.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6401 字 阅读 →
论文解读

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6017 字 阅读 →
论文解读

MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing

语音伪造检测 | 6.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7094 字 阅读 →
论文解读

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6411 字 阅读 →
论文解读

SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation

音频伪造检测 | 6.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9156 字 阅读 →
论文解读

Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection

音频事件检测 | 7.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7682 字 阅读 →
论文解读

MetaPerch: Learning from metadata for bioacoustics foundation models

音频分类 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6330 字 阅读 →
论文解读

Gumbel-BEARD: Automatic Layer Selection for Self-Supervised Adaptation of Whisper in Low-Resource Domains

语音识别 | 9.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4665 字 阅读 →