论文解读

Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 4 分钟 · 1666 字 阅读 →
论文解读

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

语音增强 | 7.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5590 字 阅读 →
论文解读

A Multi-Stage Separation-and-Classification Framework Guided by Complementary Acoustic-to-Semantic Clues

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4868 字 阅读 →
论文解读

Digital Revival: Acoustic Documentation and Digital Reactivation of Historical Woodwind Instruments

音乐生成 | 5.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5086 字 阅读 →
论文解读

AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation

数据增强 | 6.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5361 字 阅读 →
论文解读

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

语音合成 | 8.4/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10533 字 阅读 →
论文解读

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

语音合成 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6257 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11361 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3142 字 阅读 →
论文解读

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

语音合成 | 7.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5272 字 阅读 →
论文解读

The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection

数据增强 | 6.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5762 字 阅读 →
论文解读

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

语音合成 | 10/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech

语音识别 | 7.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5725 字 阅读 →
论文解读

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11077 字 阅读 →
论文解读

Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7804 字 阅读 →
论文解读

Leveraging systems' non-linearity to tackle the scarcity of data in the design of Intelligent Fault Diagnosis Systems

数据增强 | 5.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5424 字 阅读 →
论文解读

Low-Burden Data Augmentation for Dysarthric ASR via Zero-Shot Voice Cloning

语音识别 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5408 字 阅读 →
论文解读

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

音频检索 | 5.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5203 字 阅读 →
论文解读

S-JEPA : Soft Clustering Anchors for Self-Supervised Speech Representation Learning

语音识别 | 8.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5785 字 阅读 →
论文解读

Segment-Level Mandarin Chinese Speech-Based Cognitive Impairment Detection via an Autoencoder with Contrastive Learning

对比学习 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5574 字 阅读 →