论文解读

Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

语音合成 | 4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6353 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-07

共分析 58 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 176 分钟 · 87928 字 阅读 →
论文解读

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

音频分离 | 9.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6048 字 阅读 →
论文解读

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

音频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5673 字 阅读 →
论文解读

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7969 字 阅读 →
论文解读

Convex Low-resource Accent-Robust Language Detection in Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7467 字 阅读 →
论文解读

Simultaneous Speech-to-Speech Translation Without Aligned Data

语音翻译 | 8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5628 字 阅读 →
论文解读

Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis

音频分类 | 8.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8092 字 阅读 →
论文解读

VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio

音频检索 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6711 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5177 字 阅读 →
论文解读

From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages

语音识别 | 4.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6918 字 阅读 →
论文解读

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

语音翻译 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7251 字 阅读 →
论文解读

SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings

语音合成 | 5.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5960 字 阅读 →
论文解读

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

语音交互 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5306 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-03

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 101 分钟 · 50504 字 阅读 →
论文解读

Building an ASR Solution for Training and Assessing Children's Reading

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5557 字 阅读 →
论文解读

How Bilingual Are SSL Speech Models? Cross-Lingual Probing of Articulatory Encoding with Finnish and Russian EMA

自监督学习 | 5.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6340 字 阅读 →
论文解读

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

低资源 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6248 字 阅读 →
论文解读

LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6067 字 阅读 →
论文解读

Tone-Conditioned Curriculum Learning for Low-Resource Bantu Speech Recognition

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5903 字 阅读 →