论文解读

AccLID: Accent-aware Language Identification for Robust Multilingual Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4432 字 阅读 →
论文解读

Advancing Speech Summarization in Multi-Modal LLMs with Reinforcement Learning

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4272 字 阅读 →
论文解读

Ara-BEST-RQ: Multi Dialectal Arabic SSL

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4587 字 阅读 →
论文解读

ARCHI-TTS: A Flow-Matching-Based Text-to-Speech Model with Self-Supervised Semantic Aligner and Accelerated Inference

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6329 字 阅读 →
论文解读

B-GRPO: Unsupervised Speech Emotion Recognition Based on Batched-Group Relative Policy Optimization

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4316 字 阅读 →
论文解读

Bayesian Low-Rank Factorization for Robust Model Adaptation

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4176 字 阅读 →
论文解读

BBPE16: UTF-16-Based Byte-Level Byte-Pair Encoding for Improved Multilingual Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3372 字 阅读 →
论文解读

Benchmarking Humans And Machines On Complex Multilingual Speech Understanding Tasks

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3566 字 阅读 →
论文解读

CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Cross-Cultural Bias in Mel-Scale Representations: Evidence and Alternatives from Speech and Music

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4247 字 阅读 →
论文解读

Cross-Lingual Alzheimer’s Disease Detection with Multimodal LLMs via Speech Cue-Augmented Prompting and Instruction Tuning

语音生物标志物 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4634 字 阅读 →
论文解读

Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis

语音克隆 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4837 字 阅读 →
论文解读

Cross-Lingual Interleaving for Speech Language Models

语音大模型 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5122 字 阅读 →
论文解读

Decoder-Only Conformer with Modality-Aware Sparse Mixtures of Experts for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5265 字 阅读 →
论文解读

Detecting and Attributing Synthetic Spanish Speech: The HISPASpoof Dataset

语音伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4286 字 阅读 →
论文解读

Direct Simultaneous Translation Activation for Large Audio-Language Models

语音翻译 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4476 字 阅读 →
论文解读

Direct Transfer of Prosody in Speech-to-speech Translation using Disentangled Speech Tokens

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4896 字 阅读 →
论文解读

Exploring Fine-Tuning Of Large Audio Language Models For Spoken Language Understanding Under Limited Speech Data

语音理解 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3549 字 阅读 →
论文解读

Exploring SSL Discrete Tokens for Multilingual Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5356 字 阅读 →
论文解读

GLAP: General Contrastive Audio-Text Pretraining Across Domains and Languages

音频检索 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4462 字 阅读 →