论文解读

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

语音情感识别 | 6.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8349 字 阅读 →
论文解读

Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8554 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23491 字 阅读 →
论文解读

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6017 字 阅读 →
论文解读

From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7890 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 41962 字 阅读 →
论文解读

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 7010 字 阅读 →
论文解读

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6411 字 阅读 →
论文解读

Streaming Neural Speech Codecs through Time-Invariant Representations

语音编码 | 6.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7723 字 阅读 →
论文解读

Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

语音合成 | 4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6353 字 阅读 →
论文解读

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7969 字 阅读 →
论文解读

Simultaneous Speech-to-Speech Translation Without Aligned Data

语音翻译 | 8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5628 字 阅读 →
论文解读

VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio

音频检索 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6711 字 阅读 →
论文解读

Disentangling Speaker and Language Effects in Cross-Lingual Speaker Verification for Iberian Languages

说话人验证 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5518 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24050 字 阅读 →
论文解读

Do Speech Emphasis Models Generalize across Languages and Emotions?

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4935 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-29

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 46 分钟 · 22697 字 阅读 →
论文解读

Neural Speaker Diarization via Multilingual Training: Evaluation on Low-Resource Nepali-Hindi Speech

语音分离 | 5.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7055 字 阅读 →
论文解读

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4420 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 55 分钟 · 27448 字 阅读 →