论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6296 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-07

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 79 分钟 · 39450 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5431 字 阅读 →
论文解读

Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

语音生物标志物 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5797 字 阅读 →
论文解读

Smart Passive Acoustic Monitoring: Embedding a Classifier on AudioMoth Microcontroller

生物声学 | 7.5/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2580 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6496 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-06

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 81 分钟 · 40463 字 阅读 →
论文解读

MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings

肺炎筛查 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5935 字 阅读 →
论文解读

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4081 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-05

共分析 33 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 104 分钟 · 51662 字 阅读 →
论文解读

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

语音合成 | 9.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5627 字 阅读 →
论文解读

From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings

音频分类 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6394 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4966 字 阅读 →
论文解读

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6035 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5875 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 50 分钟 · 24971 字 阅读 →
论文解读

Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5369 字 阅读 →
论文解读

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5831 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

JaiTTS: A Thai Voice Cloning Model

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2500 字 阅读 →