论文解读

同样的两段声音,为何转写稳得住、问答就垮掉?

音频理解 | 6.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8603 字 阅读 →
论文解读

同音不同形,真的同音吗?当语义在频谱里留下指纹

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8782 字 阅读 →
论文解读

合成语音越多越好吗?在音素层面重新称量文本的价值

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8699 字 阅读 →
论文解读

把嘴边的电极收回指尖:按需贴合如何让无声语音既可用又不打扰隐私

语音识别 | 5.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6626 字 阅读 →
论文解读

把电话声道和业务词汇分开付账:Canary 的两次适配实验

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3952 字 阅读 →
论文解读

32 分钟语料能给 Baniwa ASR 一个起点,却不能借此跳过泛化检验

语音识别 | 4.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4842 字 阅读 →
论文解读

忘掉不等于擦除:语音网络把关键期痕迹压在了最底层

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4703 字 阅读 →
论文解读

谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车

语音识别 | 5.7/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4240 字 阅读 →
论文解读

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6295 字 阅读 →
论文解读

Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

音频理解 | 9.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5382 字 阅读 →
论文解读

Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5179 字 阅读 →
论文解读

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4624 字 阅读 →
论文解读

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4845 字 阅读 →
论文解读

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5235 字 阅读 →
论文解读

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

音视频理解 | 7.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4901 字 阅读 →
论文解读

Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition

语音识别 | 8.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4731 字 阅读 →
论文解读

TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5444 字 阅读 →
论文解读

Unsupervised Speech Recognition at the Syllable Level

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5121 字 阅读 →
论文解读

A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5678 字 阅读 →
论文解读

Towards Quantifying Benchmark Optimization in ASR Models

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6239 字 阅读 →