论文解读

Context-Aware ASR for Mandarin Technical Lectures

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5475 字 阅读 →
论文解读

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 7010 字 阅读 →
论文解读

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7082 字 阅读 →
论文解读

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6575 字 阅读 →
论文解读

Physiological Noise Augmentation Improves Non-Invasive Brain-to-Speech

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7173 字 阅读 →
论文解读

Progressive Refinement: An Iterative Pseudo-Labeling Approach for Mandarin-English Code-Switching ASR

语音识别 | 4.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7305 字 阅读 →
论文解读

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6411 字 阅读 →
论文解读

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6159 字 阅读 →
论文解读

Reinforcement Learning for Data-Efficient Code-Switched ASR

语音识别 | 5.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5883 字 阅读 →
论文解读

S-DiverSe: Spanish Diverse Speech

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7968 字 阅读 →
论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3294 字 阅读 →
论文解读

An Exterior Method for Nonnegative Matrix Factorization

音频分类 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6581 字 阅读 →
论文解读

BAT: Better Audio Transformer Guided by Convex Gated Probing

音频分类 | 8.6/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9139 字 阅读 →
论文解读

Convex Low-resource Accent-Robust Language Detection in Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7467 字 阅读 →
论文解读

Hearing Without Noticing? Attention-Aware Stealthy Black-Box Adversarial Audio Attacks

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6579 字 阅读 →
论文解读

Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits

语音识别 | 9.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6415 字 阅读 →
论文解读

NeuroCLUS: A Foundation Model with Functional Clustering for Intracranial Neural Decoding

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12965 字 阅读 →
论文解读

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3736 字 阅读 →
论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5426 字 阅读 →
论文解读

SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations

音频理解 | 8.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7325 字 阅读 →