论文解读

Impact of Phonetics on Speaker Identity in Adversarial Voice Attack

说话人验证 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3657 字 阅读 →
论文解读

Improving Automatic Speech Recognition by Mitigating Distortions Introduced by Speech Enhancement Under Drone Noise

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4511 字 阅读 →
论文解读

Improving Contextual Asr Via Multi-Grained Fusion With Large Language Models

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3976 字 阅读 →
论文解读

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word level timestamp predictions

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Input-Adaptive Differentiable Filterbanks via Hypernetworks for Robust Speech Processing

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Inverse-Hessian Regularization for Continual Learning in ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4236 字 阅读 →
论文解读

Investigating The Effect Of Sentence-Level Syntactic Structure On Information Loss In The Human Auditory System

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3548 字 阅读 →
论文解读

Joint Autoregressive Modeling of Multi-Talker Overlapped Speech Recognition and Translation

语音识别 语音翻译 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4119 字 阅读 →
论文解读

K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4671 字 阅读 →
论文解读

Language-Infused Retrieval-Augmented CTC with Adaptive Soft-Hard Gating for Robust Code-Switching ASR

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3170 字 阅读 →
论文解读

Lattice-Guided Consistency Regularization of Dual-Mode Transducers for Automatic Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3973 字 阅读 →
论文解读

Learning to Align with Unbalanced Optimal Transport in Linguistic Knowledge Transfer for ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4273 字 阅读 →
论文解读

LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data

语音识别 语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5574 字 阅读 →
论文解读

Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Leveraging Segment-Level Speech Representations for LLM-Based Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5225 字 阅读 →
论文解读

Leveraging Text-to-Speech and Voice Conversion as Data Augmentation for Alzheimer's Disease Detection from Spontaneous Speech

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5134 字 阅读 →
论文解读

Linguard: Authenticating Speech Recordings Using Speech Recognition and Watermark

音频安全 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4307 字 阅读 →
论文解读

Listen, But Don't Leak: Sensitive Data Protection for Privacy Aware Automatic Speech Recognition with Acoustic Triggers

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4187 字 阅读 →
论文解读

LLM-Based Post-ASR Error Correction for Disordered Speech

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5031 字 阅读 →
论文解读

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

基准测试 | 7.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3975 字 阅读 →