论文解读

AMR: Adaptive Modality Routing for Multimodal Polyglot Speaker Identification

说话人识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6161 字 阅读 →
论文解读

Comparing Human and Automatic Recognition of Dutch Dysarthric Continuous Speech: A Case Study

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5900 字 阅读 →
论文解读

CTC-Seeded Token Edit Refinement for Non-Autoregressive Speech Recognition

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5815 字 阅读 →
论文解读

DialogPII: A multilingual dataset of synthetic dialog transcripts to detect personal information

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 35 分钟 · 17529 字 阅读 →
论文解读

GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark

语音识别 | 8.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5725 字 阅读 →
论文解读

How to Leverage Synthetic Speech for LLM-Based ASR Systems?

语音识别 | 8.7/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7623 字 阅读 →
论文解读

Position-Aware Target Speaker Extraction for Long-Form Multi-Party Conversations: A Diarization-Free Framework for ASR

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6087 字 阅读 →
论文解读

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

语音识别 | 9.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5833 字 阅读 →
论文解读

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

语音识别 | 9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5609 字 阅读 →
论文解读

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

语音识别 | 5.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6247 字 阅读 →
论文解读

Do Speech Emphasis Models Generalize across Languages and Emotions?

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4935 字 阅读 →
论文解读

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5871 字 阅读 →
论文解读

HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13336 字 阅读 →
论文解读

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5997 字 阅读 →
论文解读

Room for Error: Large-Scale Simulation of Over-the-Air Acoustic Attacks

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7709 字 阅读 →
论文解读

FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6105 字 阅读 →
论文解读

Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

语音识别 | 5.3/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11134 字 阅读 →
论文解读

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4420 字 阅读 →
论文解读

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5097 字 阅读 →
论文解读

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4514 字 阅读 →