论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4856 字 阅读 →
论文解读

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5630 字 阅读 →
论文解读

Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12144 字 阅读 →
论文解读

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

语音增强 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5590 字 阅读 →
论文解读

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

语音翻译 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6956 字 阅读 →
论文解读

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1135 字 阅读 →
论文解读

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5029 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Autoencoder based optimized SSL representations: Complexity Minimization and improved Dysarthric ASR

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4861 字 阅读 →
论文解读

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

语音识别 | 9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6751 字 阅读 →
论文解读

Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English

语音识别 | 9.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4433 字 阅读 →
论文解读

Progressive Alignment Objectives for Aligner-Encoder based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2719 字 阅读 →
论文解读

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5481 字 阅读 →
论文解读

An Evaluation Framework for Text-to-Speech Voice Reconstruction

语音合成 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5642 字 阅读 →
论文解读

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

音频问答 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4940 字 阅读 →
论文解读

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5325 字 阅读 →
论文解读

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5368 字 阅读 →
论文解读

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6257 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11361 字 阅读 →