论文解读

Do Speech Emphasis Models Generalize across Languages and Emotions?

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4935 字 阅读 →
论文解读

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5871 字 阅读 →
论文解读

HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-06 · 约 27 分钟 · 13336 字 阅读 →
论文解读

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5997 字 阅读 →
论文解读

Room for Error: Large-Scale Simulation of Over-the-Air Acoustic Attacks

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7709 字 阅读 →
论文解读

FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6105 字 阅读 →
论文解读

Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

语音识别 | 5.3/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11134 字 阅读 →
论文解读

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4420 字 阅读 →
论文解读

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

语音识别 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5097 字 阅读 →
论文解读

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

语音识别 | 6.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4514 字 阅读 →
论文解读

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

语音识别 | 5.8/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4856 字 阅读 →
论文解读

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5630 字 阅读 →
论文解读

Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 25 分钟 · 12144 字 阅读 →
论文解读

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

语音增强 | 7.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5590 字 阅读 →
论文解读

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

语音翻译 | 7.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6956 字 阅读 →
论文解读

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 3 分钟 · 1135 字 阅读 →
论文解读

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5029 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Autoencoder based optimized SSL representations: Complexity Minimization and improved Dysarthric ASR

语音识别 | 5.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4861 字 阅读 →
论文解读

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

语音识别 | 9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6751 字 阅读 →