论文解读

Keeping Models Listening: Segment- and time-aware attention rescaling at decoding time

音频问答 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4373 字 阅读 →
论文解读

KSDIFF: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial Animation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4327 字 阅读 →
论文解读

LAFUFU: Latent Acoustic Features For Ultra-Fast Utterance Restoration

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5039 字 阅读 →
论文解读

LAMB: LLM-Based Audio Captioning with Modality Gap Bridging Via Cauchy-Schwarz Divergence

音频描述 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4276 字 阅读 →
论文解读

Language-Infused Retrieval-Augmented CTC with Adaptive Soft-Hard Gating for Robust Code-Switching ASR

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3170 字 阅读 →
论文解读

Lattice-Guided Consistency Regularization of Dual-Mode Transducers for Automatic Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3973 字 阅读 →
论文解读

Learnable Mel-Frontend for Robust Underwater Acoustic Target Detection under Non-Target Interference

音频分类 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4531 字 阅读 →
论文解读

Learning Domain-Robust Bioacoustic Representations for Mosquito Species Classification with Contrastive Learning and Distribution Alignment

生物声学 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5151 字 阅读 →
论文解读

Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4229 字 阅读 →
论文解读

Learning Piezoelectric Hysteresis in In-Ear MEMS Loudspeakers from Acoustic Measurements

音频信号处理 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4544 字 阅读 →
论文解读

Learning to Align with Unbalanced Optimal Transport in Linguistic Knowledge Transfer for ASR

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4273 字 阅读 →
论文解读

Learning Vocal-Tract Area And Radiation With A Physics-Informed Webster Model

歌唱语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5653 字 阅读 →
论文解读

Learning What to Hear: Boosting Sound-Source Association for Robust Audiovisual Instance Segmentation

音视频实例分割 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4721 字 阅读 →
论文解读

LenslessMic: Audio Encryption and Authentication via Lensless Computational Imaging

音频安全 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6232 字 阅读 →
论文解读

LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data

语音识别 语音翻译 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5574 字 阅读 →
论文解读

LETPAV: Lexicon-Enhanced Text with Progressive Audio-Visual Fusion for Multimodal Sentiment Analysis

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models

语音识别 | 6.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Leveraging Diffusion U-Net Features for Predominant Instrument Recognition

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3908 字 阅读 →
论文解读

Leveraging Large Multimodal Models for Audio-Video Deepfake Detection: A Pilot Study

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4328 字 阅读 →
论文解读

Leveraging Large Speech Language Models as Evaluators for Expressive Speech

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3233 字 阅读 →