论文解读

LOTUSDIS: A Thai Far-Field Meeting Corpus for Robust Conversational ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3735 字 阅读 →
论文解读

Low-Bandwidth High-Fidelity Speech Transmission with Generative Latent Joint Source-Channel Coding

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4889 字 阅读 →
论文解读

Low-Frequency Harmonic Control for Speech Intelligibility in Open-Ear Headphones

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3902 字 阅读 →
论文解读

Low-Latency Audio Front-End Region-of-Interest Beamforming for Smart Glasses

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4308 字 阅读 →
论文解读

Low-Resource Guidance for Controllable Latent Audio Diffusion

音乐生成 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5392 字 阅读 →
论文解读

Low-Resource Speech-Based Early Alzheimers Detection via Cross-Lingual and Few-Shot Transfer Learning

语音生物标志物 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4145 字 阅读 →
论文解读

LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3037 字 阅读 →
论文解读

MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation Without Vector Quantization

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4829 字 阅读 →
论文解读

MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5811 字 阅读 →
论文解读

Malefa: Multi-Granularity Learning and Effective False Alarm Suppression for Zero-Shot Keyword Spotting

零样本关键词检测 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4936 字 阅读 →
论文解读

Mambaformer: State-Space Augmented Self-Attention with Downup Sampling for Monaural Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4866 字 阅读 →
论文解读

Marco-Voice: A Unified Framework for Expressive Speech Synthesis with Voice Cloning

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4379 字 阅读 →
论文解读

MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion with Increased Controllability via Multiple Guidances

语音转换 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5363 字 阅读 →
论文解读

Matching Reverberant Speech Through Learned Acoustic Embeddings

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4163 字 阅读 →
论文解读

Matrix-Structured Hierarchical Convolutional Modeling for Pronunciation Assessment and Mispronunciation Detection

语音评估 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6402 字 阅读 →
论文解读

Maximum Likelihood Measurement Noise Estimation for Block-Time Domain Kalman Filters

回声消除 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4423 字 阅读 →
论文解读

MC-MRX: Reference- and Midi-Guided Music Source Extraction with Contrastive Learning

音乐源提取 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5478 字 阅读 →
论文解读

MCF: Text LLMS for Multimodal Emotional Causality

情感分析 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4895 字 阅读 →
论文解读

MCI-OTFusion: A Multimodal Model for MCI Detection and Cognitive Score Prediction

轻度认知障碍检测 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5072 字 阅读 →
论文解读

Meanflow-Accelerated Multimodal Video-to-Audio Synthesis Via One-Step Generation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4951 字 阅读 →