论文解读

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

说话人日志 | 6.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6807 字 阅读 →
论文解读

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

音视频语音识别 | 6.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7037 字 阅读 →
论文解读

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

语音识别 | 5.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7337 字 阅读 →
论文解读

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

音视频生成 | 7.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6701 字 阅读 →
论文解读

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

音频检索 | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6459 字 阅读 →
论文解读

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

音视频理解 | 4.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6424 字 阅读 →
论文解读

Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures

音乐源分离 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6140 字 阅读 →
论文解读

StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Supervised Streaming Speech Recognition

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5783 字 阅读 →
论文解读

The MPB Corpus: A Dataset of Melody, Rhythm, Harmony, and Melody-Harmony Relationships in Brazilian Popular Music

音乐理解 | 6.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6805 字 阅读 →
论文解读

Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5887 字 阅读 →
论文解读

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

语音合成 | 8.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7721 字 阅读 →
论文解读

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

语音合成 | 6.8/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9642 字 阅读 →
论文解读

Why Performance Metrics Overpromise in Auditory Attention Decoding: an Information-Theoretic Reappraisal

语音交互 | 6.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6654 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-17

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 62 分钟 · 30965 字 阅读 →
论文解读

Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost

语音识别 | 7.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6965 字 阅读 →
论文解读

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

音频分类 | 7.2/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8815 字 阅读 →
论文解读

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

语音质量评估 | 7.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6446 字 阅读 →
论文解读

Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition

语音识别 | 7.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7343 字 阅读 →
论文解读

Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

音乐生成 | 5.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7478 字 阅读 →
论文解读

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

音视频问答 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6710 字 阅读 →