每日研究速递

语音/音乐/音频论文速递 2026-07-17

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 52 分钟 · 25719 字 阅读 →
论文解读

A Hybrid Mamba for Audio-Visual Navigation

声源定位 | 6.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7805 字 阅读 →
论文解读

Cover First, Disagree Softly: Rethinking Mismatch-First Active Learning for Frame-Level Audio Classification

音频事件检测 | 6.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5869 字 阅读 →
论文解读

Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach

语音翻译 | 5.7/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7514 字 阅读 →
论文解读

Genre Bias or Aesthetic Perception? Identifying and Mitigating Shortcut Learning in Music Evaluation

音乐理解 | 6.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6179 字 阅读 →
论文解读

Greedy Volume Maximization of Gradient Embeddings for Long-Tailed Frame-Level Bioacoustic Active Learning

音频分类 | 6.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5248 字 阅读 →
论文解读

Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models

音频生成 | 7.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7410 字 阅读 →
论文解读

Live Gurbani Tracking: A Benchmark and Reference System for Captioning Sikh Kirtan

音频字幕生成 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6573 字 阅读 →
论文解读

Music-to-Dance Generation via Atomic Movements

音乐生成 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6911 字 阅读 →
论文解读

Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation Scoring

音频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6639 字 阅读 →
论文解读

Task-Oriented Sensing and Covert Transmissions for Collaborative Multi-AUV Systems

声源定位 | 4.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5721 字 阅读 →
论文解读

VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement

音频理解 | 6.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7416 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-16

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 63 分钟 · 31364 字 阅读 →
论文解读

Audio Diarization: A New Paradigm for Exploring Audio Recordings with Unknown Event Classes

说话人日志 | 4.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6151 字 阅读 →
论文解读

Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots

音频理解 | 5.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6907 字 阅读 →
论文解读

AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9598 字 阅读 →
论文解读

Contrasting statistical patterns in melodic and molecular evolution reveal distinctive constraints in a culturally evolving system

音乐理解 | 8.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6921 字 阅读 →
论文解读

DOA Estimation from One-Bit Magnitude-Only Measurements via Sign-Consistency Optimization

声源定位 | 5.1/10

 · 更新于 2026-09-06 · 约 18 分钟 · 9009 字 阅读 →
论文解读

Listen first: Output-based multi-microphone speech enhancement

语音增强 | 6.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7333 字 阅读 →
论文解读

Low-Latency Neural Models for Real-Time Music Enhancement

音乐源分离 | 7.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6872 字 阅读 →