论文解读

Unified Music Identification for Tracks and Versions

音乐检索 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6149 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-21

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 60 分钟 · 29950 字 阅读 →
论文解读

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

音乐理解 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7579 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-19

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 40 分钟 · 19678 字 阅读 →
论文解读

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

音视频语音合成 | 7.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6606 字 阅读 →
论文解读

How Fragile Is Your Watermark? Training-Free Structural Removal of Neural Audio Watermarks

音频水印 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7533 字 阅读 →
论文解读

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6787 字 阅读 →
论文解读

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7525 字 阅读 →
论文解读

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

音视频问答 | 5.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5449 字 阅读 →
论文解读

Navigating Speech Enhancement for Real-Time MRI: A Systematic Assessment of Signal Quality, Source Preservation, and Downstream Tasks

语音增强 | 5.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8798 字 阅读 →
论文解读

AT-ADD: All-Type Audio Deepfake Detection Challenge Summary

音频伪造检测 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7256 字 阅读 →
论文解读

The MPB Corpus: A Dataset of Melody, Rhythm, Harmony, and Melody-Harmony Relationships in Brazilian Popular Music

音乐理解 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6805 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-17

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 62 分钟 · 30965 字 阅读 →
论文解读

Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7343 字 阅读 →
论文解读

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

音视频问答 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6710 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-14

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 36 分钟 · 17828 字 阅读 →
论文解读

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

音视频生成 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5281 字 阅读 →
论文解读

Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping

音乐生成 | 6.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8231 字 阅读 →
论文解读

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6748 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-13

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 56 分钟 · 27887 字 阅读 →