论文解读

Music-Source-Separation-Training (MSST): A Unified Framework for Training and Evaluating Music Demixing Models

音乐源分离 | 5.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7537 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-28

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 103 分钟 · 51404 字 阅读 →
论文解读

Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9351 字 阅读 →
论文解读

MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6955 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 39 分钟 · 19087 字 阅读 →
论文解读

Cumsum-Composable Phase Transport for Low-Cost Streaming Keyword Spotting

语音唤醒 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6381 字 阅读 →
论文解读

Scalable Keyword Spotting via Modular Network Expansion

语音唤醒 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7687 字 阅读 →
论文解读

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

语音翻译 | 7.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7236 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-23

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 70 分钟 · 34984 字 阅读 →
论文解读

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

音频检索 | 8.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8119 字 阅读 →
论文解读

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-22

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 71 分钟 · 35132 字 阅读 →
论文解读

An Audio Language Model-Based Voice Concept Bottleneck Framework for Interpretable Health Assessment

语音质量评估 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7062 字 阅读 →
论文解读

Pseudo-label distillation for discriminative anomalous sound detection

音频事件检测 | 9.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7353 字 阅读 →
论文解读

Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription Challenge

语音交互 | 6.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8701 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-21

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 118 分钟 · 58810 字 阅读 →
论文解读

Large Audio Language Models for Spoofing-Aware Speaker Verification

语音伪造检测 | 6.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7545 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-17

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 52 分钟 · 25719 字 阅读 →
论文解读

Bring Music The Horizon: Music-Driven 360^\circ Video Generation

音视频生成 | 5.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4986 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-16

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 63 分钟 · 31364 字 阅读 →