论文解读

Rethinking Automatic Music Mixing as Sequential Stem Blending

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5496 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-07

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28125 字 阅读 →
论文解读

Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions

语音质量评估 | 6.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9539 字 阅读 →
论文解读

Crowdsourced Multilingual Speech Intelligibility Testing

语音质量评估 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5390 字 阅读 →
论文解读

Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE

音视频语音分离 | 6.8/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10746 字 阅读 →
论文解读

Transfer Learning for Avian Bioacoustics under Sparse Positive Labels

音频分类 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6968 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-06

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36201 字 阅读 →
论文解读

AcoustiTrace: When Plausible Sound Violates Physics

音视频生成 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6749 字 阅读 →
论文解读

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

音频分类 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6641 字 阅读 →
论文解读

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

音视频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5209 字 阅读 →
论文解读

Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6254 字 阅读 →
论文解读

SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

The Role of Disfluencies in Speech Translation

语音翻译 | 6.4/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10618 字 阅读 →
论文解读

UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations

音乐理解 | 5.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7767 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-04

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 114 分钟 · 56637 字 阅读 →
论文解读

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

音视频理解 | 8.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5406 字 阅读 →
论文解读

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6977 字 阅读 →
论文解读

CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation

音乐源分离 | 7.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5803 字 阅读 →
论文解读

Does EEG Foundation Models Transfer to Speech? A Benchmark on Overt and Imagined Speech Decoding

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5912 字 阅读 →
论文解读

Teffic-Audio: Tell Fact from Fiction

语音伪造检测 | 6.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8390 字 阅读 →