论文解读

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

空间音频 | 9.7/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4341 字 阅读 →
论文解读

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4765 字 阅读 →
论文解读

MusPyExpress: Extending MusPy with Enhanced Expression Text Support

音乐理解 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5294 字 阅读 →
论文解读

Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement

语音增强 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4932 字 阅读 →
论文解读

A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5678 字 阅读 →
论文解读

Unified Music Identification for Tracks and Versions

音乐检索 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6149 字 阅读 →
论文解读

Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5074 字 阅读 →
论文解读

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3361 字 阅读 →
论文解读

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

语音合成 | 6.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6343 字 阅读 →
论文解读

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6787 字 阅读 →
论文解读

Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale

声源定位 | 7.6/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8223 字 阅读 →
论文解读

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

音乐理解 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6497 字 阅读 →
论文解读

Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures

音乐源分离 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6140 字 阅读 →
论文解读

The MPB Corpus: A Dataset of Melody, Rhythm, Harmony, and Melody-Harmony Relationships in Brazilian Popular Music

音乐理解 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6805 字 阅读 →
论文解读

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

音频生成 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6649 字 阅读 →
论文解读

Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

音视频生成 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5281 字 阅读 →
论文解读

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6748 字 阅读 →
论文解读

MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6358 字 阅读 →
论文解读

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

语音交互 | 7.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9423 字 阅读 →
论文解读

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

音频字幕生成 | 7.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2475 字 阅读 →