论文解读

把拾音器从琴上焊死的位置里解放出来:64 路沿弦采样如何把音色选择推迟到混音台

音乐源分离 | 7.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7164 字 阅读 →
论文解读

把 100 小时 MEG 拆成两种稀缺资源,才看得见神经语音解码该怎样扩展

基准测试 | 8.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5035 字 阅读 →
论文解读

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

音乐生成 | 8.7/10

 · 更新于 2026-09-24 · 约 3 分钟 · 1221 字 阅读 →
论文解读

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

音乐生成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7660 字 阅读 →
论文解读

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

音视频语音分离 | 8.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6292 字 阅读 →
论文解读

MusPyExpress: Extending MusPy with Enhanced Expression Text Support

音乐理解 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5294 字 阅读 →
论文解读

Computational Features for Symbolic Melody Analysis

音乐理解 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4792 字 阅读 →
论文解读

Automatic Transcription of Microtonal Free-Rhythm Vocal Music: A Case Study in Iranian Classical Music

音乐转录 | 7.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3026 字 阅读 →
论文解读

Sonifying I2S Transport Signals to Detect Transmission Faults

音频分类 | 5.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6274 字 阅读 →
论文解读

FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5096 字 阅读 →
论文解读

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

多模态模型 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6568 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-14

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 36 分钟 · 17828 字 阅读 →
论文解读

Easper: An Accessible ASR Pipeline for Language Documentation

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5955 字 阅读 →
论文解读

DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers

音频交互 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6288 字 阅读 →
论文解读

omni-macos: On-Device Omni-Modal Search on Apple Silicon

音频检索 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6772 字 阅读 →
论文解读

GraphIDyOM: A graph-native Python reimplementation of IDyOM for musical expectation modelling

音乐理解 | 7.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5997 字 阅读 →
论文解读

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6160 字 阅读 →
论文解读

Music-Source-Separation-Training (MSST): A Unified Framework for Training and Evaluating Music Demixing Models

音乐源分离 | 5.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7537 字 阅读 →
论文解读

A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour

语音合成 | 6.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6602 字 阅读 →
论文解读

A Study of Parallelizable Alternatives to Dynamic Time Warping for Aligning Long Sequences

基准测试 | 8.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6393 字 阅读 →