论文解读

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

音乐生成 | 8.1/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2789 字 阅读 →
论文解读

Rethinking Attention in Spiking Transformers: Overcoming Density Bias with Set Similarity

音频分类 | 3.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7033 字 阅读 →
论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5177 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-03

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 101 分钟 · 50504 字 阅读 →
论文解读

CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents

音频分离 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5663 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 55 分钟 · 27448 字 阅读 →
论文解读

NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction

语音生成 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6037 字 阅读 →
论文解读

Progressive Alignment Objectives for Aligner-Encoder based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2719 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-24

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 98 分钟 · 48791 字 阅读 →
论文解读

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

Transformer | 7.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5452 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-19

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 110 分钟 · 54842 字 阅读 →
论文解读

Native Active Perception as Reasoning for Omni-Modal Understanding

语音识别 | 9.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6616 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 105 分钟 · 52107 字 阅读 →
论文解读

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

语音合成 | 9.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5638 字 阅读 →
论文解读

Turning music identification into a neural forward pass

音频分类 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6103 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-17

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 94 分钟 · 46631 字 阅读 →
论文解读

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

多模态模型 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5649 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-16

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 168 分钟 · 83790 字 阅读 →
论文解读

FAConformer: Frequency-Aware Convolutional Transformer for Auditory Attention Decoding

Transformer | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6445 字 阅读 →