论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6828 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 64 分钟 · 31889 字 阅读 →
论文解读

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

语音分离 | 4.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8227 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 84 分钟 · 41962 字 阅读 →
论文解读

BAT: Better Audio Transformer Guided by Convex Gated Probing

音频分类 | 8.6/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9139 字 阅读 →
论文解读

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

空间音频 | 8.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8299 字 阅读 →
论文解读

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

音乐生成 | 8.1/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2789 字 阅读 →
论文解读

Rethinking Attention in Spiking Transformers: Overcoming Density Bias with Set Similarity

音频分类 | 3.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7033 字 阅读 →
论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

语音交互 | 7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5177 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-03

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 101 分钟 · 50504 字 阅读 →
论文解读

CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents

音频分离 | 7.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5663 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 55 分钟 · 27448 字 阅读 →
论文解读

NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction

语音生成 | 7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6037 字 阅读 →
论文解读

Progressive Alignment Objectives for Aligner-Encoder based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2719 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-24

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 98 分钟 · 48791 字 阅读 →
论文解读

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

Transformer | 7.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5452 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-19

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 110 分钟 · 54842 字 阅读 →
论文解读

Native Active Perception as Reasoning for Omni-Modal Understanding

语音识别 | 9.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6616 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 105 分钟 · 52107 字 阅读 →