论文解读

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

语音合成 | 9.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5638 字 阅读 →
论文解读

Turning music identification into a neural forward pass

音频分类 | 7.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6103 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-17

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 94 分钟 · 46631 字 阅读 →
论文解读

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

多模态模型 | 7.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5649 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-16

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 168 分钟 · 83790 字 阅读 →
论文解读

FAConformer: Frequency-Aware Convolutional Transformer for Auditory Attention Decoding

Transformer | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6445 字 阅读 →
论文解读

Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models

语音识别 | 9.6/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1866 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6300 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-04

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 60 分钟 · 29896 字 阅读 →
论文解读

A Training-Efficient Transformer-Based Anti-Spoofing Network for Logical Access in ASVspoof 5

Transformer | 6.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6690 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-03

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 123 分钟 · 61249 字 阅读 →
论文解读

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

语音合成 | 10/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2923 字 阅读 →
论文解读

Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation

音乐生成 | 7.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5329 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-01

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36167 字 阅读 →
论文解读

MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding

Transformer | 8.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5123 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-30

共分析 6 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 17 分钟 · 8127 字 阅读 →
论文解读

SAME: A Semantically-Aligned Music Autoencoder

音频编码 | 8.5/10

 · 更新于 2026-09-06 · 约 26 分钟 · 13010 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-19

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 128 分钟 · 63905 字 阅读 →
论文解读

Towards Open World Sound Event Detection

音频事件检测 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6369 字 阅读 →