论文解读

Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models

语音识别 | 9.6/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1866 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6300 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-04

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 60 分钟 · 29896 字 阅读 →
论文解读

A Training-Efficient Transformer-Based Anti-Spoofing Network for Logical Access in ASVspoof 5

Transformer | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6690 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-03

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 123 分钟 · 61249 字 阅读 →
论文解读

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2923 字 阅读 →
论文解读

Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5329 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-01

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36167 字 阅读 →
论文解读

MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding

Transformer | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5123 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-30

共分析 6 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 17 分钟 · 8127 字 阅读 →
论文解读

SAME: A Semantically-Aligned Music Autoencoder

音频编码 | 8.5/10

 · 更新于 2026-09-25 · 约 26 分钟 · 13010 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-19

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 128 分钟 · 63905 字 阅读 →
论文解读

Towards Open World Sound Event Detection

音频事件检测 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6369 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-06

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 81 分钟 · 40463 字 阅读 →
论文解读

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4252 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-05

共分析 33 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 104 分钟 · 51662 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音视频 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5220 字 阅读 →
论文解读

Transformer-based End-to-End Control Filter Generation for Active Noise Control

主动噪声控制 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6089 字 阅读 →
论文解读

TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction

脑编码 | 9.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4604 字 阅读 →