每日研究速递

语音/音乐/音频论文速递 2026-05-06

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 81 分钟 · 40463 字 阅读 →
论文解读

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4252 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-05

共分析 33 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 104 分钟 · 51662 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音视频 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5220 字 阅读 →
论文解读

Transformer-based End-to-End Control Filter Generation for Active Noise Control

主动噪声控制 | 7.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6089 字 阅读 →
论文解读

TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction

脑编码 | 9.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4604 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 41 分钟 · 20229 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5924 字 阅读 →
论文解读

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

音乐理解 | 8.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6721 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5245 字 阅读 →
论文解读

Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations

音乐信息检索 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4287 字 阅读 →
论文解读

BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on POP and Classical Music

音乐信息检索 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4376 字 阅读 →
论文解读

DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6128 字 阅读 →
论文解读

FD-ARL: Feature Disentanglement with Adversarial-Reconstruction Learning for Cross-Subject Auditory Attention Decoding

听觉注意力解码 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3724 字 阅读 →
论文解读

Improving Audio Event Recognition with Consistency Regularization

音频事件检测 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4143 字 阅读 →
论文解读

Mambaformer: State-Space Augmented Self-Attention with Downup Sampling for Monaural Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4866 字 阅读 →
论文解读

Multi-Task Transformer for Explainable Speech Deepfake Detection via Formant Modeling

语音伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4283 字 阅读 →
论文解读

ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4275 字 阅读 →
论文解读

RIR-Former: Coordinate-Guided Transformer for Continuous Reconstruction of Room Impulse Responses

房间脉冲响应 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4278 字 阅读 →