每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20229 字 阅读 →
论文解读

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5924 字 阅读 →
论文解读

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

音乐理解 | 8.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6721 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5245 字 阅读 →
论文解读

Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4287 字 阅读 →
论文解读

BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on POP and Classical Music

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4376 字 阅读 →
论文解读

DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6128 字 阅读 →
论文解读

FD-ARL: Feature Disentanglement with Adversarial-Reconstruction Learning for Cross-Subject Auditory Attention Decoding

听觉注意力解码 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3724 字 阅读 →
论文解读

Improving Audio Event Recognition with Consistency Regularization

音频事件检测 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4143 字 阅读 →
论文解读

Mambaformer: State-Space Augmented Self-Attention with Downup Sampling for Monaural Speech Enhancement

语音增强 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4866 字 阅读 →
论文解读

Multi-Task Transformer for Explainable Speech Deepfake Detection via Formant Modeling

语音伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4283 字 阅读 →
论文解读

ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4275 字 阅读 →
论文解读

RIR-Former: Coordinate-Guided Transformer for Continuous Reconstruction of Room Impulse Responses

房间脉冲响应 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4278 字 阅读 →
论文解读

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

空间音频 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6276 字 阅读 →
论文解读

Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4294 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20102 字 阅读 →
论文解读

Materialistic RIR: Material Conditioned Realistic RIR Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5449 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 59 分钟 · 29279 字 阅读 →
论文解读

Explicit Dropout: Deterministic Regularization for Transformer Architectures

这篇论文旨在解决传统Dropout方法依赖随机掩码、正则化效果不透明且难以精确控制的问题。其核心方法是提出一种确定性公式,将Dropout重新表述为一个可直接加入训练损失函数的显式正则化项,并推导出了适用于Transformer架构中注意力机制(Q、K、V)和前馈网络的正则化表达式。与已有方法相比,

 · 更新于 2026-09-25 · 约 5 分钟 · 2497 字 阅读 →