论文解读

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

音视频 | 7.3/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9061 字 阅读 →
论文解读

PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions

语音数据集 | 6.5/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9997 字 阅读 →
论文解读

Profiling the Voice: Speaker-Specific Phoneme Fingerprinting for Speech Deepfake Detection

语音伪造检测 | 7/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7180 字 阅读 →
论文解读

Robust Audio Tagging under Class-wise Supervision Unreliability

音频分类 | 7.3/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8618 字 阅读 →
论文解读

Robust Soft-Constrained Spatially Selective Active Noise Control for Hearables Under Secondary Path Variations

音频增强 | 5.7/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7281 字 阅读 →
论文解读

S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation

音乐生成 | 5.6/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9578 字 阅读 →
论文解读

SAME: A Semantically-Aligned Music Autoencoder

音频编码 | 8.5/10

 · 更新于 2026-10-01 · 约 26 分钟 · 13010 字 阅读 →
论文解读

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

语音合成 | 6.8/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7239 字 阅读 →
论文解读

SIREM: Speech-Informed MRI Reconstruction with Learned Sampling

医学图像重建 | 7.3/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8537 字 阅读 →
论文解读

Sometin Beta Pass Notin (SBPN): Improving Multilingual ASR for Nigerian Languages via Knowledge Distillation

语音识别 | 6.2/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7571 字 阅读 →
论文解读

Sonalyzer-Moz: A Framework for Analyzing the Structure of Mozart's Sonata Form

音乐结构分析 | 7.3/10

 · 更新于 2026-10-01 · 约 13 分钟 · 6193 字 阅读 →
论文解读

Speaker-Disentangled Remote Speech Detection of Asthma and COPD Exacerbations

医疗音频 | 7.5/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8869 字 阅读 →
论文解读

Stable Audio 3

音频生成 | 6.8/10

 · 更新于 2026-10-01 · 约 23 分钟 · 11116 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 语音合成 | 6.7/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7824 字 阅读 →
论文解读

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

语音识别 | 7/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7835 字 阅读 →
论文解读

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

对话情感识别 | 7.4/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6752 字 阅读 →
论文解读

Voice ''Cloning'' is Style Transfer

语音克隆 | 7/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8857 字 阅读 →
论文解读

WavFlow: Audio Generation in Waveform Space

音频生成 | 6.7/10

 · 更新于 2026-10-01 · 约 24 分钟 · 11712 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-19

共分析 34 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 128 分钟 · 63905 字 阅读 →
论文解读

ARIA: A Diagnostic Framework for Music Training Data Attribution

音乐生成 | 6.1/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9163 字 阅读 →