论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4794 字 阅读 →
论文解读

Huí Sù: Co-constructing a Dual Feedback Apparatus

音乐生成 | 5.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3319 字 阅读 →
论文解读

LLAC: Learned Lossless Audio Codec

音频无损编码 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3743 字 阅读 →
论文解读

MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5811 字 阅读 →
论文解读

MeanFlowSE: One-Step Generative Speech Enhancement via Conditional Mean Flow

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3795 字 阅读 →
论文解读

MeanSE: Efficient Generative Speech Enhancement with Mean Flows

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3917 字 阅读 →
论文解读

MECap-R1: Emotion-Aware Policy with Reinforcement Learning for Multimodal Emotion Captioning

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
论文解读

Noise-to-Notes: Diffusion-Based Generation and Refinement for Automatic Drum Transcription

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5198 字 阅读 →
论文解读

ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-Based Neural Speech Codec

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4793 字 阅读 →
论文解读

PG-SE: Predictive Acceleration and Correction for Generative Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5158 字 阅读 →
论文解读

Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4866 字 阅读 →
论文解读

PSTalker: Realistic 3D Talking Head Synthesis via a Semantic-Aware Audio-Driven Point-Based Shape

说话人合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4433 字 阅读 →
论文解读

ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4275 字 阅读 →
论文解读

SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution

音频增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4383 字 阅读 →
论文解读

Timbre-Based Pretraining with Pseudo-Labels for Multi-Instrument Automatic Music Transcription

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7980 字 阅读 →
论文解读

Tldiffgan: A Latent Diffusion-Gan Framework with Temporal Information Fusion for Anomalous Sound Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4622 字 阅读 →
论文解读

Two-Stage Language Model Framework for Acoustic Echo Cancellation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4401 字 阅读 →
论文解读

Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation

音视频 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4803 字 阅读 →
论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5135 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

本文针对文本转语音(TTS)任务,提出了一种名为“细节链”(Chain-of-Details, CoD)的新框架。**要解决的问题**是现有TTS方法在建模语音生成的时域动态(从粗略时序到精细声学细节的渐进过程)方面存在不足。**使用的方法**是将语音生成分解为多个时间分辨率递增的阶段,在每个阶段使

 · 更新于 2026-09-25 · 约 10 分钟 · 4525 字 阅读 →