论文解读

并行相加代替串行求余:PACodec 如何用小码本做低码率语音编码

PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。

 · 更新于 2026-09-24 · 约 19 分钟 · 9436 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-24 · 约 17 分钟 · 8454 字 阅读 →
论文解读

在一条潜流里同时生成两条音轨:解耦语义与声学后的少步分离

音乐源分离 | 5.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11167 字 阅读 →
论文解读

既要指向性,又要去混响:一次前向如何重建干净的虚拟方向麦克风

空间音频 | 5.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7955 字 阅读 →
论文解读

让声码器也理解方向:CSAVocoder 把空间线索留在最后一公里

空间音频 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP

音乐生成 | 5.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6931 字 阅读 →
论文解读

LILAC: An Idempotent Neural Speech Codec

语音编码 | 8.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6008 字 阅读 →
论文解读

Efficient Audio Enhancement with a Differentiable Psychoacoustic Loss

音频超分辨 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6540 字 阅读 →
论文解读

Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding

语音合成 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6739 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

音频伪造检测 | 6.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7804 字 阅读 →
论文解读

Query-Based Asymmetric Modeling with Decoupled Input–Output Rates for Speech Restoration

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6737 字 阅读 →
论文解读

OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7900 字 阅读 →
论文解读

Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4894 字 阅读 →
论文解读

DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration

生成对抗网络 | 8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks

生成对抗网络 | 7.2/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4695 字 阅读 →
论文解读

PhysDrift: Bridging the Embodiment Gap in Humanoid Co-Speech Motion Generation

语音合成 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6816 字 阅读 →
论文解读

Zero-VC: Zero-Lookahead Streaming Voice Conversion via Speaker Anonymization

语音转换 | 6.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5580 字 阅读 →
论文解读

QC-GAN: A Parameter-Efficient Quaternion Conformer GAN for High-Fidelity Speech Enhancement

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6928 字 阅读 →
论文解读

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

音频生成 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5275 字 阅读 →
论文解读

Feature-Aligned Speech Watermarking for Robustness to Reconstruction Distortions

鲁棒性 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7369 字 阅读 →