论文解读

Hanui: Harnessing Distributional Discrepancies for Singing Voice Deepfake Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4470 字 阅读 →
论文解读

HarmoNet: Music Grounding by Short Video via Harmonic Resample and Dynamic Sparse Alignment

音乐检索 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4256 字 阅读 →
论文解读

Hashing-Baseline: Rethinking Hashing in the Age of Pretrained Models

音频检索 音频分类 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4362 字 阅读 →
论文解读

HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection with Multichannel Audio and Multiscale Visual Cues

音频事件检测 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4420 字 阅读 →
论文解读

HCGAN: Harmonic-Coupled Generative Adversarial Network for Speech Super-Resolution in Low-Bandwidth Scenarios

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4284 字 阅读 →
论文解读

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-Based TTS

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4633 字 阅读 →
论文解读

HergNet: A Fast Neural Surrogate Model for Sound Field Predictions Via Superposition of Plane Waves

空间音频 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4414 字 阅读 →
论文解读

HFSQVAE: Hierarchical Vector Quantization with Residuals for Frequency-Specific Embedding

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3438 字 阅读 →
论文解读

Hierarchical Activity Recognition and Captioning from Long-Form Audio

音频事件检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4494 字 阅读 →
论文解读

Hierarchical Discrete Flow Matching For Multi-Codebook Codec-Based Text-To-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3910 字 阅读 →
论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4794 字 阅读 →
论文解读

HiFi-HARP: A High-Fidelity 7th-Order Ambisonic Room Impulse Response Dataset

数据集 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5023 字 阅读 →
论文解读

High-Fidelity Speech Enhancement Via Discrete Audio Tokens

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4455 字 阅读 →
论文解读

How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-Resource Transfer

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3861 字 阅读 →
论文解读

How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4091 字 阅读 →
论文解读

HVAC-EAR: Eavesdropping Human Speech Using HVAC Systems

音频安全 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5225 字 阅读 →
论文解读

Hybrid Pruning: In-Situ Compression of Self-Supervised Speech Models for Speaker Verification and Anti-Spoofing

说话人验证 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4788 字 阅读 →
论文解读

HyFlowSE: Hybrid End-To-End Flow-Matching Speech Enhancement via Generative-Discriminative Learning

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4024 字 阅读 →
论文解读

I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-Based Single-Channel Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4966 字 阅读 →
论文解读

IBPCodec : A Low-Bitrate Lightweight Speech Codec With Inter-Band Prediction

语音编码 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3768 字 阅读 →