论文解读

HarmoNet: Music Grounding by Short Video via Harmonic Resample and Dynamic Sparse Alignment

音乐检索 | 7.0/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4256 字 阅读 →
论文解读

Hashing-Baseline: Rethinking Hashing in the Age of Pretrained Models

音频检索 音频分类 | 8.0/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4362 字 阅读 →
论文解读

HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection with Multichannel Audio and Multiscale Visual Cues

音频事件检测 | 8.0/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4420 字 阅读 →
论文解读

HCGAN: Harmonic-Coupled Generative Adversarial Network for Speech Super-Resolution in Low-Bandwidth Scenarios

语音增强 | 8.0/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4284 字 阅读 →
论文解读

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-Based TTS

语音合成 | 8.0/10

 · 更新于 2026-09-12 · 约 10 分钟 · 4633 字 阅读 →
论文解读

HergNet: A Fast Neural Surrogate Model for Sound Field Predictions Via Superposition of Plane Waves

空间音频 | 7.0/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4414 字 阅读 →
论文解读

HFSQVAE: Hierarchical Vector Quantization with Residuals for Frequency-Specific Embedding

音频生成 | 7.0/10

 · 更新于 2026-09-12 · 约 7 分钟 · 3438 字 阅读 →
论文解读

Hierarchical Activity Recognition and Captioning from Long-Form Audio

音频事件检测 | 7.5/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4494 字 阅读 →
论文解读

Hierarchical Discrete Flow Matching For Multi-Codebook Codec-Based Text-To-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-12 · 约 8 分钟 · 3910 字 阅读 →
论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-12 · 约 10 分钟 · 4794 字 阅读 →
论文解读

HiFi-HARP: A High-Fidelity 7th-Order Ambisonic Room Impulse Response Dataset

数据集 | 7.5/10

 · 更新于 2026-09-12 · 约 11 分钟 · 5023 字 阅读 →
论文解读

High-Fidelity Speech Enhancement Via Discrete Audio Tokens

语音增强 | 7.5/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4455 字 阅读 →
论文解读

How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-Resource Transfer

语音识别 | 6.5/10

 · 更新于 2026-09-12 · 约 8 分钟 · 3861 字 阅读 →
论文解读

How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4091 字 阅读 →
论文解读

Huí Sù: Co-constructing a Dual Feedback Apparatus

音乐生成 | 5.5/10

 · 更新于 2026-09-12 · 约 7 分钟 · 3319 字 阅读 →
论文解读

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations

语音对话系统 | 7.5/10

 · 更新于 2026-09-12 · 约 12 分钟 · 5611 字 阅读 →
论文解读

HVAC-EAR: Eavesdropping Human Speech Using HVAC Systems

音频安全 | 8.5/10

 · 更新于 2026-09-12 · 约 11 分钟 · 5225 字 阅读 →
论文解读

Hybrid Pruning: In-Situ Compression of Self-Supervised Speech Models for Speaker Verification and Anti-Spoofing

说话人验证 | 8.0/10

 · 更新于 2026-09-12 · 约 10 分钟 · 4788 字 阅读 →
论文解读

HyFlowSE: Hybrid End-To-End Flow-Matching Speech Enhancement via Generative-Discriminative Learning

语音增强 | 8.0/10

 · 更新于 2026-09-12 · 约 9 分钟 · 4024 字 阅读 →
论文解读

I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-Based Single-Channel Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-12 · 约 10 分钟 · 4966 字 阅读 →