论文解读

Geometric Second-Order Feature Correlation Learning for Self-Supervised Speech Emotion Recognition

语音情感识别 | 7.9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5626 字 阅读 →
论文解读

Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

语音识别 | 9.2/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5472 字 阅读 →
论文解读

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

多模态模型 | 6.2/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5591 字 阅读 →
论文解读

How Far Can Chord-Symbol Time-Series Adaptation Carry Genre Identity? Capabilities and Boundaries in Multi-Genre Chord-Symbol Modeling

音乐信息检索 | 8.8/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5729 字 阅读 →
论文解读

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

语音合成 | 5.7/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6148 字 阅读 →
论文解读

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

语音对话系统 | 6.5/10

 · 更新于 2026-09-09 · 约 6 分钟 · 2562 字 阅读 →
论文解读

KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026

语音合成 | 7.2/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5494 字 阅读 →
论文解读

Leveraging Soft Distributions of SSL-Derived Discrete Speech Tokens for Downstream Inference

语音识别 | 7.4/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6365 字 阅读 →
论文解读

Making the Most of Limited Data: Score-Aware Training for Text-to-Music Generation

音乐生成 | 6.7/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6906 字 阅读 →
论文解读

Mitigating Proxy-to-Wild Domain Gap in Deepfake Speech

数据增强 | 8.4/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6757 字 阅读 →
论文解读

MMAE: A Massive Multitask Audio Editing Benchmark

语音编辑 | 7.5/10

 · 更新于 2026-09-09 · 约 9 分钟 · 4396 字 阅读 →
论文解读

Multilingual Multi-Speaker Unit Vocoders: A Systematic Analysis of Discrete Speech Representations

语音合成 | 8.4/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5643 字 阅读 →
论文解读

MyGardenBird: A Machine-Learning-Ready Bird Sound Dataset for Twelve Common Malaysian Birds

音频事件检测 | 7.2/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5600 字 阅读 →
论文解读

Phonetic Error Analysis of Raw Waveform Acoustic Models

语音识别 | 7.6/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4614 字 阅读 →
论文解读

SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails

语音增强 | 7.5/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5847 字 阅读 →
论文解读

SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models

数据增强 | 5.5/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4925 字 阅读 →
论文解读

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

多模态模型 | 7/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5850 字 阅读 →
论文解读

TargetSEC: Plug-and-Play In-the-Wild Speech Emotion Conversion via Arousal-Conditioned Latent Style Diffusion

语音转换 | 6.8/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5649 字 阅读 →
论文解读

Towards Event-Robust Acoustic Scene Classification

数据增强 | 6.5/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4996 字 阅读 →
论文解读

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

语音合成 | 7.7/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5202 字 阅读 →