论文解读

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

音频理解 | 5.5/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2267 字 阅读 →
论文解读

Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study

音乐检索 | 8.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7467 字 阅读 →
论文解读

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

音乐生成 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7244 字 阅读 →
论文解读

Speaker Verification Under Real Classroom Conditions for English Speech

说话人验证 | 5.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7612 字 阅读 →
论文解读

Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding

语音属性识别 | 6.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5046 字 阅读 →
论文解读

FATE: Frame-Level Audio-Visual Temporal Embedding

音视频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6937 字 阅读 →
论文解读

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8227 字 阅读 →
论文解读

The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders

语音属性识别 | 7.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6369 字 阅读 →
论文解读

Joint Text-Audio Alignment for EEG-to-Text Decoding in Chinese Speech Production and Perception

语音交互 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7535 字 阅读 →
论文解读

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

音频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5915 字 阅读 →
论文解读

Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

声源定位 | 7.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8573 字 阅读 →
论文解读

Automatic Audio Equalization with Semantic Embeddings

语音增强 | 5.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7531 字 阅读 →
论文解读

Expose Your Disguise: Recovering Source Speaker Identity From Voice Conversion

对比学习 | 7.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6629 字 阅读 →
论文解读

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

音视频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7731 字 阅读 →
论文解读

Reflector: Arrangement-Aware Harmonic Retrieval for Sample-Based Composition

音乐检索 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5708 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 39 分钟 · 19087 字 阅读 →
论文解读

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

语音编码 | 9.2/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8587 字 阅读 →
论文解读

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

音频检索 | 8.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8119 字 阅读 →
论文解读

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

语音情感识别 | 5.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7242 字 阅读 →
论文解读

Time-Frequency Consistency Learning for Robust Speech Deepfake Detection

语音伪造检测 | 7.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6790 字 阅读 →