论文解读

CORTEG: Foundation Models Enable Cross-Modality Representation Transfer from Scalp to Intracranial Brain Recordings

脑机接口 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9166 字 阅读 →
论文解读

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

音频检索 | 6.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9517 字 阅读 →
论文解读

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

 · 更新于 2026-09-25 · 约 14 分钟 · 7004 字 阅读 →
论文解读

Do Melody and Rhythm Coevolve?

音乐认知 | 7.5/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10700 字 阅读 →
论文解读

PianoCoRe: Combined and Refined Piano MIDI Dataset

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7756 字 阅读 →
论文解读

Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4636 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4468 字 阅读 →
论文解读

Contrastive Regularization for Accent-Robust ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3952 字 阅读 →
论文解读

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5862 字 阅读 →
论文解读

Ecologically-Constrained Task Arithmetic for Multi-Taxa Bioacoustic Classifiers Without Shared Data

生物声学 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6468 字 阅读 →
论文解读

HARMES: A Multi-Modal Dataset for Wearable Human Activity Recognition with Motion, Environmental Sensing and Sound

音频分类 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6251 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2680 字 阅读 →
论文解读

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4252 字 阅读 →
论文解读

NH-CROP: Robust Pricing for Governed Language Data Assets under Cost Uncertainty

强化学习 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5919 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

数据集 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5318 字 阅读 →
论文解读

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5598 字 阅读 →
论文解读

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5251 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10720 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4141 字 阅读 →
论文解读

CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval

音频检索 音乐理解 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5689 字 阅读 →