论文解读

Cross-Modal Navigation with Multi-Agent Reinforcement Learning

具身导航 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6536 字 阅读 →
论文解读

Linear Semantic Segmentation for Low-Resource Spoken Dialects

语义分割 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7887 字 阅读 →
论文解读

More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4119 字 阅读 →
论文解读

To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6769 字 阅读 →
论文解读

Trustworthy Federated Label Distribution Learning under Annotation Quality Disparity

标签分布学习 | 8.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6635 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-07

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 79 分钟 · 39450 字 阅读 →
论文解读

A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2387 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5431 字 阅读 →
论文解读

ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-06

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 81 分钟 · 40463 字 阅读 →
论文解读

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3895 字 阅读 →
论文解读

HARMES: A Multi-Modal Dataset for Wearable Human Activity Recognition with Motion, Environmental Sensing and Sound

音频分类 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6251 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2680 字 阅读 →
论文解读

Neck-Learn: Attention-Based Multiple Instance Learning and Ensemble Framework for Ecological Momentary Assessment

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5210 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

数据集 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5318 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5190 字 阅读 →
论文解读

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5598 字 阅读 →
论文解读

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5102 字 阅读 →
论文解读

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2617 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

图像生成 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4164 字 阅读 →