每日研究速递

语音/音乐/音频论文速递 2026-05-07

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 79 分钟 · 39450 字 阅读 →
论文解读

Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework

说话头伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6781 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12846 字 阅读 →
论文解读

ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Toward Structural Multimodal Representations: Specialization, Selection, and Sparsification via Mixture-of-Experts

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6070 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-06

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 81 分钟 · 40463 字 阅读 →
论文解读

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3895 字 阅读 →
论文解读

Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

音视频 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6444 字 阅读 →
论文解读

HARMES: A Multi-Modal Dataset for Wearable Human Activity Recognition with Motion, Environmental Sensing and Sound

音频分类 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6251 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2680 字 阅读 →
论文解读

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5860 字 阅读 →
论文解读

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

多模态幻觉缓解 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5400 字 阅读 →
论文解读

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音视频 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5294 字 阅读 →
论文解读

MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings

肺炎筛查 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5935 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

数据集 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5318 字 阅读 →
论文解读

PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention

多模态讽刺检测 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6125 字 阅读 →
论文解读

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5598 字 阅读 →
论文解读

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5102 字 阅读 →
论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4618 字 阅读 →
论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

音频分离 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4519 字 阅读 →