论文解读

SMC-ITA: Sequential Monte Carlo Inference-Time Alignment for Video-to-Audio Generation

音频生成 | 7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5816 字 阅读 →
论文解读

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

多模态模型 | 6.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6186 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-09

共分析 48 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 141 分钟 · 70154 字 阅读 →
论文解读

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

语音情感识别 | 7.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5285 字 阅读 →
论文解读

Assessing True Generalisability of Audio-Visual Speech Recognisers

语音识别 | 9.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6841 字 阅读 →
论文解读

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

语音合成 | 9.2/10

 · 更新于 2026-09-06 · 约 26 分钟 · 12718 字 阅读 →
论文解读

FIGMA: Towards FIne-Grained Music retrievAl

对比学习 | 7.2/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4878 字 阅读 →
论文解读

Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

语音识别 | 9.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5472 字 阅读 →
论文解读

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

多模态模型 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5591 字 阅读 →
论文解读

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

多模态模型 | 7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5850 字 阅读 →
论文解读

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

多模态模型 | 6.4/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3789 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 108 分钟 · 53770 字 阅读 →
论文解读

Automatic Labelling of Speech Translation Errors

语音识别 | 6.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4750 字 阅读 →
论文解读

Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

多模态模型 | 5.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6789 字 阅读 →
论文解读

Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

音频问答 | 6.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6582 字 阅读 →
论文解读

Forgive or forget: Understanding the context of hate in audio retrieval systems

音频检索 | 7.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6360 字 阅读 →
论文解读

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

语音识别 | 9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6425 字 阅读 →
论文解读

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

语音识别 | 8.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6696 字 阅读 →
论文解读

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

说话人识别 | 6.8/10

 · 更新于 2026-09-06 · 约 27 分钟 · 13289 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-05

共分析 47 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 127 分钟 · 63374 字 阅读 →