论文解读

Missing-Token Prompted Reliability-Aware Fusion for Robust Polyglot Speaker Identification

说话人识别 | 8.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38140 字 阅读 →
论文解读

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

语音合成 | 5.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4836 字 阅读 →
论文解读

Context-Aware Multimodal Claim Verification in Spoken Dialogues

多模态模型 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6922 字 阅读 →
论文解读

Frozen Multimodal Embeddings for Personality and Cognitive Ability Assessment in Asynchronous Video Interviews

语音情感识别 | 6.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6098 字 阅读 →
论文解读

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

音频问答 | 9.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6896 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-11

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 99 分钟 · 49581 字 阅读 →
论文解读

AuRA: Internalizing Audio Understanding into LLMs as LoRA

语音问答 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3100 字 阅读 →
论文解读

DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

音乐评估 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5161 字 阅读 →
论文解读

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6823 字 阅读 →
论文解读

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5486 字 阅读 →
论文解读

KFC-KWS: Keyframe Fusion with CTC for User-Defined Keyword Spotting

关键词检测 | 7.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5345 字 阅读 →
论文解读

Optimizing 2D Input Representations and Sub-phase Fusion Strategies for Differential Diagnosis of Asthma and COPD Using CNN- and GRU-Based Networks

数据增强 | 6.8/10

 · 更新于 2026-09-25 · 约 48 分钟 · 23710 字 阅读 →
论文解读

Profy: Interpretable Visualization of Expertise-Dependent Motor Skills Toward Supporting Piano Practice

音乐信息检索 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

对比学习 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6068 字 阅读 →
论文解读

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

多模态模型 | 9.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5947 字 阅读 →
论文解读

Speech Encoder Fusion for LLM-based Automatic Speech Recognition

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5281 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-10

共分析 45 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 126 分钟 · 62690 字 阅读 →
论文解读

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6046 字 阅读 →
论文解读

Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

语音识别 | 5.4/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8872 字 阅读 →