论文解读

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

音频理解 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6409 字 阅读 →
论文解读

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

音视频生成 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8106 字 阅读 →
论文解读

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

音视频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7829 字 阅读 →
论文解读

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

音视频问答 | 7.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9623 字 阅读 →
论文解读

VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio

音频检索 | 8.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6711 字 阅读 →
论文解读

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

音视频理解 | 7.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7157 字 阅读 →
论文解读

TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue

语音交互 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5205 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-03

共分析 31 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 101 分钟 · 50504 字 阅读 →
论文解读

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

音频理解 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24050 字 阅读 →
论文解读

Dilemmadata: On the Interoperability of Heterogeneous Roman Numeral Datasets

数据集 | 10/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4937 字 阅读 →
论文解读

LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6067 字 阅读 →
论文解读

What Counts as an Error? Dual-Reference Benchmarking for Atypical ASR

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12422 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-01

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 50963 字 阅读 →
论文解读

Agent-Computer Observation Interfaces Enable Dynamic Computer Use

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6790 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 51078 字 阅读 →
论文解读

RedVox: Safety and Fairness Gaps in Speech Models Across Languages

基准测试 | 6.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4946 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-26

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 55 分钟 · 27448 字 阅读 →
论文解读

BCoughBench: Benchmarking Respiratory Acoustic Foundation Models Under Body-Coupled Wearable Sensor Conditions

基准测试 | 6.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6270 字 阅读 →
论文解读

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5630 字 阅读 →