论文解读

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

音频检索 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5371 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4370 字 阅读 →
论文解读

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4678 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4846 字 阅读 →
论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4951 字 阅读 →
论文解读

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8929 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4606 字 阅读 →
论文解读

The Deleuzian Representation Hypothesis

模型可解释性 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4780 字 阅读 →
论文解读

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

视频摘要 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5060 字 阅读 →
论文解读

TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems

语音合成评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4384 字 阅读 →
论文解读

Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5053 字 阅读 →
论文解读

VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Video

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4193 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

模型评估 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5353 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

基准测试 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4547 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3728 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4010 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20229 字 阅读 →
论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5425 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4107 字 阅读 →