论文解读

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

多模态问答 | 6.6/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8953 字 阅读 →
论文解读

Cross-Talk Speech Reduction, by Separation, for Separation

语音分离 | 9.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8921 字 阅读 →
论文解读

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

语音对话系统 | 7.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9025 字 阅读 →
论文解读

Executable Boundary Contracts for Sound Event Traces

音频事件检测 | 8.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9595 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 8.1/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9524 字 阅读 →
论文解读

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech

语音合成 | 9.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9678 字 阅读 →
论文解读

Executable Boundary Contracts for Sound Event Traces

音频事件检测 | 8.4/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9164 字 阅读 →
论文解读

GroupAffect-4: A Multimodal Dataset of Four-Person Collaborative Interaction

数据集 | 6.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9307 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8197 字 阅读 →
论文解读

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

视频理解 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 9001 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 82 分钟 · 40963 字 阅读 →
论文解读

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

音频安全 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9033 字 阅读 →
论文解读

Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

语音摘要 | 7.2/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11227 字 阅读 →
论文解读

Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities

音频问答 | 6.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8983 字 阅读 →
论文解读

ViMU: Benchmarking Video Metaphorical Understanding

基准测试 | 8.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7731 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-17

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 9 分钟 · 4469 字 阅读 →
论文解读

A Benchmark for Early-stage Parkinson's Disease Detection from Speech

语音生物标志物 | 7.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7457 字 阅读 →
论文解读

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

模型评估 | 6.3/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10971 字 阅读 →
论文解读

FutureSim: Replaying World Events to Evaluate Adaptive Agents

基准测试 | 7.6/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9806 字 阅读 →
论文解读

PROCESS-2: A Benchmark Speech Corpus for Early Cognitive Impairment Detection

语音生物标志物 | 5.4/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8039 字 阅读 →