论文解读

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

语音对话系统 | 8.0/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9925 字 阅读 →
论文解读

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

多智能体协同 | 8.0/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9029 字 阅读 →
论文解读

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

几何推理 | 7.0/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7034 字 阅读 →
论文解读

Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

音视频 | 7.0/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8769 字 阅读 →
论文解读

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

动机访谈编码 | 6.0/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6770 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 7.0/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7828 字 阅读 →
论文解读

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

生成模型 | 6.5/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7708 字 阅读 →
论文解读

Scaling few-shot spoken word classification with generative meta-continual learning

音频分类 | 7.0/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7189 字 阅读 →
论文解读

Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering

音频生成 | 7.0/10

 · 更新于 2026-10-01 · 约 21 分钟 · 10175 字 阅读 →
论文解读

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

模型评估 | 8.0/10

 · 更新于 2026-10-01 · 约 22 分钟 · 10630 字 阅读 →
论文解读

Text2Score: Generating Sheet Music From Textual Prompts

乐谱生成 | 7.0/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9318 字 阅读 →
论文解读

Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8776 字 阅读 →
论文解读

WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

语音识别 | 7.0/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7464 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-14

共分析 16 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 62 分钟 · 30769 字 阅读 →
论文解读

A Semi-Supervised Framework for Speech Confidence Detection using Whisper

语音自信度检测 | 6.5/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9646 字 阅读 →
论文解读

Adaptive Diagonal Loading using Krylov Subspaces for Robust Beamforming

声源定位 | 7.5/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8591 字 阅读 →
论文解读

AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling

音频编码 | 7.0/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8374 字 阅读 →
论文解读

AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling

音频生成 | 6.0/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8049 字 阅读 →
论文解读

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

多模态模型评估 | 5.5/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9061 字 阅读 →
论文解读

Chunkwise Aligners for Streaming Speech Recognition

语音识别 | 6.3/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9896 字 阅读 →