论文解读

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6236 字 阅读 →
论文解读

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

数据集 | 8.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8064 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 104 分钟 · 51914 字 阅读 →
论文解读

3DAE: Binaural Quality Assessment for Audio Novel View Synthesis with Spatial Maps and Benchmark

音频质量评估 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6369 字 阅读 →
论文解读

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6336 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-01

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 73 分钟 · 36167 字 阅读 →
论文解读

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

基准测试 | 9.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6831 字 阅读 →
论文解读

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6454 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-29

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28306 字 阅读 →
论文解读

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9207 字 阅读 →
论文解读

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

语音生成 | 9.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6224 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-28

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 42014 字 阅读 →
论文解读

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

多模态模型 | 9.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6285 字 阅读 →
论文解读

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

音频生成 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5779 字 阅读 →
论文解读

PitchBench: Measuring Pitch Hearing in Audio-Language Models

基准测试 | 9.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4876 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-27

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 121 分钟 · 60546 字 阅读 →
论文解读

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

音视频 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6541 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-25

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25789 字 阅读 →
论文解读

A Survey of Audio Reasoning in Multimodal Foundation Models

音频推理 | 7.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8530 字 阅读 →
论文解读

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7727 字 阅读 →