论文解读

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

端到端 | 8.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7765 字 阅读 →
论文解读

ASR-Roundtrip Evaluation Can Mask Context- and Convention-Dependent Reading Errors in Chinese News TTS

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6433 字 阅读 →
论文解读

DuplexWorld: Can voice agents help you get through the day?

语音交互 | 8.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8820 字 阅读 →
论文解读

In Defense of Using Worst-case Privacy Disclosure as Privacy Evaluation Metric of Voice Anonymization

说话人验证 | 7.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5631 字 阅读 →
论文解读

MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6358 字 阅读 →
论文解读

Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9335 字 阅读 →
论文解读

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

语音交互 | 7.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9423 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 76 分钟 · 37591 字 阅读 →
论文解读

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

音频字幕生成 | 8.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11629 字 阅读 →
论文解读

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

音视频理解 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6883 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-11

共分析 40 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 114 分钟 · 56810 字 阅读 →
论文解读

Assessing AI-generated music detection in real-world broadcast monitoring

音频伪造检测 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6180 字 阅读 →
论文解读

Frame-Level Pansori Mode Classification with Complementary Audio Representations

音乐理解 | 7.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6284 字 阅读 →
论文解读

MMAG: A Multi-Control Mixed Audio Generation Benchmark

音频生成 | 6.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7097 字 阅读 →
论文解读

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

多模态模型 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 7003 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-10

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 45 分钟 · 22351 字 阅读 →
论文解读

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

语音伪造检测 | 8.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11604 字 阅读 →
论文解读

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

音乐转录 | 7.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5987 字 阅读 →
论文解读

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

音视频问答 | 5.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7600 字 阅读 →
论文解读

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

语音交互 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6937 字 阅读 →