论文解读

LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4128 字 阅读 →
论文解读

Mapping the Methodological Space of Classroom Interaction Research: Scale, Duration, and Modality in an Age of AI

模型评估 | 6.0/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2848 字 阅读 →
论文解读

MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6271 字 阅读 →
论文解读

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

语音质量评估 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5548 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-01

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 35064 字 阅读 →
论文解读

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4165 字 阅读 →
论文解读

PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4333 字 阅读 →
论文解读

Similarity Choice and Negative Scaling in Supervised Contrastive Learning for Deepfake Audio Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4571 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4318 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-30

共分析 25 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 80 分钟 · 39601 字 阅读 →
论文解读

A Framework for Controlled Multi-Speaker Audio Synthesis for Robustness Evaluation of Speaker Diarisation Systems

说话人日志 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4437 字 阅读 →
论文解读

A Superb-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4149 字 阅读 →
论文解读

Aligning Generative Speech Enhancement with Perceptual Feedback

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5533 字 阅读 →
论文解读

AMBISONIC-DML: A Benchmark Dataset for Dynamic Higher-Order Ambisonics Music with Motion-Aligned Stems

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4335 字 阅读 →
论文解读

AQUA-Bench: Beyond finding answers to knowing when there are None in Audio Question Answering

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3971 字 阅读 →
论文解读

AR-BSNet: Towards Ultra-Low Complexity Autoregressive Target Speaker Extraction With Band-Split Modeling

语音分离 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4535 字 阅读 →
论文解读

Assessing Identity Leakage in Talking Face Generation: Metrics and Evaluation Framework

说话人脸生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3595 字 阅读 →
论文解读

Audio-Visual Deepfake Generation and Detection: An Exploratory Survey

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3233 字 阅读 →
论文解读

Auditory Illusion Benchmark for Large Audio Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3529 字 阅读 →
论文解读

Benchmarking Music Autotagging with MGPHot Expert Annotations vs. Generic Tag Datasets

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4442 字 阅读 →