论文解读

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

音频生成 | 7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4951 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4440 字 阅读 →
论文解读

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

语音编辑 | 8.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6408 字 阅读 →
论文解读

Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

语音增强 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5587 字 阅读 →
论文解读

Toward Native Multimodal Modeling: A Roadmap

多模态模型 | 10/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4994 字 阅读 →
论文解读

Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

大语言模型 | 5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6830 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-26

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 34648 字 阅读 →
论文解读

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

音视频 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6541 字 阅读 →
论文解读

Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech

语音质量评估 | 10/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6946 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-25

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25789 字 阅读 →
论文解读

A Survey of Audio Reasoning in Multimodal Foundation Models

音频推理 | 7.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8530 字 阅读 →
论文解读

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

多模态问答 | 6.6/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8953 字 阅读 →
论文解读

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

语音对话系统 | 7.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9025 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 8.1/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9524 字 阅读 →
论文解读

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

多模态模型 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8274 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7631 字 阅读 →
论文解读

EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection

音频深度伪造检测 | 7.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8115 字 阅读 →
论文解读

GroupAffect-4: A Multimodal Dataset of Four-Person Collaborative Interaction

数据集 | 6.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9307 字 阅读 →
论文解读

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

基准测试 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8197 字 阅读 →
论文解读

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

视频理解 | 7.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 9001 字 阅读 →