论文解读

Towards Quantifying Benchmark Optimization in ASR Models

语音识别 | 8.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6239 字 阅读 →
论文解读

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

音视频生成 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5274 字 阅读 →
论文解读

ChiroEcho: extending automated bat vocalisation classification beyond the learned taxonomy

音频分类 | 6.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5454 字 阅读 →
论文解读

Computational Features for Symbolic Melody Analysis

音乐理解 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4792 字 阅读 →
论文解读

Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5074 字 阅读 →
论文解读

Geometric Iterative Retrieval for Neural Audio Codec Resynthesis

音频编码 | 7.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5287 字 阅读 →
论文解读

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

多模态模型 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4562 字 阅读 →
论文解读

Multimodal Rapport Estimation in Real-World HRI

多模态模型 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4533 字 阅读 →
论文解读

Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities

音频理解 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4569 字 阅读 →
论文解读

Sounds Uncertain: Exploring the Affective Aspects of Sonification for Uncertainty Visualization

音频生成 | 6.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4366 字 阅读 →
论文解读

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

语音交互 | 6.7/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4396 字 阅读 →
论文解读

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5996 字 阅读 →
论文解读

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

语音交互 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3159 字 阅读 →
论文解读

On computational approaches to Pop music culture

音乐理解 | 6.1/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2903 字 阅读 →
论文解读

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

语音情感识别 | 8.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3361 字 阅读 →
论文解读

The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report

语音伪造检测 | 6.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8140 字 阅读 →
论文解读

Uncertainty-Aware Decision Making in Multimodal Large Language Models

音频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3533 字 阅读 →
论文解读

A Parameter-Free Few-Shot Evaluation for Elephant Vocalisation Classification

音频分类 | 5.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5571 字 阅读 →
论文解读

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6787 字 阅读 →
论文解读

Numerical and perceptual validity of synthetic Head-Related Transfer Functions at scale

声源定位 | 7.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8223 字 阅读 →