论文解读

朗读课文不该读出抑郁:用证据边界把筛查关进可审计的笼子

语音情感识别 | 7.0/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11117 字 阅读 →
论文解读

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

音视频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4901 字 阅读 →
论文解读

Frame-Level Pansori Mode Classification with Complementary Audio Representations

音乐理解 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6284 字 阅读 →
论文解读

Masked diffusion enables coherent beat tracking

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5529 字 阅读 →
论文解读

Transfer Learning for Avian Bioacoustics under Sparse Positive Labels

音频分类 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →
论文解读

Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

音频伪造检测 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6916 字 阅读 →
论文解读

Towards Operational Conversational Intelligence: A Speech Intelligence Framework

说话人日志 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6520 字 阅读 →
论文解读

Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R

音频理解 | 7.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8024 字 阅读 →
论文解读

AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification

说话人验证 | 7.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7571 字 阅读 →
论文解读

Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6832 字 阅读 →
论文解读

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

语音情感识别 | 5.3/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7032 字 阅读 →
论文解读

Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026

音频事件检测 | 8.3/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9493 字 阅读 →
论文解读

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

音视频 | 7.9/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8619 字 阅读 →
论文解读

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

模型集成 | 9.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6811 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音质量评估 | 6.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6832 字 阅读 →
论文解读

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

语音情感识别 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5806 字 阅读 →
论文解读

SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits

多模态模型 | 4.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9967 字 阅读 →
论文解读

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6172 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6524 字 阅读 →
论文解读

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

语音识别 | 10/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6280 字 阅读 →