论文解读

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5486 字 阅读 →
论文解读

Linguistically Augmented Audio Speech Data (LinguAS)

语音伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

OpenBibleTTS: Large-Scale Speech Resources and TTS Models for Low-Resource Languages

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6802 字 阅读 →
论文解读

Revisiting Lexicon Evaluation in Unsupervised Word Discovery

语音识别 | 1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5346 字 阅读 →
论文解读

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6366 字 阅读 →
论文解读

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

基准测试 | 8.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5681 字 阅读 →
论文解读

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

多模态模型 | 9.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6131 字 阅读 →
论文解读

Representation Matters in Randomized Smoothing for Audio Classification

音频分类 | 5.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4733 字 阅读 →
论文解读

SpeakerCard-1M: An Evidence-Grounded Speaker Card Corpus for In-the-Wild Speaker Verification

说话人验证 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6193 字 阅读 →
论文解读

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

数据集 | 8.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8064 字 阅读 →
论文解读

MindVoice: Reconstructing Intelligible Speech from Non-invasive Neural Signals with Pretrained Priors

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8301 字 阅读 →
论文解读

ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

语音识别 | 8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5167 字 阅读 →
论文解读

Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking

语音合成 | 8.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5895 字 阅读 →
论文解读

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

多模态模型 | 7.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6784 字 阅读 →
论文解读

Can We Hear from Events? Generating Speech from Event Camera

语音合成 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6885 字 阅读 →
论文解读

Toward Natural Emotional Text-To-Speech System with Fine-Grained Non-Verbal Expression Control

语音合成 | 6.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5960 字 阅读 →
论文解读

Cost-Effective Model Evaluation with Meta-Learning

迁移学习 | 5.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7948 字 阅读 →
论文解读

MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio

音频深度伪造检测 | 10/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7102 字 阅读 →
论文解读

MOTOR: A Multimodal Dataset for Two-Wheeler Rider Behavior Understanding

视频行为识别 | 5.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5468 字 阅读 →
论文解读

A strongly annotated passive acoustic dataset for tropical bird monitoring

生物声学 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10188 字 阅读 →