论文解读

Neighbor-Consistent Neural Filters for Robust Personal Sound Zones Under Localization Uncertainty

声区控制 | 8.5/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8836 字 阅读 →
论文解读

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

音视频 | 7.3/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6324 字 阅读 →
论文解读

Plug-in Losses for Evidential Deep Learning: A Simplified Framework for Uncertainty Estimation that Includes the Softmax Classifier

模型评估 | 3.5/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6504 字 阅读 →
论文解读

Real-time, EDM-inspired sonfication of the activity of a supercomputer

数据声化 | 6.5/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5745 字 阅读 →
论文解读

RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching

语音合成 | 7.8/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6377 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-22

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-09 · 约 41 分钟 · 20533 字 阅读 →
论文解读

A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

声源定位 | 4.0/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8794 字 阅读 →
论文解读

A strongly annotated passive acoustic dataset for tropical bird monitoring

生物声学 | 7.2/10

 · 更新于 2026-09-09 · 约 21 分钟 · 10188 字 阅读 →
论文解读

A Survey of Audio Reasoning in Multimodal Foundation Models

音频推理 | 7.7/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8530 字 阅读 →
论文解读

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

音频大模型 | 6.2/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7477 字 阅读 →
论文解读

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

语音识别 | 6.8/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7727 字 阅读 →
论文解读

Causal Spatio-Temporal Sound Field Reconstruction

声场重建 | 8.7/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7814 字 阅读 →
论文解读

CoarseSoundNet: Building a reliable model for ecological soundscape analysis

音频分类 | 8.5/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8312 字 阅读 →
论文解读

Codec-Robust Attacks on Audio LLMs

音频安全 | 8.3/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8462 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 8.7/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7201 字 阅读 →
论文解读

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

多模态问答 | 6.6/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8953 字 阅读 →
论文解读

Cross-Talk Speech Reduction, by Separation, for Separation

语音分离 | 9.1/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8921 字 阅读 →
论文解读

DASM: Domain-Aware Sharpness Minimization for Multi-Domain Voice Stream Steganalysis

音频隐写分析 | 7.4/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6558 字 阅读 →
论文解读

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

语音对话系统 | 7.8/10

 · 更新于 2026-09-09 · 约 19 分钟 · 9025 字 阅读 →
论文解读

Evaluating Speech Articulation Synthesis with Articulatory Phoneme Recognition

语音质量评估 | 8.2/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7861 字 阅读 →