论文解读

From Volterra Series to Kunchenko Stochastic Polynomials: Half a Century of Non-Gaussian Estimation Methodology

统计信号处理 | 7.8/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5756 字 阅读 →
论文解读

In Silico Modeling of the RAMPHO Buffer: Dissociating Informational and Energetic Masking via Phonetic Entropy in Deep Neural Networks

认知科学 | 6.5/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5140 字 阅读 →
论文解读

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

跨模态 | 9.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5861 字 阅读 →
论文解读

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

音乐生成 | 5.9/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7711 字 阅读 →
论文解读

MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

跨模态 | 6.5/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6048 字 阅读 →
论文解读

Neighbor-Consistent Neural Filters for Robust Personal Sound Zones Under Localization Uncertainty

声区控制 | 8.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8836 字 阅读 →
论文解读

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

音视频 | 7.3/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6324 字 阅读 →
论文解读

Plug-in Losses for Evidential Deep Learning: A Simplified Framework for Uncertainty Estimation that Includes the Softmax Classifier

模型评估 | 3.5/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6504 字 阅读 →
论文解读

Real-time, EDM-inspired sonfication of the activity of a supercomputer

数据声化 | 6.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5745 字 阅读 →
论文解读

RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching

语音合成 | 7.8/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6377 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-22

共分析 15 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 41 分钟 · 20533 字 阅读 →
论文解读

A conceptual framework for learning to listen by reward: Curiosity-driven search for novel sources

声源定位 | 4.0/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8794 字 阅读 →
论文解读

A strongly annotated passive acoustic dataset for tropical bird monitoring

生物声学 | 7.2/10

 · 更新于 2026-09-10 · 约 21 分钟 · 10188 字 阅读 →
论文解读

A Survey of Audio Reasoning in Multimodal Foundation Models

音频推理 | 7.7/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8530 字 阅读 →
论文解读

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

音频大模型 | 6.2/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7477 字 阅读 →
论文解读

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

语音识别 | 6.8/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7727 字 阅读 →
论文解读

Causal Spatio-Temporal Sound Field Reconstruction

声场重建 | 8.7/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7814 字 阅读 →
论文解读

CoarseSoundNet: Building a reliable model for ecological soundscape analysis

音频分类 | 8.5/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8312 字 阅读 →
论文解读

Codec-Robust Attacks on Audio LLMs

音频安全 | 8.3/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8462 字 阅读 →
论文解读

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

音频生成 | 8.7/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7201 字 阅读 →