论文解读

Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics

生理信号预测 | 6/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8109 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-18

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 48 分钟 · 23894 字 阅读 →
论文解读

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

音视频分割 | 7.2/10

 · 更新于 2026-09-10 · 约 23 分钟 · 11356 字 阅读 →
论文解读

ViMU: Benchmarking Video Metaphorical Understanding

基准测试 | 8.1/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7731 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-17

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 9 分钟 · 4469 字 阅读 →
论文解读

A Benchmark for Early-stage Parkinson's Disease Detection from Speech

语音生物标志物 | 7.2/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7457 字 阅读 →
论文解读

A Calculus-Based Framework for Determining Vocabulary Size in End-to-End ASR

语音识别 | 3.9/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8601 字 阅读 →
论文解读

AudioMosaic: Contrastive Masked Audio Representation Learning

音频分类 | 7.3/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7392 字 阅读 →
论文解读

Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis

音频生成 | 6.8/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8349 字 阅读 →
论文解读

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

模型评估 | 6.3/10

 · 更新于 2026-09-10 · 约 22 分钟 · 10971 字 阅读 →
论文解读

FSD50K-Solo: Automated Curation of Single-Source Sound Events

数据清洗 | 5.5/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6839 字 阅读 →
论文解读

FutureSim: Replaying World Events to Evaluate Adaptive Agents

基准测试 | 7.6/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9806 字 阅读 →
论文解读

IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

语音提取 | 6/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8685 字 阅读 →
论文解读

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

音频分类 | 5.5/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9405 字 阅读 →
论文解读

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

多模态模型 | 3.3/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7378 字 阅读 →
论文解读

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

基础模型 | 6.8/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9331 字 阅读 →
论文解读

Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music

音乐生成 | 6.7/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6651 字 阅读 →
论文解读

Physics-Based iOCT Sonification for Real-time Interaction Awareness in Subretinal Injection

医疗音频 | 6.5/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7411 字 阅读 →
论文解读

PROCESS-2: A Benchmark Speech Corpus for Early Cognitive Impairment Detection

语音生物标志物 | 5.4/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8039 字 阅读 →
论文解读

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8162 字 阅读 →