论文解读

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

模型评估 | 6.3/10

 · 更新于 2026-10-01 · 约 22 分钟 · 10971 字 阅读 →
论文解读

FSD50K-Solo: Automated Curation of Single-Source Sound Events

数据清洗 | 5.5/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6839 字 阅读 →
论文解读

FutureSim: Replaying World Events to Evaluate Adaptive Agents

基准测试 | 7.6/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9806 字 阅读 →
论文解读

IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

语音提取 | 6/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8685 字 阅读 →
论文解读

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

音频分类 | 5.5/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9405 字 阅读 →
论文解读

MediaClaw: Multimodal Intelligent-Agent Platform Technical Report

多模态模型 | 3.3/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7378 字 阅读 →
论文解读

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

基础模型 | 6.8/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9331 字 阅读 →
论文解读

Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music

音乐生成 | 6.7/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6651 字 阅读 →
论文解读

Physics-Based iOCT Sonification for Real-time Interaction Awareness in Subretinal Injection

医疗音频 | 6.5/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7411 字 阅读 →
论文解读

PROCESS-2: A Benchmark Speech Corpus for Early Cognitive Impairment Detection

语音生物标志物 | 5.4/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8039 字 阅读 →
论文解读

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

语音识别 | 7.5/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8162 字 阅读 →
论文解读

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

说话人验证 | 7/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8893 字 阅读 →
论文解读

Streaming Speech-to-Text Translation with a SpeechLLM

语音翻译 | 6.8/10

 · 更新于 2026-10-01 · 约 22 分钟 · 10616 字 阅读 →
论文解读

Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report

说话人验证 | 5.5/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9548 字 阅读 →
论文解读

Transmit Beamforming for High-Rate Underwater Acoustic Communications

水声通信 | 5.3/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6683 字 阅读 →
论文解读

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

语音合成 | 5.5/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8691 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-15

共分析 20 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 83 分钟 · 41092 字 阅读 →
论文解读

Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval

语音活动检测 | 7.0/10

 · 更新于 2026-10-01 · 约 20 分钟 · 9877 字 阅读 →
论文解读

Decoupled Azimuth Elevation AoA Estimation Exploiting Kronecker Separable Steering Matrices

声源定位 | 7.0/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8639 字 阅读 →
论文解读

Does language matter for spoken word classification? A multilingual generative meta-learning approach

音频分类 | 6.0/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7080 字 阅读 →