论文解读

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

说话人验证 | 7/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8893 字 阅读 →
论文解读

Streaming Speech-to-Text Translation with a SpeechLLM

语音翻译 | 6.8/10

 · 更新于 2026-09-10 · 约 22 分钟 · 10616 字 阅读 →
论文解读

Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report

说话人验证 | 5.5/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9548 字 阅读 →
论文解读

Transmit Beamforming for High-Rate Underwater Acoustic Communications

水声通信 | 5.3/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6683 字 阅读 →
论文解读

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

语音合成 | 5.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8691 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-15

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 83 分钟 · 41092 字 阅读 →
论文解读

Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval

语音活动检测 | 7.0/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9877 字 阅读 →
论文解读

Decoupled Azimuth Elevation AoA Estimation Exploiting Kronecker Separable Steering Matrices

声源定位 | 7.0/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8639 字 阅读 →
论文解读

Does language matter for spoken word classification? A multilingual generative meta-learning approach

音频分类 | 6.0/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7080 字 阅读 →
论文解读

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

语音对话系统 | 8.0/10

 · 更新于 2026-09-10 · 约 20 分钟 · 9925 字 阅读 →
论文解读

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

多智能体协同 | 8.0/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9029 字 阅读 →
论文解读

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

几何推理 | 7.0/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7034 字 阅读 →
论文解读

Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

音视频 | 7.0/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8769 字 阅读 →
论文解读

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

动机访谈编码 | 6.0/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6770 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 7.0/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7828 字 阅读 →
论文解读

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

生成模型 | 6.5/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7708 字 阅读 →
论文解读

Scaling few-shot spoken word classification with generative meta-continual learning

音频分类 | 7.0/10

 · 更新于 2026-09-10 · 约 15 分钟 · 7189 字 阅读 →
论文解读

Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering

音频生成 | 7.0/10

 · 更新于 2026-09-10 · 约 21 分钟 · 10175 字 阅读 →
论文解读

Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

模型评估 | 8.0/10

 · 更新于 2026-09-10 · 约 22 分钟 · 10630 字 阅读 →
论文解读

Text2Score: Generating Sheet Music From Textual Prompts

乐谱生成 | 7.0/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9318 字 阅读 →