论文解读

Sparse Fluid Antenna Arrays: Continuous Position Design Beyond Classical DOF Limits

声源定位 | 7/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7558 字 阅读 →
论文解读

Towards Trust Calibration in Socially Interactive Agents: Investigating Gendered Multimodal Behaviors Generation with LLMs

社交智能体 | 5.9/10

 · 更新于 2026-10-01 · 约 21 分钟 · 10069 字 阅读 →
论文解读

When Vision Speaks for Sound

音视频 | 7.7/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9514 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 82 分钟 · 40963 字 阅读 →
论文解读

A Distribution Matching Approach to Neural Piano Transcription with Optimal Transport

音乐转录 | 5.5/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7911 字 阅读 →
论文解读

A Fast Robust Adaptive filter using Improved Data-Reuse Method

声学回声消除 | 6.2/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8222 字 阅读 →
论文解读

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频修复 | 8.1/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8138 字 阅读 →
论文解读

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

音频安全 | 8.7/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9033 字 阅读 →
论文解读

Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades

语音问答 | 5.6/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8456 字 阅读 →
论文解读

Audio-Image Cross-Modal Retrieval with Onomatopoeic Images

音频检索 | 7/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6984 字 阅读 →
论文解读

Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

语音摘要 | 7.2/10

 · 更新于 2026-10-01 · 约 23 分钟 · 11227 字 阅读 →
论文解读

Bridging the Gap: Converting Read Text to Conversational Dialogue

语音转换 | 3.1/10

 · 更新于 2026-10-01 · 约 11 分钟 · 5452 字 阅读 →
论文解读

Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities

音频问答 | 6.5/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8983 字 阅读 →
论文解读

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

多模态模型 | 8.6/10

 · 更新于 2026-10-01 · 约 21 分钟 · 10221 字 阅读 →
论文解读

Contextual Biasing for Streaming ASR via CTC-based Word Spotting

语音识别 | 7.2/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7082 字 阅读 →
论文解读

EnvTriCascade: An Environment-Aware Tri-Stage Cascaded Framework for ESDD2 2026 Challenge

音频深度伪造检测 | 5.3/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9344 字 阅读 →
论文解读

Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters

说话人提取 | 6.3/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8630 字 阅读 →
论文解读

Fractional-Order Subband p-Norm Adaptive Filter via Transformation Nearest Kronecker Product Decomposition for Active Noise Control

自适应滤波 | 5/10

 · 更新于 2026-10-01 · 约 18 分钟 · 8577 字 阅读 →
论文解读

MedASR: An Open-Source Model for High-Accuracy Medical Dictation

语音识别 | 7.9/10

 · 更新于 2026-10-01 · 约 17 分钟 · 8271 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

音频深度伪造检测 | 7.4/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7396 字 阅读 →