每日研究速递

语音/音乐/音频论文速递 2026-07-22

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 71 分钟 · 35132 字 阅读 →
论文解读

Adaptive Momentum Enhanced Distributed Multichannel Active Noise Control for Faster Convergence under Communication Delays

音频理解 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7172 字 阅读 →
论文解读

AI_LectureNote: A Retrospective Pilot Study of a Post-ASR Workflow for English-Script Rendering and Semantic Drift in Korean-English Medical Lectures

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6277 字 阅读 →
论文解读

AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification

说话人验证 | 7.8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7571 字 阅读 →
论文解读

An Audio Language Model-Based Voice Concept Bottleneck Framework for Interpretable Health Assessment

语音质量评估 | 6.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7062 字 阅读 →
论文解读

Audio Cross Verification Using Dual Alignment Likelihood Ratio Test

音频伪造检测 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6313 字 阅读 →
论文解读

Component-Level Ensemble Fusion for Speech and Environmental Sound Deepfake Detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6832 字 阅读 →
论文解读

Dense-Sparse Dynamic Time Warping for Customizing Piano Concerto Accompaniments

音乐源分离 | 7.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7252 字 阅读 →
论文解读

Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models

说话人验证 | 7.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8389 字 阅读 →
论文解读

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

音视频理解 | 5.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5753 字 阅读 →
论文解读

EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation

语音情感识别 | 5.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7242 字 阅读 →
论文解读

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

基准测试 | 8.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7245 字 阅读 →
论文解读

Explainable Lightweight Compact Deep Models for Speech Emotion Recognition

语音情感识别 | 5.4/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9115 字 阅读 →
论文解读

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

音频生成 | 6.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6266 字 阅读 →
论文解读

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

音视频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7604 字 阅读 →
论文解读

FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration

音乐生成 | 7.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6828 字 阅读 →
论文解读

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

语音合成 | 6.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6532 字 阅读 →
论文解读

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

音频编码 | 9.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6824 字 阅读 →
论文解读

How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks

鲁棒性 | 6.6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7971 字 阅读 →
论文解读

Is One Score Enough? Assessing Singing Quality of Songs with Temporal Score Curves

音乐理解 | 7.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7120 字 阅读 →