论文解读

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

语音识别 | 7.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6172 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 47 分钟 · 23491 字 阅读 →
论文解读

BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6017 字 阅读 →
论文解读

Designing Maintainable Hybrid Generative Systems: A Quantum-Inspired Approach to Automated Music Harmony Generation

音乐生成 | 5.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5880 字 阅读 →
论文解读

Determinantal point process sampling for bioacoustic active learning

音频分类 | 6.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8115 字 阅读 →
论文解读

Distributed Multichannel Wiener Filtering for Topology-Unconstrained Wireless Acoustic Sensor Networks

语音增强 | 5.1/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8583 字 阅读 →
论文解读

Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

语音属性识别 | 7.8/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3485 字 阅读 →
论文解读

Few-Shot Class-Incremental Audio Classification Using Pseudo-Incrementally Trained Embedding Learner and Continually Updated Stochastic Classifier

音频分类 | 6.3/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10275 字 阅读 →
论文解读

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

语音分离 | 4.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8227 字 阅读 →
论文解读

ForestIR: Physics-Informed Forest Sound Simulation for Array-Based Bioacoustic Remote Sensing

声源定位 | 7.2/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8495 字 阅读 →
论文解读

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5163 字 阅读 →
论文解读

From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7890 字 阅读 →
论文解读

From Textural Counterpoint to Feature Encoding: A Multi-Dimensional Machine Representation Study of Haydn's "The Lark" Integrating Electroacoustic Analysis

音乐生成 | 2.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6692 字 阅读 →
论文解读

Gemma 4 Technical Report

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8126 字 阅读 →
论文解读

Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats

语音转换 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6152 字 阅读 →
论文解读

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

语音交互 | 9.2/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8435 字 阅读 →
论文解读

InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective

语音属性识别 | 7.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7432 字 阅读 →
论文解读

Learning-based Physics-Constrained Neural Kernel for Sound Field Estimation With Source-Position-Dependent Directional Weighting

声源定位 | 5.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

音乐检索 | 5.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6172 字 阅读 →
论文解读

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

音乐理解 | 7.8/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8800 字 阅读 →