论文解读

Hearing the Ocean: Bio-inspired Gammatone-CNN framework for Robust Underwater Acoustic Target Classification

音频分类 | 7.5/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4734 字 阅读 →
论文解读

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

音频质量评估 | 8.5/10

 · 更新于 2026-10-02 · 约 14 分钟 · 6589 字 阅读 →
论文解读

Library learning with e-graphs on jazz harmony

音乐信息检索 | 6.5/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6079 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-10-02 · 约 16 分钟 · 7885 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

音频分类 | 7.5/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4468 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

音乐信息检索 | 8.5/10

 · 更新于 2026-10-02 · 约 14 分钟 · 6876 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.0/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4621 字 阅读 →
论文解读

SEI-SHIELD: Robust Specific Emitter Identification Under Label Noise Via Self-Supervised Filtering and Iterative Rescue

信号处理 | 7.5/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6041 字 阅读 →
论文解读

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

音频安全 | 7.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5665 字 阅读 →
论文解读

Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement

语音增强 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5050 字 阅读 →
论文解读

Stage Light is Sequence^2: Multi-Light Control via Imitation Learning

舞台技术 | 7.0/10

 · 更新于 2026-10-02 · 约 14 分钟 · 6801 字 阅读 →
论文解读

Stage-adaptive audio diffusion modeling

音频生成 | 7.0/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5813 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6296 字 阅读 →
论文解读

To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-10-02 · 约 14 分钟 · 6769 字 阅读 →
论文解读

Trustworthy Federated Label Distribution Learning under Annotation Quality Disparity

标签分布学习 | 8.0/10

 · 更新于 2026-10-02 · 约 14 分钟 · 6635 字 阅读 →
论文解读

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

音乐转录 | 7.0/10

 · 更新于 2026-10-02 · 约 21 分钟 · 10272 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-07

共分析 22 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 79 分钟 · 39450 字 阅读 →
论文解读

A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language

语音识别 | 7.0/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4807 字 阅读 →
论文解读

A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition

语音识别 | 6.0/10

 · 更新于 2026-10-02 · 约 5 分钟 · 2387 字 阅读 →
论文解读

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5431 字 阅读 →