论文解读

SagnacAssisted Enhanced OTDR for Distributed Acoustic Sensing: A Standardized Benchmark and Engineering Evaluation Framework

信号处理基础 | 6.6/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4688 字 阅读 →
论文解读

SB-RF: Schrödinger Bridge Rectified Flow for One-Step Robust Speech Enhancement

语音增强 | 7.6/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5309 字 阅读 →
论文解读

SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

语音情感识别 | 6.8/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5860 字 阅读 →
论文解读

Sound Effects Dataset Unification With the Universal Category System

音频分类 | 6.9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5518 字 阅读 →
论文解读

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

语音识别 | 7.3/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6366 字 阅读 →
论文解读

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

基准测试 | 8.4/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5681 字 阅读 →
论文解读

Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech

语音合成 | 7.9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 6000 字 阅读 →
论文解读

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

说话人识别 | 6.8/10

 · 更新于 2026-09-09 · 约 27 分钟 · 13289 字 阅读 →
论文解读

Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs

语音识别 | 5.9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5559 字 阅读 →
论文解读

UniVoice: A Unified Model for Speech and Singing Voice Generation

语音合成 | 8.7/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5545 字 阅读 →
论文解读

USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding

音频编码 | 9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 6009 字 阅读 →
论文解读

VoCodec: A Low-bitrate Streamable Neural Speech Codec with Voicing-driven Quantization

语音编码 | 7.2/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5601 字 阅读 →
论文解读

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

大语言模型 | 8.9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5808 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-05

共分析 47 篇语音/AI 论文

 · 更新于 2026-09-09 · 约 127 分钟 · 63374 字 阅读 →
论文解读

A Second-Order Cepstral Signature of Contact-Vibration Sounds Reproduced by Laptop Loudspeakers: A Synthetic Case Study

信号处理基础 | 4.8/10

 · 更新于 2026-09-09 · 约 9 分钟 · 4472 字 阅读 →
论文解读

Channel-Oriented Design for EEG-to-Music Reconstruction

音乐生成 | 7.7/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4877 字 阅读 →
论文解读

CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding

语音编码 | 8.8/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7045 字 阅读 →
论文解读

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

多模态模型 | 9.3/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6131 字 阅读 →
论文解读

Differentiable Articulatory Copy-Synthesis of Biphonic Singing

音频生成 | 7.1/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6505 字 阅读 →
论文解读

Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification

音频分类 | 10/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4712 字 阅读 →