论文解读

Privacy-preserving Prosody Representation Learning

自监督学习 | 4.9/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5261 字 阅读 →
论文解读

Project SPARROW and the Future of Conservation Technology

计算机视觉 | 10/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6098 字 阅读 →
论文解读

Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation

音频检索 | 6.9/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4629 字 阅读 →
论文解读

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

数据集 | 8.3/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8064 字 阅读 →
论文解读

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

语音识别 | 7.2/10

 · 更新于 2026-09-09 · 约 4 分钟 · 1679 字 阅读 →
论文解读

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

语音识别 | 5.3/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6052 字 阅读 →
论文解读

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

语音编辑 | 8.7/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6662 字 阅读 →
论文解读

Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6692 字 阅读 →
论文解读

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

语音合成 | 9.6/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5542 字 阅读 →
论文解读

Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation

语音合成 | 7.6/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8756 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-09 · 约 5 分钟 · 2097 字 阅读 →
论文解读

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

语音识别 | 8/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5632 字 阅读 →
论文解读

When Tabular Foundation Models Transfer Across Modalities: A Systematic Evaluation Across 95 Datasets, 7 Modalities, and Two Regimes

音频分类 | 7.1/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5941 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-09 · 约 104 分钟 · 51914 字 阅读 →
论文解读

3DAE: Binaural Quality Assessment for Audio Novel View Synthesis with Spatial Maps and Benchmark

音频质量评估 | 6.5/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6369 字 阅读 →
论文解读

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音识别 | 5.5/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6336 字 阅读 →
论文解读

AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

音乐生成 | 8.6/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6772 字 阅读 →
论文解读

Audio Pirates: Black-box Audio Watermark Removal via Diffusion Priors

扩散模型 | 7.4/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7293 字 阅读 →
论文解读

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

语音合成 | 10/10

 · 更新于 2026-09-09 · 约 6 分钟 · 2923 字 阅读 →
论文解读

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

语音翻译 | 7.8/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5915 字 阅读 →