论文解读

Parameter-efficient Dual-encoder Architecture with Differentiable Choquet Integral Fusion for Underwater Acoustic Classification

音频分类 | 6.4/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5654 字 阅读 →
论文解读

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

语音识别 | 8.8/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5668 字 阅读 →
论文解读

Privacy-preserving Prosody Representation Learning

自监督学习 | 4.9/10

 · 更新于 2026-09-30 · 约 11 分钟 · 5261 字 阅读 →
论文解读

Project SPARROW and the Future of Conservation Technology

计算机视觉 | 10/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6098 字 阅读 →
论文解读

Quality Audio Prototyping: a prototype system for unified sound retrieval and procedural generation

音频检索 | 6.9/10

 · 更新于 2026-09-30 · 约 10 分钟 · 4629 字 阅读 →
论文解读

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

数据集 | 8.3/10

 · 更新于 2026-09-30 · 约 17 分钟 · 8064 字 阅读 →
论文解读

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

语音识别 | 7.2/10

 · 更新于 2026-09-30 · 约 4 分钟 · 1679 字 阅读 →
论文解读

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

语音识别 | 5.3/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6052 字 阅读 →
论文解读

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

语音编辑 | 8.7/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6662 字 阅读 →
论文解读

Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6692 字 阅读 →
论文解读

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

语音合成 | 9.6/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5542 字 阅读 →
论文解读

Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation

语音合成 | 7.6/10

 · 更新于 2026-09-30 · 约 18 分钟 · 8756 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-30 · 约 5 分钟 · 2097 字 阅读 →
论文解读

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

语音识别 | 8/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5632 字 阅读 →
论文解读

When Tabular Foundation Models Transfer Across Modalities: A Systematic Evaluation Across 95 Datasets, 7 Modalities, and Two Regimes

音频分类 | 7.1/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5941 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-30 · 约 104 分钟 · 51914 字 阅读 →
论文解读

3DAE: Binaural Quality Assessment for Audio Novel View Synthesis with Spatial Maps and Benchmark

音频质量评估 | 6.5/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6369 字 阅读 →
论文解读

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音识别 | 5.5/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6336 字 阅读 →
论文解读

AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

音乐生成 | 8.6/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6772 字 阅读 →
论文解读

不可听水印为何在扩散重生面前失效:DiffErase 的黑盒去除与保真权衡

针对语音/音乐/环境声的神经音频水印,DiffErase 在不查询检测器且不知水印方案的黑盒条件下,通过梅尔频谱的中间噪声扰动与预训练扩散去噪重生实现去除,并在五种水印系统上将检测 TPR 降至近 0 的同时以 t* 控制保真度代价。

 · 更新于 2026-09-30 · 约 19 分钟 · 9247 字 阅读 →