论文解读

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

语音识别 | 7.2/10

 · 更新于 2026-09-30 · 约 4 分钟 · 1679 字 阅读 →
论文解读

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

语音识别 | 5.3/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6052 字 阅读 →
论文解读

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

语音编辑 | 8.7/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6662 字 阅读 →
论文解读

Spiking and Event-driven Neuromorphic Mamba Models for Efficient Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6692 字 阅读 →
论文解读

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

语音合成 | 9.6/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5542 字 阅读 →
论文解读

Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation

语音合成 | 7.6/10

 · 更新于 2026-09-30 · 约 18 分钟 · 8756 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-30 · 约 5 分钟 · 2097 字 阅读 →
论文解读

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

语音识别 | 8/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5632 字 阅读 →
论文解读

When Tabular Foundation Models Transfer Across Modalities: A Systematic Evaluation Across 95 Datasets, 7 Modalities, and Two Regimes

音频分类 | 7.1/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5941 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-02

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-30 · 约 104 分钟 · 51914 字 阅读 →
论文解读

3DAE: Binaural Quality Assessment for Audio Novel View Synthesis with Spatial Maps and Benchmark

音频质量评估 | 6.5/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6369 字 阅读 →
论文解读

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音识别 | 5.5/10

 · 更新于 2026-09-30 · 约 13 分钟 · 6336 字 阅读 →
论文解读

AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

音乐生成 | 8.6/10

 · 更新于 2026-09-30 · 约 14 分钟 · 6772 字 阅读 →
论文解读

不可听水印为何在扩散重生面前失效:DiffErase 的黑盒去除与保真权衡

针对语音/音乐/环境声的神经音频水印,DiffErase 在不查询检测器且不知水印方案的黑盒条件下,通过梅尔频谱的中间噪声扰动与预训练扩散去噪重生实现去除,并在五种水印系统上将检测 TPR 降至近 0 的同时以 t* 控制保真度代价。

 · 更新于 2026-09-30 · 约 19 分钟 · 9247 字 阅读 →
论文解读

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

语音合成 | 10/10

 · 更新于 2026-09-30 · 约 6 分钟 · 2923 字 阅读 →
论文解读

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

语音翻译 | 7.8/10

 · 更新于 2026-09-30 · 约 12 分钟 · 5915 字 阅读 →
论文解读

Escaping the Linearity Trap: Manifold Detours for Black-Box Adversarial Attacks on Singing Audio Deepfake Detection

自监督学习 | 9.7/10

 · 更新于 2026-09-30 · 约 16 分钟 · 7568 字 阅读 →
论文解读

Extracting accent features in spoken Brazilian Portuguese without sociolinguistic labels

口音识别 | 8.3/10

 · 更新于 2026-09-30 · 约 15 分钟 · 7444 字 阅读 →
论文解读

FiPA-SR -- FiLM-Conditioned Perceptually Informed Audio Super-Resolution

生成对抗网络 | 8.1/10

 · 更新于 2026-09-30 · 约 10 分钟 · 4919 字 阅读 →
论文解读

几何主导下如何减出材料:GaMi 的跨模态相减式解耦

针对几何变化压制材料特征的问题,GaMi 用共位毫米波与声学的共享几何一致性做对齐-校准-相减解耦,并以样本间对比抑制残差,在 20 类材料上以 95.2% 的总体准确率显著优于单模态基线,代价是需双模态同步采集与多目标联合训练。

 · 更新于 2026-09-30 · 约 23 分钟 · 11269 字 阅读 →