论文解读

Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4629 字 阅读 →
论文解读

Audio Classification Models are Vulnerable to Filter Perturbations

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3318 字 阅读 →
论文解读

Audio Deepfake Detection at the First Greeting: "Hi!"

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4507 字 阅读 →
论文解读

AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4254 字 阅读 →
论文解读

AURA: A Stegaformer-Based Scalable Deep Audio Watermark with Extreme Robustness

音频水印 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5484 字 阅读 →
论文解读

Auxiliary Multi-Label Training For Improving the Robustness of Audio Deepfake Detection on AI-Processed Data

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3885 字 阅读 →
论文解读

AVATAR: Audio-Visual Adaptive Fusion via Trained Agent Reinforcement for Multimodal Deepfake Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4343 字 阅读 →
论文解读

Bloodroot: When Watermarking Turns Poisonous for Stealthy Backdoor

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4790 字 阅读 →
论文解读

Brainprint-Modulated Target Speaker Extraction

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4574 字 阅读 →
论文解读

Bridging the Front-End and Back-End for Robust ASR via Cross-Attention-Based U-Net

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4857 字 阅读 →
论文解读

CaMoD: Causal-Aware Modality Denoising for Multimodal Dialogue Intent Recognition

多模态对话意图识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4555 字 阅读 →
论文解读

Condition-Invariant fMRI decoding of speech intelligibility with deep state space model

神经解码 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4075 字 阅读 →
论文解读

Confidence-Guided Error Correction for Disordered Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4863 字 阅读 →
论文解读

Content Leakage in Librispeech and its Impact on the Privacy Evaluation of Speaker Anonymization

语音匿名化 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3586 字 阅读 →
论文解读

Content-Preserving Speech Representation Learning Via Adaptive Segment-Level Alignment

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5415 字 阅读 →
论文解读

Context-Aware Dynamic Graph Learning for Multimodal Emotion Recognition with Missing Modalities

语音情感识别 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4275 字 阅读 →
论文解读

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5305 字 阅读 →
论文解读

Cooperative Multi-Agent Reinforcement Learning for Adaptive Aggregation in Semi-Supervised Federated Learning with non-IID Data

联邦学习 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

Coupling Acoustic Geometry and Visual Semantics for Robust Depth Estimation

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9555 字 阅读 →
论文解读

Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4237 字 阅读 →