论文解读

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

生态计算 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5623 字 阅读 →
论文解读

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4899 字 阅读 →
论文解读

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4175 字 阅读 →
论文解读

A Brain-Inspired Gating Mechanism Unlocks Robust Computation in Spiking Neural Networks

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5996 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4107 字 阅读 →
论文解读

Are Deep Speech Denoising Models Robust to Adversarial Noise?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4051 字 阅读 →
论文解读

Beyond Instance-Level Alignment: Dual-Level Optimal Transport for Audio-Text Retrieval

音频检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4293 字 阅读 →
论文解读

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

音频安全 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5487 字 阅读 →
论文解读

Physics-Informed Audio-Geometry-Grid Representation Learning for Universal Sound Source Localization

声源定位 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5024 字 阅读 →
论文解读

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5831 字 阅读 →
论文解读

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

语音分词 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4686 字 阅读 →
论文解读

TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4181 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5209 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5309 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4392 字 阅读 →
论文解读

LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4128 字 阅读 →
论文解读

MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6271 字 阅读 →
论文解读

Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning

个性化联邦学习 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3077 字 阅读 →
论文解读

A New Location Estimator for Mixed LOS & NLOS scenarios

声源定位 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5838 字 阅读 →
论文解读

Similarity Choice and Negative Scaling in Supervised Contrastive Learning for Deepfake Audio Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4571 字 阅读 →