论文解读

Integrating acoustic tapping with a UAV platform for tile condition classification

音频分类 | 7.5/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4811 字 阅读 →
论文解读

Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5630 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频问答 | 6.5/10

 · 更新于 2026-09-10 · 约 6 分钟 · 2680 字 阅读 →
论文解读

MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech

音频安全 | 7.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5419 字 阅读 →
论文解读

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4252 字 阅读 →
论文解读

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

音乐生成 | 7.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5860 字 阅读 →
论文解读

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

多模态幻觉缓解 | 7.5/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5400 字 阅读 →
论文解读

Multi-Axis Speech Similarity via Factor-Partitioned Embeddings

音频检索 | 6.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4834 字 阅读 →
论文解读

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音视频 | 7.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5294 字 阅读 →
论文解读

MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings

肺炎筛查 | 6.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5935 字 阅读 →
论文解读

Neck-Learn: Attention-Based Multiple Instance Learning and Ensemble Framework for Ecological Momentary Assessment

语音生物标志物 | 7.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5210 字 阅读 →
论文解读

NH-CROP: Robust Pricing for Governed Language Data Assets under Cost Uncertainty

强化学习 | 7.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5919 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

数据集 | 7.0/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5318 字 阅读 →
论文解读

PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention

多模态讽刺检测 | 8.0/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6125 字 阅读 →
论文解读

Period-conscious Time-series Reconstruction under Local Differential Privacy

时间序列重构 | 7.0/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4076 字 阅读 →
论文解读

Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation

音频分类 | 6.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5535 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.5/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5190 字 阅读 →
论文解读

Spoken Language Identification with Pre-trained Models and Margin Loss

说话人识别 | 7.5/10

 · 更新于 2026-09-10 · 约 8 分钟 · 3725 字 阅读 →
论文解读

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

语音情感识别 | 7.0/10

 · 更新于 2026-09-10 · 约 12 分钟 · 5598 字 阅读 →
论文解读

The AECM Algorithm for Deterministic Maximum Likelihood Direction Finding in the Presence of Gaussian Mixture Noise

声源定位 | 7.0/10

 · 更新于 2026-09-10 · 约 7 分钟 · 3375 字 阅读 →