每日研究速递

语音/音乐/音频论文速递 2026-05-06

共分析 23 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 81 分钟 · 40463 字 阅读 →
论文解读

Artificial intelligence language technologies in multilingual healthcare: Grand challenges ahead

多语言健康沟通 | 6.5/10

 · 更新于 2026-10-02 · 约 5 分钟 · 2457 字 阅读 →
论文解读

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

基准测试 | 7.5/10

 · 更新于 2026-10-02 · 约 8 分钟 · 3895 字 阅读 →
论文解读

Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

音视频 | 7.5/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6444 字 阅读 →
论文解读

Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models

语音识别 | 8.0/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4665 字 阅读 →
论文解读

Flexi-LoRA with Input-Adaptive Ranks: Efficient Finetuning for Speech and Reasoning Tasks

大语言模型 | 8.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5782 字 阅读 →
论文解读

HARMES: A Multi-Modal Dataset for Wearable Human Activity Recognition with Motion, Environmental Sensing and Sound

音频分类 | 8.0/10

 · 更新于 2026-10-02 · 约 13 分钟 · 6251 字 阅读 →
论文解读

Integrating acoustic tapping with a UAV platform for tile condition classification

音频分类 | 7.5/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4811 字 阅读 →
论文解读

Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5630 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频问答 | 6.5/10

 · 更新于 2026-10-02 · 约 6 分钟 · 2680 字 阅读 →
论文解读

MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech

音频安全 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5419 字 阅读 →
论文解读

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

音乐生成 | 7.5/10

 · 更新于 2026-10-02 · 约 9 分钟 · 4252 字 阅读 →
论文解读

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

音乐生成 | 7.0/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5860 字 阅读 →
论文解读

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

多模态幻觉缓解 | 7.5/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5400 字 阅读 →
论文解读

Multi-Axis Speech Similarity via Factor-Partitioned Embeddings

音频检索 | 6.0/10

 · 更新于 2026-10-02 · 约 10 分钟 · 4834 字 阅读 →
论文解读

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音视频 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5294 字 阅读 →
论文解读

MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings

肺炎筛查 | 6.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5935 字 阅读 →
论文解读

Neck-Learn: Attention-Based Multiple Instance Learning and Ensemble Framework for Ecological Momentary Assessment

语音生物标志物 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5210 字 阅读 →
论文解读

NH-CROP: Robust Pricing for Governed Language Data Assets under Cost Uncertainty

强化学习 | 7.5/10

 · 更新于 2026-10-02 · 约 12 分钟 · 5919 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

数据集 | 7.0/10

 · 更新于 2026-10-02 · 约 11 分钟 · 5318 字 阅读 →