论文解读

CoughSense: Five-Class Respiratory Disease Classification via Whisper Encoder Fine-Tuning and Dual-Encoder Cross-Attention Fusion with Balanced Contrastive Learning

数据增强 | 9.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7875 字 阅读 →
论文解读

Context-aware child-directed speech detection from long-form recordings

自监督学习 | 8.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5403 字 阅读 →
论文解读

几何主导下如何减出材料:GaMi 的跨模态相减式解耦

针对几何变化压制材料特征的问题,GaMi 用共位毫米波与声学的共享几何一致性做对齐-校准-相减解耦,并以样本间对比抑制残差,在 20 类材料上以 95.2% 的总体准确率显著优于单模态基线,代价是需双模态同步采集与多目标联合训练。

 · 更新于 2026-09-24 · 约 23 分钟 · 11269 字 阅读 →
论文解读

Cost-Effective Model Evaluation with Meta-Learning

迁移学习 | 5.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7948 字 阅读 →
论文解读

A strongly annotated passive acoustic dataset for tropical bird monitoring

生物声学 | 7.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10188 字 阅读 →
论文解读

CoarseSoundNet: Building a reliable model for ecological soundscape analysis

音频分类 | 8.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8312 字 阅读 →
论文解读

Ordering Matters: Rank-Aware Selective Fusion for Blended Emotion Recognition

多模态情感识别 | 5.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 7000 字 阅读 →
论文解读

DASM: Domain-Aware Sharpness Minimization for Multi-Domain Voice Stream Steganalysis

语音伪造检测 | 7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7015 字 阅读 →
论文解读

PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions

语音数据集 | 6.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9997 字 阅读 →
论文解读

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8162 字 阅读 →
论文解读

Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models

语音识别 | 6.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9094 字 阅读 →
论文解读

Empirical Study of Pop and Jazz Mix Ratios for Genre-Adaptive Chord Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5401 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4468 字 阅读 →
论文解读

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

音频安全 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5862 字 阅读 →
论文解读

MultiSense-Pneumo: A Multimodal Learning Framework for Pneumonia Screening in Resource-Constrained Settings

肺炎筛查 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5935 字 阅读 →
论文解读

NH-CROP: Robust Pricing for Governed Language Data Assets under Cost Uncertainty

强化学习 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5919 字 阅读 →
论文解读

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4081 字 阅读 →
论文解读

LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation

说话人验证 | 8.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7232 字 阅读 →
论文解读

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

说话人验证 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5273 字 阅读 →
论文解读

One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

语音克隆 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4425 字 阅读 →