论文解读

ECHO: Frequency-Aware Hierarchical Encoding for Variable-Length Signals

音频分类 | 9.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4374 字 阅读 →
论文解读

Emo-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4628 字 阅读 →
论文解读

Emotional Damage: Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3817 字 阅读 →
论文解读

Evaluating Compositional Structure in Audio Representations

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4315 字 阅读 →
论文解读

Exploring How Audio Effects Alter Emotion with Foundation Models

音乐理解 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4321 字 阅读 →
论文解读

From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-Modal Understanding in Multimodal LLMS

音频场景理解 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4037 字 阅读 →
会议任务专题

ICASSP 2026 - 音频大模型

共 1 篇 ICASSP 2026 音频大模型 方向论文

 · 更新于 2026-09-25 · 约 3 分钟 · 1489 字 阅读 →
论文解读

Improving Audio Question Answering with Variational Inference

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4080 字 阅读 →
论文解读

Investigating Modality Contribution in Audio LLMs for Music

模型评估 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3688 字 阅读 →
论文解读

Keeping Models Listening: Segment- and time-aware attention rescaling at decoding time

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Modeling Inter-Segment Relationships in Speech for Dementia Detection with Audio Spectrogram Transformers and Graph Attention Networks

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4152 字 阅读 →
论文解读

MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5146 字 阅读 →
论文解读

Multimodal LLMs as Expert Speech Annotators: Acoustic Macro-Descriptors for Parkinson's Detection

语音生物标志物 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4079 字 阅读 →
论文解读

Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

语音情感识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4289 字 阅读 →
论文解读

Segmentwise Pruning in Audio-Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

SONAR: Self-Distilled Continual Pre-Training for Domain Adaptive Audio Representation

音频事件检测 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3901 字 阅读 →
论文解读

Sparse Autoencoders Make Audio Foundation Models More Explainable

模型评估 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4339 字 阅读 →
论文解读

Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-Wise Distillation

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3417 字 阅读 →
论文解读

Temporal Distillation for Music Representation Learning

音乐信息检索 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Test-Time Scaling for Auditory Cognition in Audio Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4888 字 阅读 →