论文解读

同样的两段声音,为何转写稳得住、问答就垮掉?

音频理解 | 6.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8603 字 阅读 →
论文解读

咳嗽不是噪声:让对话智能体在轮次间听见呼吸

音频事件检测 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7497 字 阅读 →
论文解读

Omni 不等于会选:当模型被要求用对的模态回答

音视频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8261 字 阅读 →
论文解读

别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理

音频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5836 字 阅读 →
论文解读

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

音频理解 | 7.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6380 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5452 字 阅读 →
论文解读

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6164 字 阅读 →
论文解读

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

音频理解 | 8.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6093 字 阅读 →
论文解读

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7258 字 阅读 →
论文解读

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

音频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6505 字 阅读 →
论文解读

Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

音频理解 | 8.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6292 字 阅读 →
论文解读

Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

音频理解 | 9.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5382 字 阅读 →
论文解读

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6302 字 阅读 →
论文解读

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

音频质量评估 | 8.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6001 字 阅读 →
论文解读

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

音频理解 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5275 字 阅读 →
论文解读

Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations?

音频理解 | 5.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

语音交互 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5667 字 阅读 →
论文解读

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

音频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5976 字 阅读 →
论文解读

Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models

音频理解 | 7.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6022 字 阅读 →
论文解读

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5610 字 阅读 →