论文解读

当声音在笑、文字在哭:大音频语言模型为何听不见讽刺

语音情感识别 | 8.1/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12067 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 151 分钟 · 75584 字 阅读 →
论文解读

对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化

音视频理解 | 6.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8045 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 66 分钟 · 32614 字 阅读 →
论文解读

当语音和文本各说各话,重排器如何当翻译官?

LoRA | 5.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8739 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 87 分钟 · 43538 字 阅读 →
论文解读

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

音频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6505 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 68 分钟 · 33830 字 阅读 →
论文解读

The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7035 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-18

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 129 分钟 · 64264 字 阅读 →
论文解读

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

说话人日志 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6807 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-17

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 62 分钟 · 30965 字 阅读 →
论文解读

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

语音质量评估 | 7.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6446 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-14

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 36 分钟 · 17828 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6671 字 阅读 →
论文解读

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

音频事件检测 | 6.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5766 字 阅读 →
论文解读

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

音视频生成 | 7.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7019 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-13

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 56 分钟 · 27887 字 阅读 →
论文解读

myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR

语音识别 | 6.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8115 字 阅读 →
论文解读

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6535 字 阅读 →