论文解读

边听边分清谁在说:把长历史留下来做说话人归属

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4402 字 阅读 →
论文解读

不做硬切分:用连续说话人占比给 Whisper 注入重叠感知

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11582 字 阅读 →
论文解读

听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音

说话人日志 | 7.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14406 字 阅读 →
论文解读

当发言意愿也需要先验:用 Beta 倾向补全多通道日志的贝叶斯闭环

说话人日志 | 6.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11955 字 阅读 →
论文解读

给声音装上刻度:TEMPO 如何让大音频语言模型学会报时

音频事件检测 | 7.1/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12370 字 阅读 →
论文解读

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

语音识别 | 7.3/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4845 字 阅读 →
论文解读

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

语音情感识别 | 8.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4585 字 阅读 →
论文解读

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5235 字 阅读 →
论文解读

Towards Actionable Surgical Team Dynamics: from Teamwork to Counterfactual Annotations

音视频理解 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4656 字 阅读 →
论文解读

Target Speaker Identification: A Low-Latency Streaming Pipeline

说话人验证 | 5.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5075 字 阅读 →
论文解读

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6343 字 阅读 →
论文解读

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

说话人日志 | 6.5/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6807 字 阅读 →
论文解读

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

音频事件检测 | 6.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5766 字 阅读 →
论文解读

Speaker Role and Language Diarization for Analyzing Multilingual Interviews for Language Proficiency of Older Adults

说话人日志 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6762 字 阅读 →
论文解读

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

说话人日志 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6772 字 阅读 →
论文解读

Towards Operational Conversational Intelligence: A Speech Intelligence Framework

说话人日志 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6520 字 阅读 →
论文解读

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

说话人日志 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8448 字 阅读 →
论文解读

Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9351 字 阅读 →
论文解读

What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio

语音识别 | 4.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6414 字 阅读 →
论文解读

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

说话人日志 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6496 字 阅读 →