论文解读

Audio Diarization: A New Paradigm for Exploring Audio Recordings with Unknown Event Classes

说话人日志 | 4.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6151 字 阅读 →
论文解读

Investigating the Integration of Spatial Information in Foundation-Model-Based Speaker Diarization

说话人日志 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6032 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 5.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6538 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7440 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.6/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7527 字 阅读 →
论文解读

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

语音活动检测 | 6.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9878 字 阅读 →
论文解读

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

音频生成 | 5.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7545 字 阅读 →
论文解读

voxmap-studio: An open-source speaker diarization annotation tool with built-in cost instrumentation

说话人日志 | 6.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8922 字 阅读 →
论文解读

Efficiency-Performance Trade-offs in Neural Speaker Diarization via Structured Pruning and Low-Bit Quantization

说话人日志 | 5.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6022 字 阅读 →
论文解读

Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5831 字 阅读 →
论文解读

Automated Pronunciation Evaluation for Korean Toddler Speech using Speech Diarization and Self-Supervised Learning

说话人日志 | 6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6726 字 阅读 →
论文解读

SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription

语音识别 | 8.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6767 字 阅读 →
论文解读

ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

语音识别 | 8/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5167 字 阅读 →
论文解读

Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

语音识别 说话人日志 | 5.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10162 字 阅读 →
论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4581 字 阅读 →
论文解读

A Framework for Controlled Multi-Speaker Audio Synthesis for Robustness Evaluation of Speaker Diarisation Systems

说话人日志 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4437 字 阅读 →
论文解读

Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5056 字 阅读 →
论文解读

Automatic Estimation of Speaker Diarization Error Rate Based on Features of Audio Quality and Speaker Discriminability

说话人分离 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4339 字 阅读 →
会议任务专题

ICASSP 2026 - 说话人日志

共 2 篇 ICASSP 2026 说话人日志 方向论文

 · 更新于 2026-09-24 · 约 7 分钟 · 3086 字 阅读 →
论文解读

Loose Coupling of Spectral and Spatial Models for Multi-Channel Diarization and Enhancement of Meetings in Dynamic Environments

说话人日志 语音分离 | 7.2/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3877 字 阅读 →