论文解读

Improving Automatic Speech Recognition for Speakers Treated for Oral Cancer using Data Augmentation and LLM Error Correction

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8703 字 阅读 →
论文解读

Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization

语音识别 说话人分离 | 7.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8034 字 阅读 →
论文解读

Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report

说话人验证 | 5.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9548 字 阅读 →
论文解读

A Semi-Supervised Framework for Speech Confidence Detection using Whisper

语音自信度检测 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9646 字 阅读 →
论文解读

Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

语音识别 说话人日志 | 5.5/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10162 字 阅读 →
论文解读

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

音频生成 | 6.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8585 字 阅读 →
论文解读

Dolphin-CN-Dialect: Where Chinese Dialects Matter

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8629 字 阅读 →
论文解读

Speech-based Psychological Crisis Assessment using LLMs

语音情感识别 | 5.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8451 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6296 字 阅读 →
论文解读

Deepfake Audio Detection Using Self-supervised Fusion Representations

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4110 字 阅读 →
论文解读

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6496 字 阅读 →
论文解读

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

生态计算 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5623 字 阅读 →
论文解读

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

音频分类 | 9.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6625 字 阅读 →
论文解读

Towards Improving Speaker Distance Estimation through Generative Impulse Response Augmentation

声源定位 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4493 字 阅读 →
论文解读

Data-Centric Lessons To Improve Speech-Language Pretraining

语音问答 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4396 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6243 字 阅读 →
论文解读

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

视频生成 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4252 字 阅读 →
论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5344 字 阅读 →
论文解读

A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)

语音分离 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5194 字 阅读 →