论文解读

AI_LectureNote: A Retrospective Pilot Study of a Post-ASR Workflow for English-Script Rendering and Semantic Drift in Korean-English Medical Lectures

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6277 字 阅读 →
论文解读

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

语音转换 | 6.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7105 字 阅读 →
论文解读

SSTMark: Robust Training-Free Semantic-Level Speech Watermarking

音频水印 | 6.5/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10235 字 阅读 →
论文解读

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

说话人日志 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6496 字 阅读 →
论文解读

Natural Backdoor Attacks on Speech Recognition Models

语音识别 | 3.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7287 字 阅读 →
论文解读

SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6373 字 阅读 →
论文解读

RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9074 字 阅读 →
论文解读

Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match?

语音情感识别 | 6.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8730 字 阅读 →
论文解读

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

语音识别 | 5.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8468 字 阅读 →
论文解读

Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification

语音识别 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7202 字 阅读 →
论文解读

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

语音识别 | 5.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7257 字 阅读 →
论文解读

Data Augmentation for L2 English Speaking Assessment using TTS

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7246 字 阅读 →
论文解读

Efficiently Adapting Spoken Language Models for the Singaporean Context

语音交互 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8212 字 阅读 →
论文解读

GigaAM Multilingual: Foundation Model for Underrepresented Languages

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6967 字 阅读 →
论文解读

Listen to the Features: Voice Anonymization Driven by Content Embedding Matching over Signal Reconstruction

语音克隆 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6792 字 阅读 →
论文解读

Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6459 字 阅读 →
论文解读

Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9645 字 阅读 →
论文解读

Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6688 字 阅读 →
论文解读

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

音视频语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7585 字 阅读 →
论文解读

Phone Segmentation and Recognition through Phonological Activation Mapping

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8145 字 阅读 →