论文解读

Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming

Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming

 · 更新于 2026-09-07 · 约 10 分钟 · 4683 字 阅读 →
论文解读

Graph-Based Phonetic Error Correction of Noisy ASR

语音识别 | 6.7/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6592 字 阅读 →
论文解读

Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS

语音合成 | 7.5/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4894 字 阅读 →
论文解读

MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning

自监督学习 | 7.4/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5126 字 阅读 →
论文解读

One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications

语音增强 | 7.2/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5687 字 阅读 →
论文解读

Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant

语音识别 | 6.2/10

 · 更新于 2026-09-07 · 约 25 分钟 · 12144 字 阅读 →
论文解读

Real-Time Voice AI Hears but Does Not Listen

Real-Time Voice AI Hears but Does Not Listen

 · 更新于 2026-09-07 · 约 12 分钟 · 5846 字 阅读 →
论文解读

Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

语音合成 | 7.3/10

 · 更新于 2026-09-07 · 约 4 分钟 · 1666 字 阅读 →
论文解读

SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

语音增强 | 7.4/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5590 字 阅读 →
论文解读

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

语音对话系统 | 6.7/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6090 字 阅读 →
论文解读

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

语音翻译 | 7.8/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6956 字 阅读 →
论文解读

Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5991 字 阅读 →
论文解读

Velocity Prediction in Automatic Guitar Transcription

Velocity Prediction in Automatic Guitar Transcription

 · 更新于 2026-09-07 · 约 19 分钟 · 9203 字 阅读 →
论文解读

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

语音合成 | 7.2/10

 · 更新于 2026-09-07 · 约 3 分钟 · 1135 字 阅读 →
论文解读

What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients

语音可懂度评估 | 6.4/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5414 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-25

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-07 · 约 77 分钟 · 38268 字 阅读 →
论文解读

A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic

语音识别 | 7/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5029 字 阅读 →
论文解读

A Methodology for Characterizing Underwater Radiated Noise from Submerged Electric Vehicles in a Coastal Environment: An AUV Test Case

信号处理基础 | 7/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6165 字 阅读 →
论文解读

A Multi-Stage Separation-and-Classification Framework Guided by Complementary Acoustic-to-Semantic Clues

音频分类 | 7.5/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4868 字 阅读 →
论文解读

A Variational-Flow Analysis of StoRM under Noise-Power Mismatch

语音增强 | 4.4/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4515 字 阅读 →