论文解读

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6280 字 阅读 →
论文解读

Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1214 字 阅读 →
论文解读

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7367 字 阅读 →
论文解读

Benchmarking Speech-to-Speech Translation Models

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5395 字 阅读 →
论文解读

Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

语音合成 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5364 字 阅读 →
论文解读

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement

语音合成 | 8.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6116 字 阅读 →
论文解读

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

音频生成 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6522 字 阅读 →
论文解读

Inference-Time Scaling for Joint Audio-Video Generation

语音合成 | 6.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5102 字 阅读 →
论文解读

The DeepSpeak-Agentic Dataset

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6420 字 阅读 →
论文解读

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5546 字 阅读 →
论文解读

DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech

语音合成 | 7.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

Local Diagnostics of Continuous Normalizing Flow for Out-of-Distribution Detection

语音合成 | 8.1/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5709 字 阅读 →
论文解读

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5668 字 阅读 →
论文解读

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

语音识别 | 5.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6052 字 阅读 →
论文解读

Sympatheia: Emotionally Adaptive Voice Assistant with Continuous Affect Conditioning

语音合成 | 9.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5542 字 阅读 →
论文解读

UniVocal: Unified Speech-Singing Code-Switching Synthesis

语音合成 | 8.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2097 字 阅读 →
论文解读

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6336 字 阅读 →
论文解读

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2923 字 阅读 →
论文解读

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

语音合成 | 9.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6263 字 阅读 →
论文解读

MindVoice: Reconstructing Intelligible Speech from Non-invasive Neural Signals with Pretrained Priors

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8301 字 阅读 →