论文解读

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1135 字 阅读 →
论文解读

BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset

音频深度伪造检测 | 9/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4225 字 阅读 →
论文解读

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8986 字 阅读 →
论文解读

ZONOS2 Technical Report

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7161 字 阅读 →
论文解读

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5481 字 阅读 →
论文解读

An Acoustic Landmark Database of the English Lexicon via Articulatory Synthesis

语音合成 | 6.9/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7940 字 阅读 →
论文解读

An Evaluation Framework for Text-to-Speech Voice Reconstruction

语音合成 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5642 字 阅读 →
论文解读

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7085 字 阅读 →
论文解读

Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning

语音情感识别 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5489 字 阅读 →
论文解读

Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6835 字 阅读 →
论文解读

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

语音合成 | 8.4/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10533 字 阅读 →
论文解读

Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study

语音合成 | 8.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5133 字 阅读 →
论文解读

DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6257 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11361 字 阅读 →
论文解读

Imitation Learning for Elder-Facing Speech Synthesis

语音合成 | 5.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5760 字 阅读 →
论文解读

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

语音合成 | 6.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4805 字 阅读 →
论文解读

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

音频水印 | 8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7077 字 阅读 →
论文解读

LISE : Listenable Interpretable Speaker Embeddings

说话人验证 | 6.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5422 字 阅读 →
论文解读

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

语音合成 | 7.4/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5272 字 阅读 →
论文解读

Physics-Informed Neural Operator for Speech Production Analysis

语音合成 | 6.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4938 字 阅读 →