论文解读

PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6124 字 阅读 →
论文解读

Phrased: Phrase Dictionary Biasing for Speech Translation

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4074 字 阅读 →
论文解读

Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4562 字 阅读 →
论文解读

PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5541 字 阅读 →
论文解读

PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5099 字 阅读 →
论文解读

Revisiting Direct Speech-to-Text Translation with Speech LLMS: Better Scaling than Cot Prompting?

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4766 字 阅读 →
论文解读

SA-SSL-MOS: Self-Supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5780 字 阅读 →
论文解读

SEP-ST: Incorporating Speech Entity Prompt Into Large Language Models for Speech Translation

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3975 字 阅读 →
论文解读

Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-Scale Dataset Cleansing

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4546 字 阅读 →
论文解读

StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4238 字 阅读 →
论文解读

Syncspeech: Efficient and Low-Latency Text-to-Speech Based on Temporal Masked Transformer

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4853 字 阅读 →
论文解读

TICL: Text-Embedding KNN for Speech in-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4710 字 阅读 →
论文解读

Towards Fair ASR for Second Language Speakers using Fairness Prompted Finetuning

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4138 字 阅读 →
论文解读

Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3966 字 阅读 →
论文解读

TTA: Transcribe, Translate and Alignment for Cross-Lingual Speech Representation

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5261 字 阅读 →
论文解读

UMA-SPLIT: Unimodal Aggregation for Both English and Mandarin Non-Autoregressive Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3808 字 阅读 →
论文解读

Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5297 字 阅读 →
论文解读

VividTalker: A Modular Framework for Expressive 3D Talking Avatars with Controllable Gaze and Blink

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5244 字 阅读 →
论文解读

Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-Resource Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3795 字 阅读 →
论文解读

Scaling Properties of Continuous Diffusion Spoken Language Models

语音生成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6298 字 阅读 →