论文解读

Synthcloner: Synthesizer-Style Audio Transfer via Factorized Codec with ADSR Envelope Control

音频生成 | 8.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5185 字 阅读 →
论文解读

Synthesized Data Selection via Score Distribution Matching for Te Reo Māori Automatic Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4219 字 阅读 →
论文解读

Synthetic Data Domain Adaptation for ASR via LLM-Based Text and Phonetic Respelling Augmentation

语音识别 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4965 字 阅读 →
论文解读

Synthetic yet Striking? Assessing Vocal Charisma in TTS via Perceptual and Algorithmic Measures

语音合成 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4258 字 阅读 →
论文解读

T-Cache: Fast Inference For Masked Generative Transformer-Based TTS Via Prompt-Aware Feature Caching

语音合成 | 9.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4509 字 阅读 →
论文解读

T-Mimi: A Transformer-Based Mimi Decoder for Real-Time On-Phone TTS

语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3841 字 阅读 →
论文解读

TAG: Structured Temporal Audio Generation via LLM-Guided Manual Scription and Control

音频生成 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4086 字 阅读 →
论文解读

TAGARELA - A Portuguese Speech Dataset from Podcasts

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3967 字 阅读 →
论文解读

Taming Audio VAEs via Target-KL Regularization

音频生成 | 6.5/10

 · 更新于 2026-09-16 · 约 12 分钟 · 5919 字 阅读 →
论文解读

Target Speaker Anonymization in Multi-Speaker Recordings

语音匿名化 | 7.6/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3887 字 阅读 →
论文解读

Target-Speaker LLM-ASR with Speaker-Aware Speech Encoder

语音识别 | 8.8/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4444 字 阅读 →
论文解读

Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4678 字 阅读 →
论文解读

Task-Oriented Sound Privacy Preservation for Sound Event Detection Via End-to-End Adversarial Multi-Task Learning

音频事件检测 | 7.5/10

 · 更新于 2026-09-16 · 约 12 分钟 · 5739 字 阅读 →
论文解读

TASU: Text-only Alignment for Speech Understanding

语音识别 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4344 字 阅读 →
论文解读

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

音频问答 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3624 字 阅读 →
论文解读

Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing

音视频 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4812 字 阅读 →
论文解读

Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-Wise Distillation

音频问答 | 7.0/10

 · 更新于 2026-09-16 · 约 7 分钟 · 3417 字 阅读 →
论文解读

Teaching the Teachers: Boosting Unsupervised Domain Adaptation In Speech Recognition By Ensemble Update

语音识别 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4428 字 阅读 →
论文解读

Temporal Distillation for Music Representation Learning

音乐信息检索 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Temporal Graph Modeling for Speech Emotion Recognition Using LSTM-Aggregated Multigraph Networks

语音情感识别 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3621 字 阅读 →