论文解读

The Role of Prosodic and Lexical Cues in Turn-Taking with Self-Supervised Speech Representations

语音对话系统 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4558 字 阅读 →
论文解读

The Singing Voice Conversion Challenge 2025: From Singer Identity Conversion to Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3758 字 阅读 →
论文解读

The Synergistic Role of Audio and Large Video-Language Model in Source-Free Video Domain Adaptation

领域适应 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4434 字 阅读 →
论文解读

Theory and Application of Circular Relative Harmonic Coefficients

声源定位 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4582 字 阅读 →
论文解读

Thinking While Listening: Simple Test Time Scaling for Audio Classification

音频分类 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4620 字 阅读 →
论文解读

Three Seconds is Sufficient: A Multi-Pronged Framework for Model-Based Speaker Adaptation in ASR Under Data-Scarce Conditions

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4318 字 阅读 →
论文解读

TICL: Text-Embedding KNN for Speech in-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4710 字 阅读 →
论文解读

Timbre-Aware Audio Difference Captioning for Anomalous Machine Sounds without Paired Training Data via Synthetic Perturbations

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4605 字 阅读 →
论文解读

Timbre-Based Pretraining with Pseudo-Labels for Multi-Instrument Automatic Music Transcription

音乐信息检索 | 7.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7980 字 阅读 →
论文解读

Time vs. Layer: Locating Predictive Cues for Dysarthric Speech Descriptors in Wav2vec 2.0

语音质量评估 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4296 字 阅读 →
论文解读

Time-Domain Synthesis of Virtual Sound Source Within Personalized Sound Zone using a Linear Loudspeaker Array

空间音频 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3765 字 阅读 →
论文解读

Time-Shifted Token Scheduling for Symbolic Music Generation

音乐生成 | 8.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3965 字 阅读 →
论文解读

TinyMU: A Compact Audio-Language Model for Music Understanding

音乐理解 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5011 字 阅读 →
论文解读

Tldiffgan: A Latent Diffusion-Gan Framework with Temporal Information Fusion for Anomalous Sound Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4622 字 阅读 →
论文解读

TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4601 字 阅读 →
论文解读

Tokenchain: A Discrete Speech Chain via Semantic Token Modeling

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Toward Faithful Explanations in Acoustic Anomaly Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3867 字 阅读 →
论文解读

Toward Robust And Efficient Beat Tracking Via Beat-Aware Attention

音乐理解 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4385 字 阅读 →
论文解读

Towards Blind Data Cleaning: A Case Study in Music Source Separation

音乐信息检索 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4929 字 阅读 →
论文解读

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6217 字 阅读 →