论文解读

Progressive Refinement: An Iterative Pseudo-Labeling Approach for Mandarin-English Code-Switching ASR

语音识别 | 4.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7305 字 阅读 →
论文解读

ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

语音合成 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6226 字 阅读 →
论文解读

Quantum-Inspired Harmonic Decision Models: A Computational Framework for Music Generation

音乐生成 | 2.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5098 字 阅读 →
论文解读

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6411 字 阅读 →
论文解读

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

音频理解 | 8.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6569 字 阅读 →
论文解读

Ranking the Impact of Contextual Specialization in Neural Speech Enhancement

语音增强 | 6.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6906 字 阅读 →
论文解读

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6159 字 阅读 →
论文解读

Reinforcement Learning for Data-Efficient Code-Switched ASR

语音识别 | 5.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5883 字 阅读 →
论文解读

S-DiverSe: Spanish Diverse Speech

语音识别 | 5.8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7968 字 阅读 →
论文解读

Sampling Bias Compensation for Robust Evaluation of Audio Classification Systems with Partially Labeled Evaluation Datasets

音频分类 | 4.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6573 字 阅读 →
论文解读

Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study

语音属性识别 | 7.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7915 字 阅读 →
论文解读

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

语音编码 | 7.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5637 字 阅读 →
论文解读

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

语音交互 | 8.9/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7382 字 阅读 →
论文解读

Streaming Neural Speech Codecs through Time-Invariant Representations

语音编码 | 6.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7723 字 阅读 →
论文解读

SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation

音频伪造检测 | 6.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9156 字 阅读 →
论文解读

Taste-aware music retrieval from audio embeddings

音乐检索 | 6.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6947 字 阅读 →
论文解读

TokAN: Accent Normalization Using Self-Supervised Speech Tokens

语音转换 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6234 字 阅读 →
论文解读

Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

语音合成 | 4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6353 字 阅读 →
论文解读

Towards Language-Agnostic Speech Inversion

语音属性识别 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5655 字 阅读 →
论文解读

Towards Robust Uncertainty-Aware Speaker Modeling

说话人验证 | 5.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5565 字 阅读 →