论文解读

Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

语音识别 | 6.8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6816 字 阅读 →
论文解读

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5784 字 阅读 →
论文解读

Rhythm of the Deep: A Computational-Linguistic Test of Duality of Patterning in Sperm Whale Codas

自监督学习 | 8.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6634 字 阅读 →
论文解读

Robust Spoofed Speech Detection via Temporal Pyramid Modeling

音频深度伪造检测 | 6.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6597 字 阅读 →
论文解读

ROMPAR: Morphological Completion and Demographic Unlearning for Romanian-Accented Speech Recognition

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4459 字 阅读 →
论文解读

Scaling Human and G2P Supervision for Robust Phonetic Transcription

语音识别 | 7.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4873 字 阅读 →
论文解读

SPRI: SVD-Partitioned Residual Initialization for Data-Constrained MoE Upcycling

语音翻译 | 7.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6597 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-16

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 168 分钟 · 83790 字 阅读 →
论文解读

Mask, Sample, Revise: A Revisable CTMC Inference Stack for Guided Discrete Flow Matching Text-to-Speech

语音合成 | 6.8/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8765 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-15

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 72 分钟 · 35999 字 阅读 →
论文解读

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

语音翻译 | 8.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6061 字 阅读 →
论文解读

Positional Encoding in the Context of Memristor-Based Analog Computation for Automatic Speech Recognition

语音识别 | 8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4178 字 阅读 →
论文解读

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

语音合成 | 9.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6236 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 77 分钟 · 38140 字 阅读 →
论文解读

Evaluating Bias in Phoneme-Based Automatic Speech Recognition Systems: An Analysis of IPA Transcription Models

语音识别 | 8.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5179 字 阅读 →
论文解读

Gumbel-BEARD: Automatic Layer Selection for Self-Supervised Adaptation of Whisper in Low-Resource Domains

语音识别 | 9.1/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4665 字 阅读 →
论文解读

Pretrained self-supervised speech models can recognize unseen consonants

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4929 字 阅读 →
论文解读

Tight Boundary Prediction in Speaker Diarization Using Causal-Anticausal Consistency

低资源 | 9.6/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4149 字 阅读 →
论文解读

UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction

语音合成 | 8.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6102 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-11

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 99 分钟 · 49581 字 阅读 →