论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9782 字 阅读 →
论文解读

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

音视频理解 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5818 字 阅读 →
论文解读

Technical Report for MERL's Real-TSE Challenge Submission

语音分离 | 6.6/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8552 字 阅读 →
论文解读

Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

语音识别 | 8.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9313 字 阅读 →
论文解读

Tonnetz-Driven Graph Wedgelet for Harmonic Complexity Reduction in Music Scores

音乐理解 | 5.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5870 字 阅读 →
论文解读

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

音乐生成 | 5.6/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9038 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-13

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 51 分钟 · 25294 字 阅读 →
论文解读

HeadRoom: Lightweight, Edge-deployable Pipeline for Adaptive Notification Routing

音频事件检测 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6561 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-11

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 4 分钟 · 1819 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 8.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7893 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 22 分钟 · 10711 字 阅读 →
论文解读

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

语音质量评估 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7643 字 阅读 →
论文解读

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

语音质量评估 | 8.7/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9401 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7616 字 阅读 →
论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7365 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音质量评估 | 6.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6832 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音合成 | 8.7/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9056 字 阅读 →
论文解读

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

语音识别 | 8.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6706 字 阅读 →
论文解读

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9228 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 5.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6538 字 阅读 →