论文解读

EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

多模态模型 | 8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5702 字 阅读 →
论文解读

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

语音合成 | 8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4782 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-28

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 42014 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6556 字 阅读 →
论文解读

LongCat-Video-Avatar 1.5 Technical Report

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7471 字 阅读 →
论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7303 字 阅读 →
论文解读

Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6086 字 阅读 →
论文解读

Rubato: Transcribing Piano Music with Timestamps

音乐转录 | 10/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8956 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-27

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 121 分钟 · 60546 字 阅读 →
论文解读

StepAudio 2.5 Technical Report

统一音频模型 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6187 字 阅读 →
论文解读

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

语音质量评估 | 10/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5850 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-25

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 52 分钟 · 25789 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7894 字 阅读 →
论文解读

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

音频问答 | 7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8063 字 阅读 →
论文解读

Speaker-Disentangled Remote Speech Detection of Asthma and COPD Exacerbations

医疗音频 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8869 字 阅读 →
论文解读

Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues

音频分类 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7338 字 阅读 →
论文解读

From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation

语音翻译 | 6.9/10

 · 更新于 2026-09-25 · 约 36 分钟 · 17909 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-18

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 48 分钟 · 23894 字 阅读 →
论文解读

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

说话人验证 | 7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8893 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-15

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 83 分钟 · 41092 字 阅读 →