SPAM: Style Prompt Adherence Metric for Prompt-Based TTS
语音合成 | 7.0/10
语音合成 | 7.0/10
空间音频 | 8.5/10
语音情感识别 | 8.0/10
医疗AI | 7.5/10
语音驱动动作生成 | 7.0/10
关键词检测 | 7.5/10
音频事件检测 | 8.5/10
模型评估 | 8.0/10
音乐理解 | 7.5/10
语音识别 | 7.5/10
音频检索 | 8.0/10
音频检索 | 7.5/10
语音合成 | 7.0/10
音频生成 | 7.5/10
这篇论文旨在解决现有音频-文本检索方法无法处理查询和文档中音频与文本交错出现(如多轮对话、混合输入)的局限性。为此,作者定义了音频-文本交错上下文检索(ATIR)任务,并构建了一个包含约8.8万对样本的大规模基准。为解决直接应用多模态大语言模型(MLLM)时音频token冗余导致的效率和精度问题,论
这篇论文旨在解决将连续变化的基频(F0)曲线映射到首尔韩语中离散、不变的音高重音类别(如LHLH, HHLH)这一难题。传统方法易受F0测量噪声和说话人差异的影响。为此,作者提出了**Dual-Glob**,一个深度监督对比学习框架。其核心是通过一个**双分支(干净视图和增强视图)编码器**,在共享
共分析 21 篇语音/AI 论文
这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,
这篇论文旨在解决当前语音深度伪造检测(SDD)系统在面对富有表现力和情感的合成语音攻击时泛化能力不足的核心问题。现有方法过度依赖伪造数据,容易学习数据集特定的伪影,而非自然语音的可迁移特征。为此,作者