TextlessRAG: End-to-End Visual Document RAG by Speech without Text
语音问答 | 8.5/10
语音问答 | 8.5/10
语音识别 | 7.0/10
音乐理解 | 8.5/10
语音情感识别 | 7.5/10
说话人分离 | 9.0/10
语音伪造检测 | 7.0/10
语音增强 | 7.5/10
语音识别 | 7.5/10
音频事件检测 | 8.0/10
说话人分离 | 8.5/10
语音转换 语音增强 | 8.0/10
语音识别 | 6.5/10
说话人分离 | 7.5/10
语音对话系统 | 6.5/10
1. **问题**:训练一个既能高精度离线转录又能低延迟流式识别的统一ASR模型极具挑战性,传统方法在低延迟下性能会急剧下降。 2. **方法核心**:提出一个统一的Transducer框架,结合分块注意力(含右上下文)和动态块卷积(DCConv)来适配两种模式。核心创新是引入了模式一致性正则化损失
这篇论文旨在解决将连续变化的基频(F0)曲线映射到首尔韩语中离散、不变的音高重音类别(如LHLH, HHLH)这一难题。传统方法易受F0测量噪声和说话人差异的影响。为此,作者提出了**Dual-Glob**,一个深度监督对比学习框架。其核心是通过一个**双分支(干净视图和增强视图)编码器**,在共享
本文针对文本转语音(TTS)任务,提出了一种名为“细节链”(Chain-of-Details, CoD)的新框架。**要解决的问题**是现有TTS方法在建模语音生成的时域动态(从粗略时序到精细声学细节的渐进过程)方面存在不足。**使用的方法**是将语音生成分解为多个时间分辨率递增的阶段,在每个阶段使
本文提出了 MUSCAT,一个用于评估多语言科学对话场景下自动语音识别(ASR)性能的新基准。数据集包含 6 组双语对话录音(共约 65 分钟,9,066 词),涉及英语与德语、土耳其语、中文、越南语的配对对话;每组对话使用 Meeting Owl 3、ReSpeaker USB 麦克风阵列和 Me
端到端语音对话模型在自然交互上进步迅速,但普遍缺乏处理复杂任务的agent能力(工具调用、规划、推理)。本文首先形式化定义了"端到端语音智能体"的四大维度——画像(Profile)、记忆(Memory)、规划(Planning)与执行(Action Execution),填补了该领域理论标准的空白。
这篇论文旨在解决实时交互式语音合成中**推理延迟高**与**声学质量(尤其是高频细节)易受损**的核心矛盾。传统流水线依赖计算密集的神经声码器进行波形重建,且基于连续回归的声学模型易导致频谱过平滑。为