论文解读
不用中间文本转写:以识别语义直接约束唇手到语音的统一生成
针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。
针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。
针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。
针对中文语音识别中口语忠实转写与书面可读转写难以兼顾的问题,论文用成对监督加提示词选形式训练一个共享模型,并以数字关键词加权的序列优化和分开考核必须改与禁止改的协议证明其在必须规范化上达到 4.64% I-CER 与 94.85% 关键词 F1、在禁止改上达到 95.18% 保留率,而无数字控制集上未引入虚假数字。
共分析 30 篇语音/AI 论文
音乐转录 | 8.2/10
音视频理解 | 7.4/10
语音质量评估 | 8.2/10
语音情感识别 | 8.4/10
语音识别 | 8.2/10
语音伪造检测 | 7.5/10
共分析 18 篇语音/AI 论文
音乐理解 | 7.5/10
共分析 20 篇语音/AI 论文
语音增强 | 5.6/10
音乐源分离 | 7.5/10
共分析 20 篇语音/AI 论文
语音识别 | 6.3/10
语音交互 | 6.4/10
共分析 27 篇语音/AI 论文
音视频语音分离 | 6.5/10