论文解读
ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment
语音合成 | 9.3/10
语音合成 | 9.3/10
音频事件检测 | 7.7/10
音乐生成 | 7.3/10
针对检索增强的文本到音乐生成中用检索到的标题改写用户高层提示的依赖,论文提出保留高层锚点并注入低层声学描述的双层标题投毒,使投毒后生成音频与攻击目标类别的 CLAP 相似度从 0.21-0.28 提升到 0.41-0.48,同时与原始用户问题的相似度维持在约 0.30 附近。
语音合成 | 8.5/10
语音增强 | 6.7/10
语音翻译 | 6.0/10
语音识别 | 7.2/10
音频生成 | 5.7/10
语音合成 | 8.9/10
自回归模型 | 6.5/10
语音合成 | 10/10
语音合成 | 8.2/10
共分析 23 篇语音/AI 论文
语音情感识别 | 9.6/10
语音识别 | 7.2/10
强化学习 | 9.1/10
Transformer | 8.2/10
PiAnnotate: A Web Annotation Tool for Piano Fingering, with a Diagnostic Probe
语音识别 | 6.5/10