论文解读
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
语音合成 | 10/10
语音合成 | 10/10
语音翻译 | 7.8/10
自监督学习 | 9.7/10
口音识别 | 8.3/10
生成对抗网络 | 8.1/10
针对几何变化压制材料特征的问题,GaMi 用共位毫米波与声学的共享几何一致性做对齐-校准-相减解耦,并以样本间对比抑制残差,在 20 类材料上以 95.2% 的总体准确率显著优于单模态基线,代价是需双模态同步采集与多目标联合训练。
语音合成 | 9.3/10
音频事件检测 | 7.7/10
音乐生成 | 7.3/10
针对检索增强的文本到音乐生成中用检索到的标题改写用户高层提示的依赖,论文提出保留高层锚点并注入低层声学描述的双层标题投毒,使投毒后生成音频与攻击目标类别的 CLAP 相似度从 0.21-0.28 提升到 0.41-0.48,同时与原始用户问题的相似度维持在约 0.30 附近。
语音合成 | 8.5/10
语音增强 | 6.7/10
语音翻译 | 6.0/10
语音识别 | 7.2/10
音频生成 | 5.7/10
语音合成 | 8.9/10
自回归模型 | 6.5/10
语音合成 | 10/10
语音合成 | 8.2/10
共分析 23 篇语音/AI 论文