Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences
📄 Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences 标签:#音乐生成 #多模态模型 #生成模型 #智能座舱 #实时处理 5.2/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 5.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #多模态模型 | #生成模型 #智能座舱 | arxiv 👥 作者与机构 第一作者:Cosmin Dragoiu(Mercedes-Benz Research & Development North America) 通讯作者:未说明 作者列表:Cosmin Dragoiu(Mercedes-Benz Research & Development North America)、Nooshin Nabizadeh(Mercedes-Benz Research & Development North America) 邮箱信息:cosmin.dragoiu@mercedes-benz.com、nooshin.nabizadeh@mercedes-benz.com 💡 毒舌点评 该工作把 VLM、LLM、生成式音频模型和座舱氛围灯整合成一条完整的车载音乐生成流水线,组件选型基准和 safety check 清单对工业落地有参考价值。但论文最大的硬伤是 VLM 选型结论与自己的基准数据直接矛盾:Gemini 2.5 Flash Lite 延迟更低(0.6s vs 1.2s)、CLIP 分数更高(27.25 vs 26.43),最后却选了 LiquidAI,且正文没有给出任何解释;此外"实时"“个性化"“用户正向反馈"等关键声明缺少端到端延迟、真实车辆测试和任何可量化用户研究支撑。作为顶会投稿,这更像是一份工程 demo 报告而非研究论文。 ...