QCon London 会议:DoorDash 的 MLOps 扩展与演进策略
在最近的 QCon London 会议上,DoorDash 机器学习平台高级工程经理 Hien Luu 发表了题为 "Strategies and Principles to Scale and Evolve MLOps at DoorDash" 的演讲。Luu 分享了如何克服机器学习系统未能为生产环境带来价值的挑战,这是许多公司面临的常见问题。他提出了三个关键原则,这些原则在 DoorDash 中被证明是有效的。
机器学习项目的失败率高
Luu 在演讲开始时指出,根据 Gartner 的数据,85% 的机器学习项目失败,主要原因在于它们未能进入生产环境。他强调,机器学习模型在投入生产之前无法产生投资回报(ROI)。MLOps 应被视为一种工程学科,采用正确的策略对于从零开始构建成功的 MLOps 基础设施至关重要。
成功 MLOps 的四个关键因素
AI Infrastructure Alliance 提供了一个基于四个关键因素的 MLOps 成功蓝图:用例、文化、技术和人员。
- 用例:理解机器学习项目的关键方面至关重要,需要与利益相关者和决策者合作,可能涉及公平性、偏见和预测可解释性等问题。
- 文化:了解公司文化是成功实施 MLOps 策略的关键,公司可能具有创新、协作、结果导向、传统、客户导向或包容性等不同特点。
- 技术:评估系统周围的技术债务和所有依赖项的成熟度,确保技术与人员目标一致,以达到预期效果。
- 人员:在基础设施规划中让利益相关者参与,并保持有效的沟通模式,确保 MLOps 策略与组织的需求和目标一致。
DoorDash 的三大核心原则
Luu 分享了 DoorDash 在扩展和演进 MLOps 过程中成功的三大核心原则:
- Dream Big, Start Small(大处着眼,小处着手):强调明确的愿景和雄心勃勃的目标,同时通过逐步改进实现进展和影响。
- 1% Better Every Day(每天进步 1%):通过持续的小改进实现整体提升,Luu 以 DoorDash 使用 Redis 进行特征存储为例,展示了减少 CPU 时间和内存使用的优化,最终实现了 3 倍的成本降低和 38% 的延迟减少。
- Customer Obsession(客户至上):强调倾听客户需求并为其创新,DoorDash 通过“薯条时刻”给客户带来惊喜,从而提升客户体验。
现有工具与利益相关者对齐
在问答环节,Luu 建议在构建自定义工具之前考虑现有解决方案,例如 Triton 或 Bento。他还强调,理解利益相关者的目标和公司期望的影响是确保 MLOps 策略成功的关键。
结论
Luu 在 QCon London 会议上分享了三个原则,帮助公司扩展和演进 MLOps 项目。通过遵循“大处着眼,小处着手”、“每天进步 1%”和“客户至上”的原则,并考虑现有工具和利益相关者的对齐,公司可以显著提高其机器学习系统在生产环境中的成功率。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。