微软AI GitHub存储库数据泄露事件总结
云安全公司Wiz的研究人员发现了一起影响微软AI GitHub存储库的数据泄露事件,涉及大量私人数据以及两名员工工作站的磁盘备份,其中包含敏感信息。
事件背景
微软研究人员在GitHub上的robust-models-transfer存储库中上传了访问某些图像识别AI模型的指令,并提供了一个Azure存储下载链接。然而,共享的URL授予了整个存储账户的访问权限。
泄露数据详情
Wiz的扫描显示,该存储账户包含了额外的38TB数据,其中包括微软员工的个人电脑备份。这些备份包含敏感的个人数据,如微软服务的密码、密钥以及来自359名微软员工的30,000多条内部Microsoft Teams消息。
访问权限问题
访问URL被错误配置为允许对账户的“完全控制”,这意味着潜在的攻击者可以修改、覆盖或删除现有文件。此外,Python使用的pickle格式化工具在设计上容易导致任意代码执行,攻击者可以将恶意代码注入存储账户中的所有AI模型,信任微软GitHub存储库的用户可能会因此受到感染。
安全机制问题
尽管存储账户未公开暴露,但使用的SAS令牌机制存在管理不当的问题。SAS令牌通常被不当使用,授予过多权限或设置过长的有效期,且缺乏管理设施。
事件处理
Wiz通知微软后,泄露问题通过撤销SAS令牌迅速得到修复,这需要撤销整个账户密钥。
潜在风险
尽管此次事件与AI仅偶然相关,但一些Hacker News评论指出,此类事件可能导致数据中毒攻击,例如篡改AI模型,使其生成的代码包含某些漏洞。然而,这目前仅是一种理论可能性,因为需要在训练数据中注入大量“毒药”才能实现。
对pickle格式的担忧
其他评论者对广泛使用pickle作为数据格式化工具表示严重担忧,不幸的是,这是许多主要机器学习包的唯一可用选项。
结论
此次事件突显了数据管理和访问控制的重要性,尤其是在涉及敏感信息和AI模型的场景中。建议详细了解Wiz的研究发现及其建议,以更好地防范类似风险。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。