微软AI研究人员意外泄露了38TB的敏感数据

微软AI GitHub存储库数据泄露事件总结

云安全公司Wiz的研究人员发现了一起影响微软AI GitHub存储库的数据泄露事件,涉及大量私人数据以及两名员工工作站的磁盘备份,其中包含敏感信息。

事件背景

微软研究人员在GitHub上的robust-models-transfer存储库中上传了访问某些图像识别AI模型的指令,并提供了一个Azure存储下载链接。然而,共享的URL授予了整个存储账户的访问权限。

泄露数据详情

Wiz的扫描显示,该存储账户包含了额外的38TB数据,其中包括微软员工的个人电脑备份。这些备份包含敏感的个人数据,如微软服务的密码、密钥以及来自359名微软员工的30,000多条内部Microsoft Teams消息。

访问权限问题

访问URL被错误配置为允许对账户的“完全控制”,这意味着潜在的攻击者可以修改、覆盖或删除现有文件。此外,Python使用的pickle格式化工具在设计上容易导致任意代码执行,攻击者可以将恶意代码注入存储账户中的所有AI模型,信任微软GitHub存储库的用户可能会因此受到感染。

安全机制问题

尽管存储账户未公开暴露,但使用的SAS令牌机制存在管理不当的问题。SAS令牌通常被不当使用,授予过多权限或设置过长的有效期,且缺乏管理设施。

事件处理

Wiz通知微软后,泄露问题通过撤销SAS令牌迅速得到修复,这需要撤销整个账户密钥。

潜在风险

尽管此次事件与AI仅偶然相关,但一些Hacker News评论指出,此类事件可能导致数据中毒攻击,例如篡改AI模型,使其生成的代码包含某些漏洞。然而,这目前仅是一种理论可能性,因为需要在训练数据中注入大量“毒药”才能实现。

pickle格式的担忧

其他评论者对广泛使用pickle作为数据格式化工具表示严重担忧,不幸的是,这是许多主要机器学习包的唯一可用选项。

结论

此次事件突显了数据管理和访问控制的重要性,尤其是在涉及敏感信息和AI模型的场景中。建议详细了解Wiz的研究发现及其建议,以更好地防范类似风险。

阅读 22
0 条评论