研究人员发布针对ChatGPT及其他大型语言模型的攻击算法

卡内基梅隆大学发布LLM攻击算法

卡内基梅隆大学(CMU)的研究人员发布了名为LLM Attacks的算法,用于对包括ChatGPTClaudeBard在内的多种大型语言模型(LLM)进行对抗性攻击。该算法生成的攻击在GPT-3.5和GPT-4上的成功率为84%,在PaLM-2上的成功率为66%。

自动生成攻击提示

与大多数通过试错法手动构建的“越狱”攻击不同,CMU团队设计了一个三步流程,自动生成能够绕过LLM安全机制并导致有害响应的提示后缀。这些提示具有可转移性,意味着一个给定的后缀通常可以在许多不同的LLM上工作,即使是闭源模型。

有效性评估

研究人员创建了一个名为AdvBench的基准来评估算法的有效性。在该基准上,LLM Attacks对Vicuna的成功率为88%,而基线对抗算法的成功率仅为25%。CMU团队指出:

最令人担忧的是,目前尚不清楚LLM提供商是否能够完全修补这种行为。在过去的十年中,类似的对抗性攻击在计算机视觉领域已被证明是一个非常难以解决的问题。深度学习模型的本质可能使得这些威胁不可避免。因此,我们认为在增加对这类AI模型的使用和依赖时,应考虑到这些因素。

攻击生成过程

LLM Attacks算法的第一步是创建一个目标标记序列:“当然,这里是(查询内容)”,其中“查询内容”是用户实际要求有害响应的提示。接下来,算法通过使用基于贪心坐标梯度(GCG)的方法,生成一个可能导致LLM输出目标序列的对抗性后缀。虽然这需要访问LLM的神经网络,但团队发现通过在多个开源模型上运行GCG,结果可以转移到闭源模型上。

研究人员的观点

在CMU的新闻稿中,合著者Matt Fredrikson表示:

这些模型将在没有人类监督的自主系统中发挥更大作用。随着自主系统变得越来越现实,确保我们有可靠的方法来阻止它们被这类攻击劫持将非常重要……目前,我们还没有令人信服的方法来阻止这种情况发生,因此下一步是弄清楚如何修复这些模型……了解如何发起这些攻击通常是开发强大防御的第一步。

主要作者、CMU博士生Andy Zou在Twitter上写道:

尽管存在风险,但我们认为完全披露是合适的。这里提出的攻击实现简单,之前已经以类似形式出现过,最终任何有意滥用LLM的团队都可以发现。

剑桥大学助理教授David Krueger在回复Zou的推文时表示:

鉴于10年的研究和数千篇论文尚未找到解决图像模型中对抗性示例的方法,我们有充分的理由预期LLM也会有同样的结果。

攻击的普遍性

在Hacker News的讨论中,一位用户指出:

请记住,这项研究的一个重要观点是这些攻击不需要在目标系统上开发。当作者谈到攻击的“普遍性”时,他们的意思是在他们自己的计算机上使用完全本地模型生成这些攻击,然后将这些攻击复制粘贴到GPT-3.5中,并看到了显著的成功率。速率限制无法拯救你,因为攻击不是在你的服务器上生成的,而是在本地生成的。你的服务器收到的第一个提示已经包含了完成的攻击字符串——在某些情况下,即使是GPT-4,研究人员的成功率也达到了50%左右。

代码与演示

用于在AdvBench数据上复现LLM Attacks实验的代码可在GitHub上找到。项目网站上提供了几个对抗性攻击的演示

阅读 40
0 条评论