英伟达的NeMo Guardrails增强了生成式AI应用的安全性

Nvidia推出NeMo Guardrails:为大型语言模型(LLMs)提供安全保障

Nvidia新推出的NeMo Guardrails软件包旨在帮助开发者减少大型语言模型(LLMs)的风险,如生成有害或冒犯性内容以及访问敏感数据。这一创新对开发者至关重要,因为它提供了多种功能来控制模型的行为,从而确保其更安全的部署。NeMo Guardrails特别有助于减轻LLMs生成有害或冒犯性内容的风险,为日益依赖AI的环境中提供了重要的保护层。

NeMo Guardrails的核心功能

NeMo Guardrails通过提供多种功能来控制LLMs的行为,帮助开发者降低相关风险。该软件包基于Colang,这是Nvidia为对话式AI开发的一种建模语言和运行时环境。Nvidia应用研究副总裁Jonathan Cohen表示:“如果你有一个客户服务聊天机器人,设计用来谈论你的产品,你可能不希望它回答关于竞争对手的问题。你需要监控对话,并在发生这种情况时将对话引导回你希望的主题。”

NeMo Guardrails的三大类别

NeMo Guardrails目前支持三大类别:主题控制、安全性和安全性。

  1. 主题控制:确保对话集中在特定主题上。
  2. 安全性:确保与LLM的互动不会导致错误信息、有毒回应或不适当内容。它还强制执行政策以提供适当回应,并防止AI系统被黑客攻击。
  3. 安全性:防止LLM执行恶意代码或以构成安全威胁的方式调用外部应用程序。

沙盒环境和风险仪表板

NeMo Guardrails提供了一个沙盒环境,允许开发者在不危及生产系统的情况下自由实验AI模型,从而减少生成有害或冒犯性内容的风险。此外,它还提供了一个风险仪表板,持续跟踪和审查AI模型的使用情况,帮助开发者在潜在风险导致重大问题之前识别并缓解这些风险。同时,它还提供了一套明确的政策和指南,旨在指导组织内部AI的使用。

反响与局限性

NeMo Guardrails的推出总体反响积极,但一些人对局限性表示担忧。开发者在使用该LLM软件包时需要注意某些限制和约束。Cambrian-AI Research的Karl Freund写道:“Guardrails可能会被恶意行为者绕过或破坏,他们可能利用系统中的弱点生成有害或误导性信息。” Jailbreaks、hallucinations等问题仍然是当前研究领域,目前没有系统能够提供完全的保护。

其他相关工具

其他工具也可用于确保大型语言模型的安全性。例如,语言模型查询语言(LMQL)旨在简化自然语言提示,并基于Python构建。微软的Guidance框架也可用于解决LLM输出不符合特定数据格式的问题。

Nvidia的建议

Nvidia建议,Guardrails最好作为第二道防线。开发和部署聊天机器人的公司仍应通过多层次的保障措施来训练模型。

阅读 50
0 条评论