Meta的CICERO AI赢得在线外交比赛

Meta AI 开源 CICERO:在策略游戏《Diplomacy》中击败人类玩家

Meta AI Research 最近开源了名为 CICERO 的人工智能系统,该系统能够在策略游戏《Diplomacy》中击败大多数人类玩家。《Diplomacy》是一款需要与其他玩家协调计划的游戏,CICERO 结合了类似聊天机器人的对话能力和战略推理能力,并在最近的一场在线《Diplomacy》锦标赛中击败了人类玩家,获得了第一名。

CICERO 的技术细节

CICERO 的相关研究发表在《Science》期刊上,详细描述了其工作原理。CICERO 使用了一个包含 27 亿参数的语言模型来处理与其他玩家之间的对话。为了确定其行动,CICERO 的规划算法利用对话来预测其他玩家可能采取的行动,以及其他玩家认为 CICERO 会采取的行动。反过来,规划器的输出为对话模型提供了意图。为了评估 CICERO,研究团队匿名将其参加了 40 场在线《Diplomacy》游戏,结果显示 CICERO 的得分是人类玩家平均得分的两倍多。

Meta 团队表示:

尽管我们在这项工作中取得了显著进展,但如何稳健地将语言模型与特定意图对齐,以及决定这些意图的技术(和规范)挑战仍然存在。通过开源 CICERO 代码,我们希望 AI 研究人员能够以负责任的方式继续推进我们的工作。我们已通过使用对话模型进行零样本分类,初步尝试检测和删除新领域中的有害信息。我们希望《Diplomacy》能成为推进人机交互研究的安全沙盒。

《Diplomacy》游戏背景

《Diplomacy》是一款策略棋盘游戏,玩家需要通过占领大多数称为供应中心的领土来获胜。游戏中没有随机因素,战斗结果由数量优势决定。因此,玩家通常需要合作,游戏的大部分时间都花在发送消息以协调行动上。有时,玩家会进行欺骗,例如承诺帮助其他玩家,但实际上计划攻击该玩家。

CICERO 的对话生成与规划

为了在游戏中取得成功,AI 不仅需要生成人类水平的消息,这些消息还必须与游戏板的状态相符,并且能够赢得其他玩家的信任。Meta 使用了一个预训练的 R2C2 语言模型,并在近 1300 万条在线《Diplomacy》游戏消息的数据集上进行了微调。生成的对话基于规划模块生成的意图,这些意图是消息发送者和接收者在阅读消息后最可能采取的行动。

CICERO 的规划模块通过预测其他玩家可能采取的行动(基于游戏板状态和这些玩家的消息)来生成意图,然后为自己选择最优行动。为了模拟其他玩家的可能行动,CICERO 使用了一种称为 piKL 的迭代规划算法,该算法结合了与其他玩家对话中的信息。为了训练规划模块,Meta 研究人员使用了类似于 AlphaZero 的自对弈算法。

CICERO 的在线表现

Meta 团队将 CICERO 匿名参加了在线《Diplomacy》游戏的联赛。AI 共进行了 40 场比赛,包括一场有 21 名玩家参加的 8 场锦标赛,CICERO 在锦标赛中获得了第一名。在全部 40 场比赛中,CICERO 的排名在前 10%,平均得分为 25.8%,而其 82 名人类对手的平均得分仅为 12.4%。

CICERO 是否会“背叛”其他玩家?

在关于这项工作的 Twitter 讨论中,CICERO 的合著者 Mike Lewis 回答了 关于 CICERO 是否会“背叛”(即欺骗)其他玩家的问题:

CICERO 被设计为不会有意背叛——它的所有消息都与其当前计划采取的行动相符。然而,有时它会改变主意...

开源代码

CICERO 的源代码已在 GitHub 上公开。

阅读 56
0 条评论