LMSYS 组织发布聊天机器人竞技场及LLM评估数据集

LMSYS Org 发布 Chatbot Arena 和 MT-Bench 评测平台

LMSYS Org 最近发布了 Chatbot Arena,这是一个用于比较大型语言模型(LLMs)的平台。用户可以在两个聊天机器人的回复中选择更好的一个。LMSYS 还发布了包含 Arena 对话的数据集,以及人类对 LLMs 在 MT-Bench 基准测试中表现的评价数据集。

Chatbot Arena 的创建与目的

LMSYS Org 在今年早些时候创建了 Chatbot Arena,目的是通过“众包”方式评估多个开源和闭源的 LLMs,包括 GPT-4 和 LLaMA。Arena 生成了一个模型排行榜,根据 Elo 评分系统 对模型进行排名。由于这种方法耗时较长,LMSYS 团队开发了额外的基准测试 MT-Bench,该测试包含 80 个多轮对话问题,并由 GPT-4 对聊天机器人的回答进行评分。

MT-Bench 的特点与局限性

MT-Bench 能够有效区分不同能力的聊天机器人,具有可扩展性,并提供类别分解的详细见解。然而,LMSYS Org 指出,LLM 作为评分者时应谨慎使用,尤其是在处理数学和推理问题时,仍可能出现错误。

传统基准测试的局限性

随着 LLMs 的发展,传统基准测试(如 GLUE)已无法充分衡量其能力,因为模型在这些测试中已经表现出超人类水平。虽然 MMLU 基准测试可以衡量 LLM 的知识能力,但它无法衡量模型生成符合人类偏好的输出的能力。

Vicuna LLM 的发布与评估

LMSYS Org 在今年早些时候发布了 Vicuna LLM,这是对 Meta 的 LLaMA 模型进行微调的版本。研究人员使用 GPT-4 作为评判者,声称 Vicuna 的质量超过 ChatGPT 和 Bard 的 90%。随后,LMSYS Org 推出了 Chatbot Arena,通过众包方式评估模型。用户同时与两个模型互动,并选择他们更喜欢的模型,最终生成模型的 Elo 评分。

数据集发布与用户提示分类

在运行 Arena 几个月后,研究人员识别了 8 类用户提示,包括数学、推理和 STEM 知识等。他们为每个类别创建了 10 个多轮问题,形成了 MT-Bench,作为 Arena 的“质量控制补充”。研究人员再次使用 GPT-4 对聊天机器人的回答进行评分,发现 GPT-4 的评分与人类评分者的吻合度超过 80%。GPT-4 的解释甚至能说服人类评分者改变选择,发生率为 34%。LMSYS Org 还发布了包含 3.3k 个“专家级成对人类偏好”的数据集,涵盖六个不同模型的回答。

社区反馈与未来方向

机器学习研究员 Nathan Lambert 在 Twitter 上讨论了这一工作,指出 MT-Bench 评分是研究人员优化模型以匹配 GPT-4 等领先模型的清晰基准。MT-Bench 的合著者 Wei-Lin Chiang 也在 Twitter 上回答了几个用户问题,强调在使用模型进行评估时,官方模板的标准化和 LLM 对模板的敏感性是需要解决的问题。

资源获取

Chatbot Arena 和 MT-Bench 的评估代码已在 GitHub 上发布,Arena 对话数据集和 MT-Bench 回答数据集以及当前的 LLM 排行榜可在 Huggingface 上获取。

阅读 487
0 条评论