Ai4 2023:来自Cruise的Hussein Mehanna的生成式AI测试经验

Ai4 2023 会议:Hussein Mehanna 关于自动驾驶车辆如何提升 AI 模型测试的演讲

在近期的 Ai4 2023 会议 上,CruiseHussein Mehanna 发表了题为“自动驾驶车辆如何提升 AI 模型测试”的演讲。演讲主要围绕如何提高生成式 AI 的可靠性,并分享了 Cruise 在自动驾驶领域的经验如何应用于 AI 模型测试。

主要观点

  1. 处理“长尾问题”
    系统需要具备处理罕见情况的能力,即“长尾问题”。Mehanna 指出,人类在面对意外情况时会改变行为,变得更加谨慎,而 AI 模型需要能够识别“认知不确定性”(epistemic uncertainty),即“知道何时不知道”。
  2. 测量模型输出质量
    开发者需要测量模型输出的质量,而不是依赖简单的聚合数据。Mehanna 举例说,Cruise 在测量车辆与行人互动的性能时,虽然整体表现优秀,但在特定群体(如儿童行人)中的表现较差。这表明,AI 模型中的“偏差”问题可能源于测量方法,而非模型本身。
  3. 推动系统至极限
    开发者应通过极限测试来观察系统在不同场景下的表现。Cruise 使用生成式 AI 创建对抗性测试场景,例如模拟行人突然摔倒或车辆突然停止的情况,以全面评估系统性能。

关键信息

  • Cruise 的经验
    Cruise 的自动驾驶车辆已行驶超过 300 万英里,展示了其在复杂场景下的表现。通过生成合成图像和对抗性场景,Cruise 提升了自动驾驶模型的训练和测试效果。
  • 生成式 AI 的应用
    Cruise 利用生成式 AI 创建单帧图像和对抗性场景,用于训练感知模型和测试车辆行为。例如,生成行人突然摔倒的场景以评估车辆的反应。
  • 语言模型的应用
    Cruise 的车辆软件使用类似语言模型的技术来预测其他车辆的运动。

重要细节

  • 认知不确定性的重要性
    Mehanna 强调,AI 模型需要能够识别和处理认知不确定性,这是提升可靠性的关键。
  • 测量方法的改进
    他建议通过多次迭代找到合适的质量测量方法,并指出 AI 模型中的偏差问题可能源于测量方法的不足。
  • 极限测试的价值
    Cruise 通过生成对抗性测试数据,全面评估系统在不同极端情况下的表现,确保系统在复杂环境中的可靠性。

总结

Mehanna 总结道:“你需要建立一个信任系统,以便安全地部署生成式 AI 或任何 AI 系统。我相信我们可以从自动驾驶车辆中学到很多。”通过处理长尾问题、改进测量方法和进行极限测试,开发者可以提高 AI 模型的可靠性,从而在更广泛的应用中安全部署 AI 技术。

阅读 27
0 条评论