Ai4 2023 会议:Hussein Mehanna 关于自动驾驶车辆如何提升 AI 模型测试的演讲
在近期的 Ai4 2023 会议 上,Cruise 的 Hussein Mehanna 发表了题为“自动驾驶车辆如何提升 AI 模型测试”的演讲。演讲主要围绕如何提高生成式 AI 的可靠性,并分享了 Cruise 在自动驾驶领域的经验如何应用于 AI 模型测试。
主要观点
- 处理“长尾问题”
系统需要具备处理罕见情况的能力,即“长尾问题”。Mehanna 指出,人类在面对意外情况时会改变行为,变得更加谨慎,而 AI 模型需要能够识别“认知不确定性”(epistemic uncertainty),即“知道何时不知道”。 - 测量模型输出质量
开发者需要测量模型输出的质量,而不是依赖简单的聚合数据。Mehanna 举例说,Cruise 在测量车辆与行人互动的性能时,虽然整体表现优秀,但在特定群体(如儿童行人)中的表现较差。这表明,AI 模型中的“偏差”问题可能源于测量方法,而非模型本身。 - 推动系统至极限
开发者应通过极限测试来观察系统在不同场景下的表现。Cruise 使用生成式 AI 创建对抗性测试场景,例如模拟行人突然摔倒或车辆突然停止的情况,以全面评估系统性能。
关键信息
- Cruise 的经验
Cruise 的自动驾驶车辆已行驶超过 300 万英里,展示了其在复杂场景下的表现。通过生成合成图像和对抗性场景,Cruise 提升了自动驾驶模型的训练和测试效果。 - 生成式 AI 的应用
Cruise 利用生成式 AI 创建单帧图像和对抗性场景,用于训练感知模型和测试车辆行为。例如,生成行人突然摔倒的场景以评估车辆的反应。 - 语言模型的应用
Cruise 的车辆软件使用类似语言模型的技术来预测其他车辆的运动。
重要细节
- 认知不确定性的重要性
Mehanna 强调,AI 模型需要能够识别和处理认知不确定性,这是提升可靠性的关键。 - 测量方法的改进
他建议通过多次迭代找到合适的质量测量方法,并指出 AI 模型中的偏差问题可能源于测量方法的不足。 - 极限测试的价值
Cruise 通过生成对抗性测试数据,全面评估系统在不同极端情况下的表现,确保系统在复杂环境中的可靠性。
总结
Mehanna 总结道:“你需要建立一个信任系统,以便安全地部署生成式 AI 或任何 AI 系统。我相信我们可以从自动驾驶车辆中学到很多。”通过处理长尾问题、改进测量方法和进行极限测试,开发者可以提高 AI 模型的可靠性,从而在更广泛的应用中安全部署 AI 技术。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。