亚马逊Athena现支持Apache Spark引擎

Amazon Athena 支持 Apache Spark 以加速分析工作负载

Amazon Athena 现已支持开源分布式处理系统 Apache Spark,用于运行快速分析工作负载。数据分析师和工程师可以在 Athena 中使用 Jupyter Notebook 进行数据处理,并通过编程方式与 Spark 应用程序交互。

低延迟查询与可视化

对于需要低延迟查询的交互式 Spark 工作负载,客户可以从多个数据源查询数据,并可视化分析结果,Athena 可以在不到一秒内启动应用程序。

扩展现有 SQL 功能

在 Amazon Athena 现有的 SQL 功能基础上,Apache Spark on Athena 提供了按需扩展的能力,以满足不断变化的数据量和处理需求。AWS 首席开发者倡导者 Donnie Prakoso 解释了基于 Spark 3.2 的新无服务器选项的主要优势:

为交互式应用程序构建运行 Apache Spark 的基础设施并不容易。客户需要在这些应用程序之上配置、配置和维护基础设施,还需要进行资源优化以避免应用程序启动缓慢。

Apache Spark 的应用场景

Apache Spark 是一个开源的分布式处理系统,设计用于运行快速分析工作负载,广泛应用于各个行业以执行复杂的数据分析,并常用于探索数据湖以获取洞察。借助 Athena 的新功能,数据工程师可以从 AWS 控制台使用笔记本构建 Apache Spark 应用程序,或通过 Athena API 以编程方式构建。

与 AWS Glue Data Catalog 的集成

Prakoso 补充道:

Amazon Athena 与 AWS Glue Data Catalog 集成,帮助客户处理 AWS Glue Data Catalog 中的任何数据源,包括 Amazon S3 中的数据。这为客户构建应用程序以分析和可视化数据、探索数据以及为机器学习管道准备数据集提供了可能性。

现有支持与局限

Apache Spark 工作负载已经通过 Jupyter Notebook 在 AWS 上得到支持,使用 Glue 或 EMR Serverless,这使得一些开发者对新选项的好处持怀疑态度。Athena SQL 创建的视图不受 Athena for Spark 支持,因此跨引擎查询不受支持。AWS 提供了一期播客来详细介绍新功能。

演示与使用案例

在展示如何使用 Athena for Apache Spark 探索和从数据湖中获取洞察的演示中,AWS 高级大数据架构师 Pathik Shah 和 AWS 产品经理 Raj Devnath 写道:

您现在可以使用 Python 的表达能力,在 Athena 控制台上或通过 Athena API 使用简化的笔记本体验构建交互式 Apache Spark 应用程序。(...)对于在数据湖上执行交互式数据探索,您现在可以使用即时启动、交互式且完全托管的 Apache Spark 引擎。

定价与可用性

Apache Spark 代码执行按数据处理单元(DPU)每小时 0.35 美元计费,按秒计费,Athena 笔记本不收取额外费用。单个 DPU 提供四个 vCPU 和 16 GB 内存。

可用区域

Athena for Apache Spark 目前在有限的 AWS 区域可用:俄亥俄州、北弗吉尼亚州、俄勒冈州、东京和爱尔兰。

阅读 37
0 条评论