Google 宣布 Hive-BigQuery Connector 正式上线
Google 近日宣布 Hive-BigQuery Connector 正式上线,该工具简化了 Apache Hive 和 Google BigQuery 之间的集成与迁移。这个开源连接器是一个 Hive 存储处理器,使 Hive 能够与 BigQuery 的存储层进行交互。
主要功能与优势
- 支持 HiveQL 查询:该连接器支持使用类似 SQL 的查询语言 HiveQL 在 Hive 中读取和写入 BigQuery 数据。
- 无数据移动:数据工程师可以直接访问和查询 BigQuery 数据集,无需移动数据。
- 工具与框架的兼容性:BigQuery 用户可以利用 Hive 的工具、库和框架进行数据处理和分析。
技术细节
- Hive StorageHandler API:连接器实现了 Hive StorageHandler API,允许 Hive 工作负载与 BigQuery 和 BigLake 表集成。
- 计算与数据层分离:Hive 的执行引擎处理所有计算操作(如聚合和连接),而连接器管理与 BigQuery 数据层的所有交互。
- 支持多种执行引擎:连接器支持 MapReduce 和 Tez 执行引擎,并支持创建和删除 BigQuery 表。
- 快速读取:通过 Storage Read API 流和 Apache Arrow 格式,支持从 BigQuery 表中快速读取数据。
适用场景
- 迁移期间的连续性:确保在迁移过程中业务的连续性。
- 部分数据仓库需求:使用 BigQuery 满足部分数据仓库需求。
- 开源软件栈:维护完整的开源软件栈。
其他相关工具
- BigQuery Migration Service:Google 已支持 BigQuery 批量 SQL 翻译器 和 交互式 SQL 翻译器,将 Hive 查询转换为 BigQuery 的 ANSI 兼容 SQL 语法。
- 其他开源连接器:Google 还发布了其他开源连接器,如 Cloud Storage Connector 和 Apache Spark SQL connector for BigQuery,以减少数据转换并分析多样化数据集。
限制与支持
- 分区支持:由于 Hive 和 BigQuery 的分区机制不同,Hive 的 PARTITIONED BY 子句不受支持。开发者可以使用 BigQuery 支持的时间单位列和摄入时间分区选项。
- Dataproc 支持:连接器支持 Dataproc 2.0 和 2.1。
获取方式
Hive-BigQuery 连接器已在 GitHub 上发布。
**粗体** _斜体_ [链接](http://example.com) `代码` - 列表 > 引用。你还可以使用@来通知其他用户。