Amazon Aurora PostgreSQL 新增 pgvector 以支持生成式 AI 的嵌入

AWS Aurora PostgreSQL 支持 pgvector 扩展

AWS 最近宣布,与 PostgreSQL 兼容的 Amazon Aurora 版本现在支持 pgvector,用于向量存储和相似性搜索。Aurora 是最新支持这一开源扩展的托管 PostgreSQL 数据库,能够存储和搜索机器学习模型生成的嵌入向量。

pgvector 扩展的功能

pgvector 扩展简化了在现有 PostgreSQL 数据库中存储和有效搜索嵌入向量的过程,捕捉了文本输入的语义。AWS 的首席数据库专家解决方案架构师 Shayon Sanyal 详细介绍了如何在 Aurora 上利用 pgvector 进行自然语言处理、聊天机器人和情感分析。

pgvector 提供了不同的功能,允许用户识别精确和近似的最近邻。它旨在与其他 PostgreSQL 功能(如索引和查询)无缝协作。使用 ChatGPT 和其他大型语言模型工具通常需要将这些系统的输出(即向量嵌入)存储在永久存储系统中,以便后续检索。

应用案例

Sanyal 展示了如何使用 LangChain 和 Streamlit 构建一个简单的交互式应用程序,让用户基于 PDF 文件内容进行自然语言提问。pgvector 扩展允许客户将机器学习功能集成到电子商务、媒体和健康应用中。这一新选项增强了 Amazon Aurora 机器学习的能力,将 Aurora 与 AWS 机器学习服务集成,并提供使用 SQL 语言创建基于机器学习的预测的能力。

Glass 的联合创始人 Stefan Borsje 评论说,pgvector 在 Amazon Aurora 中的表现令人惊叹,相似性搜索的速度和精度在合理规模的数据集上表现出色,能够在约 10 毫秒内对数十万个 512 维向量进行余弦相似性排序。

AI 驱动的搜索

AWS 的高级数据库专家解决方案架构师 Krishna Sarabu 解释了如何使用 SageMaker 和 pgvector 在 PostgreSQL 中构建 AI 驱动的搜索。生成嵌入向量后,应用程序或研究人员可以在向量空间内执行相似性搜索。相似性搜索在电子商务、推荐系统和欺诈检测等各种行业应用中都有益处。例如,系统可以识别产品或交易之间的数学相似性,以创建相关的产品推荐或识别潜在的欺诈活动。

其他云服务支持

由于生成式 AI 的流行,为了与 Pinecone 等专用向量数据库竞争,不同的托管数据库服务也添加了对 pgvector 的支持。这些服务包括 Azure Database for PostgreSQL Flexible Server、Azure Cosmos DB for PostgreSQL 和 Amazon RDS for PostgreSQL。此外,Google Cloud SQL for PostgreSQL 和 AlloyDB for PostgreSQL 最近也引入了对该扩展的支持。

版本和区域支持

pgvector 扩展在 Aurora PostgreSQL 15.3、14.8、13.11、12.15 及更高版本中可用,覆盖所有 AWS 区域。文档涵盖了当前支持的所有扩展及其版本,以及如何使用 PostgreSQL 扩展和外部数据包装器。

阅读 66
0 条评论