Amazon Opensearch Serverless 的向量引擎现已进入预览阶段

AWS宣布预览版向量存储和搜索功能

AWS在其无服务器搜索服务Amazon OpenSearch Serverless中发布了向量存储和搜索功能的预览版。该功能旨在支持机器学习增强的搜索体验和生成式AI应用。

背景与现有技术

Amazon OpenSearch Serverless是Amazon OpenSearch Service的无服务器版本,基于开源搜索项目Apache Lucene。传统上,基于Lucene的搜索系统依赖于关键字匹配和评分指标来控制结果的相关性。这种方法虽然高效,但可能会排除语义上符合查询但缺少关键字的文档。

向量搜索的优势

向量搜索通过将查询转换为密集向量,并通过变换模型找到具有相似向量表示的文档,从而克服了传统关键字搜索的局限性。这种方法需要一种能够适当索引这些向量(称为嵌入)并通过搜索邻近向量来识别相似性的存储系统。

新功能:向量引擎

新的向量引擎允许创建维度高达16,000的向量索引,并支持欧几里得、余弦或点积相似性度量。此外,新索引允许每个文档最多有1000个字段作为搜索过滤器的上下文元数据。

架构优势

利用OpenSearch Serverless的架构,向量引擎消除了用户对底层基础设施进行大小调整、调优或扩展控制的需求。它还支持OpenSearch套件API,允许现有的词汇搜索、过滤、聚合和地理空间查询功能与向量搜索结合使用。

用户反馈与改进

用户反馈主要集中在Amazon OpenSearch Serverless相对较高的成本上。AWS团队已经计划在未来将最低要求从4个OpenSearch计算单元(OCU)降低到1个OCU,并提供每月1400个OCU小时的免费额度,以便客户在服务正式发布前进行实验。

替代方案

对于类似的生成式AI和机器学习工作负载,替代方案包括带有pgvector扩展的PostgreSQLElasticsearch Vector SearchPinecone

进一步信息

有关如何开始使用Amazon OpenSearch Serverless向量引擎的更多信息,请参阅其文档页面

阅读 21
0 条评论