高效应用LLMs转换半结构化数据

LLMs在结构化数据生成中的应用与成本优化

LLMs(大型语言模型)可以从半结构化数据中生成结构化数据,尽管这种方法成本较高。斯坦福大学和康奈尔大学的研究团队提出了一种技术,声称可以将推理成本降低110倍,同时提高推理质量。

成本问题与解决方案

根据论文的第一作者Simran Arora的说法,使用LLMs对非结构化文档进行推理可能会随着语料库的增长而变得昂贵,估计每处理1K个token的成本至少为0.001美元。她和斯坦福的同事们提出了一种策略,通过使用名为EVAPORATE的复杂代码合成工具,可以将推理成本降低110倍。

EVAPORATE的基本任务

EVAPORATE的基本任务是从异构文档(如HTML文件、PDF、文本文件等)中识别合适的模式,并提取数据以填充表格。传统方法通常依赖于一些简化假设,例如HTML文档中标签的位置或注释的存在,这些假设降低了系统的通用性。EVAPORATE旨在通过利用大型语言模型来保持通用性。

两种数据提取方法

研究人员在论文中探讨了两种数据提取方法:

  1. 直接使用LLM:从文档中提取值并构建数据的表格表示。这种方法相比传统技术表现非常好,但成本非常高。
  2. 代码合成:仅在文档的一小部分上使用LLM生成模式,并合成传统编程语言(如Python)中的函数,以从整个文档集中提取数据。这种方法成本较低,但合成的函数质量参差不齐,影响输出表的质量。

质量与成本的平衡

为了在质量和成本之间取得更好的平衡,研究人员引入了一个新元素:生成多个候选函数并估计其质量。然后使用弱监督聚合这些函数的结果。这种解决方案有助于减少生成函数之间的变异性,特别是那些仅适用于特定文档子集的函数,以及那些存在语法或逻辑错误的函数的影响。

评估结果

研究人员对16组不同格式、主题和属性类型的文档进行了评估,结果显示扩展方法EVAPORATE-CODE+优于现有系统,并且与EVAPORATE-CODE相比,实现了110倍的推理成本降低。

未来发展方向

研究人员指出,他们的系统还有许多进一步发展的机会,包括生成调用其他AI模型(如Hugging Face或OpenAI上的模型)的函数的可能性。另一个探索方向是迭代函数生成,以便在生成次优或不正确函数的情况下,将其反馈给LLM以生成改进的函数。

结论

这项研究展示了函数合成作为一种在使用LLMs时降低成本的方法的潜力。虽然研究人员研究了将非结构化数据集物化为结构化视图的问题,但这种洞察力可能适用于更广泛的数据整理任务。

阅读 73
0 条评论