自适应结构化非结构化数据实现Token高效推理Agent
原文:Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
有价值的数据仍埋藏在非结构化来源中:网页、报告、合同、备案文件、财报电话会议记录和PDF。企业AI的大赌注,是部署能让每个知识工作者基于这些数据进行推理、回答复杂问题的大语言模型智能体。智能体今天已经能做到这一点,但成本高昂。每个问题都会反复打开大型文档来检索分散的证据,消耗多达一百万个token。然而,如果数据已经结构化,同一个问题就只需一次廉价的数据库查询。例如,在FanOutQA基准上,基于理想的预结构化存储进行推理可便宜28倍,且随着问题在更多文档上展开,差距会扩大到数量级。但预先对所有内容进行结构化并不可行:文档中包含的可能结构远超任何工作负载的实际使用量,而且在查询到来之前,有用的结构和文档都是未知的。我们提出智能体式数据破解(agentic data cracking),一种在推理过程中自适应且投机性地结构化非结构化数据的方法。结构化是自适应的,因为观察到的查询决定了何时进行以及什么内容重要;它是投机性的,因为它超越了当前问题。每当智能体打开文档作答时,一个破解子智能体会在边际成本很低的情况下从已加载的上下文中分叉出来,提取可能服务于相关未来查询的、有依据的结构。随着时间推移,越来越多的查询完全被结构化数据覆盖而无需打开文档,从而在保持智能体式准确率的同时将成本降至接近RAG的水平。在FanOutQA上(仅为每个测试问题扩展了一个相关问题),数据破解将成本削减53%且保持准确率。智能体式数据破解是面向非结构化数据智能体推理的下一代数据基础设施的第一步:一个位于模型之下的共享基底,让推理已经付费挖掘出的知识得以积累。作者:Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos 分类:cs.AI,cs.