分析预计算记忆的组合、重建与纠错成本
原文:What It Costs to Compose, Rebuild, and Correct Precomputed Memory
语言模型可以从预计算记忆中作答——即模型对某批资料的已保存理解,可在多次请求间复用,而无需每次重新读取。本文梳理了这种做法在哪些情况下能保持正确性,以及在何种条件下会失效。在Llama-3.1-8B-Instruct上的实验中,我们同时使用了保存的键值缓存及其训练得到的压缩版本,结果显示:预计算记忆在由分别准备的部分组装时会退化;只有通过重建才能保持最新,而根据我们的测量,重建成本占完整准备的很大比例;并且在措辞条件满足时,它才能处理随附提供的更正。如果预计算记忆能够彼此并行提供、以高性价比方式重建,并能被实时到达的新信息所取代,它们就可以作为避免在重复查询中反复向模型输入上下文的一种手段。我们的结果对处理多样化查询的已部署系统的启示是:预计算记忆最好按照新信息改变记忆原始计算依据的节奏来重建。无论是热重建键值缓存的训练压缩版本,还是在记忆旁提供特定措辞的更新(以粘贴文本或注入缓存状态的形式),都在保持预计算记忆最新方面显示出特别的潜力,后者可作为两次重建之间的临时措施,我们还测量了各自的成本并指出了相关待解问题。