逆向推理结合困惑度引导的预训练数据增强方法
原文:REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation
随着语言模型算力的不断扩展,高质量训练数据正日益成为重要瓶颈。传统的下一词预测只监督上下文之后的内容,却让这种延续背后的中间推理保持隐式。我们提出 REER-PT,这是一个将逆向工程推理(REER)扩展到原始预训练数据的可扩展框架。REER-PT 识别那些难以预测但仍可从上文推断出的延续内容,并插入简洁的推理标注,以重建上下文与延续之间缺失的联系。候选标注在离线状态下生成并优化,困惑度作为优化信号。长度和目标泄露约束可过滤掉无用或琐碎的标注。这种稀疏变换保留了源文本,并与标准下一词预测保持兼容,避免了预训练期间的在线推理 rollout。我们应用 REER-PT 将源预训练语料库转换为增强语料库。在增强数据、原始 token 和筛选延续内容的对比中,困惑度降幅介于 0.42 到 7.29 之间,且仅约 0.05% 的标注 13-gram 原样出现在源文本中。随后,我们分别用相同架构和训练配置,在源语料库和增强语料库上训练了两个 680M 参数模型。增强数据模型在多项知识和推理基准上获得了高达 2.07 个百分点的提升。综合来看,困惑度分析表明延续内容的可预测性得到改善,而受控预训练实验则表明这种增强可以在不改变标准预训练目标的情况下提升模型性能。