工业视角提出将LLM后训练视为棕地维护的数据工程方法
原文:LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering
工业界的后训练是一种“褐地维护”模式。团队接手一个已部署的检查点(checkpoint),必须在固定的算力和数据配比(mixture)预算下实现针对性改进,同时不损害其他能力。所维护的产物日益成为一种“数据资产”(dataware):其行为由精心策划的后训练数据配比控制,并通过有边界的配比补丁而非推倒重训来更新。基于一次工业级代码生成改进实践,我们从维护者的视角剖析了这项工作在实践中为何困难,提炼出三个反复出现的挑战:零和的配比设计、以“良率(yield)”作为核心约束指标,以及不确定性下的端到端集成;并指出,进步更多依赖于一种“数据资产编程”的工程纪律,而非一次性配方。在案例研究中,那些提高教师蒸馏向可用训练数据转化率的干预措施,在使用相同的解法教师模型和每个候选题目四次解法尝试的条件下,将可用监督数据量提升了2.84倍。在主要评估中,经良率工程化处理的补丁使CodeForces pass@1提升+2.59分(pass@3提升+3.11),留出的LiveCodeBench v6 pass@1提升+6.11(pass@3提升+8.05),以上结果均基于每种条件下单一固定检查点的16次随机评估,且在统计上显著;内部AIME和MATH回归测试保持在容差范围内。作者:Gopi Krishnan Rajbahadur、Amir M. Ebrahimi、Boyuan Chen、Ahmed E. Hassan