← 返回信息流
论文 arXiv 论文 · Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen, Ahmed E. Hassan 2026-08-31 17:08 🔥 热度 8

LLM后训练如同褐地维护:数据工程(Dataware Engineering)的工业视角

工业视角提出将LLM后训练视为棕地维护的数据工程方法

原文:LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering

工业界的后训练是一种“褐地维护”模式。团队接手一个已部署的检查点(checkpoint),必须在固定的算力和数据配比(mixture)预算下实现针对性改进,同时不损害其他能力。所维护的产物日益成为一种“数据资产”(dataware):其行为由精心策划的后训练数据配比控制,并通过有边界的配比补丁而非推倒重训来更新。基于一次工业级代码生成改进实践,我们从维护者的视角剖析了这项工作在实践中为何困难,提炼出三个反复出现的挑战:零和的配比设计、以“良率(yield)”作为核心约束指标,以及不确定性下的端到端集成;并指出,进步更多依赖于一种“数据资产编程”的工程纪律,而非一次性配方。在案例研究中,那些提高教师蒸馏向可用训练数据转化率的干预措施,在使用相同的解法教师模型和每个候选题目四次解法尝试的条件下,将可用监督数据量提升了2.84倍。在主要评估中,经良率工程化处理的补丁使CodeForces pass@1提升+2.59分(pass@3提升+3.11),留出的LiveCodeBench v6 pass@1提升+6.11(pass@3提升+8.05),以上结果均基于每种条件下单一固定检查点的16次随机评估,且在统计上显著;内部AIME和MATH回归测试保持在容差范围内。作者:Gopi Krishnan Rajbahadur、Amir M. Ebrahimi、Boyuan Chen、Ahmed E. Hassan

查看原文 ↗ 技术论文

📌 相关阅读

智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 9 【中/英】 AI 时代,类型检查会变得更重要吗?🤔 热度 9 Kubernetes上的KV缓存感知路由,及预填充解码分离 | AI Engineer | KV Cache Aware Routing and P D Di 热度 9 RAG系统检索总是不准?从原理到LangChain落地,Loader/向量库/检索调优/ChatDoc全拆解,比付费效果强百倍!零基础小白也能轻松上手! 热度 9