SUN框架桥接模型控制与学习策略,实现长程操控
原文:SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies
在长时程操作任务中,基于模型的控制与学习到的策略之间存在一个隐性的分歧:控制负责执行指定的目标,学习则将该行为摊销为反应式策略,而现有协议却丢弃了任务语义,导致奖励需要手工设计,行为也会偏离控制所验证的内容。我们提出语义统一(Semantically UNified,SUN)程序——一种类型化可执行程序,其中几何与接触关系只需定义一次,即可编译为对齐的模型预测控制(MPC)代价、满足性谓词、RL 奖励、转移守卫和诊断信息。我们的系统 Kuafu 由大型视觉语言系统驱动,能够从语言和场景语义自动合成 SUN 程序,通过 MPC 筛选可行性,并在训练阶段条件化策略时保留语义。在九项任务中,Kuafu 实现了 82.03% 的宏平均成功率,优于稀疏奖励(35.67%)和 Stage-BC(24.75%)基线。在 8192 路并行规模下,其每小时生成的成功轨迹时间是人工遥操作的 10.57 倍。使用每任务 500 条轨迹,Kuafu 数据可将 DP3 策略训练至 46.0% 的仿真成功率(对比其他方法的 22.4%),并在物理 Franka 和 Kinova 机器人上达到 34.7%。这些结果表明,经仿真筛选的任务语义可以有效将控制摊销为鲁棒策略,无需演示或手工稠密奖励,从而统一了符号规划与数据驱动执行。作者:Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao 分类:cs.RO,cs.AI