← 返回信息流
行业 arXiv 论文 · Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao 2026-08-31 17:59 🔥 热度 3

SUN:面向语言驱动控制-学习-现实策略的持久化程序

SUN框架桥接模型控制与学习策略,实现长程操控

原文:SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

在长时程操作任务中,基于模型的控制与学习到的策略之间存在一个隐性的分歧:控制负责执行指定的目标,学习则将该行为摊销为反应式策略,而现有协议却丢弃了任务语义,导致奖励需要手工设计,行为也会偏离控制所验证的内容。我们提出语义统一(Semantically UNified,SUN)程序——一种类型化可执行程序,其中几何与接触关系只需定义一次,即可编译为对齐的模型预测控制(MPC)代价、满足性谓词、RL 奖励、转移守卫和诊断信息。我们的系统 Kuafu 由大型视觉语言系统驱动,能够从语言和场景语义自动合成 SUN 程序,通过 MPC 筛选可行性,并在训练阶段条件化策略时保留语义。在九项任务中,Kuafu 实现了 82.03% 的宏平均成功率,优于稀疏奖励(35.67%)和 Stage-BC(24.75%)基线。在 8192 路并行规模下,其每小时生成的成功轨迹时间是人工遥操作的 10.57 倍。使用每任务 500 条轨迹,Kuafu 数据可将 DP3 策略训练至 46.0% 的仿真成功率(对比其他方法的 22.4%),并在物理 Franka 和 Kinova 机器人上达到 34.7%。这些结果表明,经仿真筛选的任务语义可以有效将控制摊销为鲁棒策略,无需演示或手工稠密奖励,从而统一了符号规划与数据驱动执行。作者:Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao 分类:cs.RO,cs.AI

查看原文 ↗ 技术论文机器人

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 19 前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局 热度 9 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 热度 9 H2全身遥操作调试日记|脚底打滑原因找到了 热度 9 机器人领域的深度强化学习:连续控制、运动与模拟实战课程 热度 9