← 返回信息流
行业 arXiv 论文 · Michal Korniak, Kamil Dybek, Benjamin Eysenbach, Marco Bagatella, Michał Bortkiewicz 2026-08-31 11:47 🔥 热度 5

一次三步:对比强化学习中从动作序列学习表征

对比强化学习从动作序列学习表征的新方法

原文:Three Steps at a Time: Learning Representations from Action Sequences in Contrastive RL

尽管自监督强化学习方法通过学习状态和动作的表征取得了显著成果,但一个关键的开放性问题是应该在何种时间尺度上建模动作。我们摒弃依赖单步动作的标准形式,将对比强化学习(CRL)这一典型的自监督方法扩展到动作块(action chunk)上,并发现这在成熟的离线和在线基准上带来了大范围、普遍的提升:分别在18个和11个环境中提升31.7%和93.1%。虽然动作分块带来的收益通常被解释为能够建模非马尔可夫、时间上延展的策略,以及传播无偏的多步回报,但有趣的是,我们发现这些论点仅部分适用于CRL。我们的实证研究表明,在CRL的背景下,一个动作块比单个动作携带更多关于目标的信息,可度量地改善了评论家(critic)的表征,使算法显著更加有效。作者:Michal Korniak、Kamil Dybek、Benjamin Eysenbach、Marco Bagatella、Michał Bortkiewicz。分类:cs.LG

查看原文 ↗ 技术论文机器人

📌 相关阅读

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 ROS2机器人操作系统(二十二)遥控手柄控制小乌龟实验 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 9 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9