对比强化学习从动作序列学习表征的新方法
原文:Three Steps at a Time: Learning Representations from Action Sequences in Contrastive RL
尽管自监督强化学习方法通过学习状态和动作的表征取得了显著成果,但一个关键的开放性问题是应该在何种时间尺度上建模动作。我们摒弃依赖单步动作的标准形式,将对比强化学习(CRL)这一典型的自监督方法扩展到动作块(action chunk)上,并发现这在成熟的离线和在线基准上带来了大范围、普遍的提升:分别在18个和11个环境中提升31.7%和93.1%。虽然动作分块带来的收益通常被解释为能够建模非马尔可夫、时间上延展的策略,以及传播无偏的多步回报,但有趣的是,我们发现这些论点仅部分适用于CRL。我们的实证研究表明,在CRL的背景下,一个动作块比单个动作携带更多关于目标的信息,可度量地改善了评论家(critic)的表征,使算法显著更加有效。作者:Michal Korniak、Kamil Dybek、Benjamin Eysenbach、Marco Bagatella、Michał Bortkiewicz。分类:cs.LG