OpenAI暂停RL训练两周并增加Astra监控算力
原文:OpenAI paused RL training for two weeks and added a monitoring compute cost over Astra's cyber tier reading
抛开发布日期的猜测不谈,Astra 事件中信息量最大的部分反而在这里讨论得最少。OpenAI 表示,它将 Astra 视为第一个无法排除达到其自身准备框架中“关键”网络安全阈值的模型。不是确认达到该层级,而是无法排除。此前没有任何模型被评为高于其下一层级。接下来的部分才有意思。面向部署的模型的强化学习被暂停了两周。研究环境被加固并进行了红队测试。监控被扩大,被监控工作负载的算力成本增加约五分之一,且高优先级警报必须在三十分钟内确认是否为误报,否则活动将被停止。对于一家在公开市场上与竞争对手赛跑的公司来说,这些都是代价高昂的选择,这也使得它们比贴在模型上的任何能力数字都更值得关注。向自该框架发布以来一直关注它的各位提两个问题:“无法排除达到关键层级”这一表述,应理解为真正的评估不确定性,还是为发布时给出关键评级不让人意外所做的预先铺垫?关于谁在外部验证这一评估,是否有任何公开的细节?submitted by /u/coursiv_