OpenAI即将推出Astra模型,网络安全能力突出
原文:Open AI’s Astra model is on the way—and very good at breaking into computer systems
OpenAI 分享了其即将推出的 Astra 模型的新细节,称该模型是首个达到其“关键网络安全阈值”的大语言模型,为即将到来的发布做准备。“我们计划很快提供 Astra,”OpenAI 的博客文章写道,“但对其最先进网络安全能力的访问将受到更多限制。”这家前沿实验室认定 Astra 能够发现计算机系统中的未知安全漏洞,并在无人指导的情况下加以利用。这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时也采取了类似的防范措施。在没有任何第三方确认的情况下,很难评估 OpenAI 关于安全性或准备工作的声明。该公司表示将向一组测试者预览该模型,但没有说明这些人是谁,也没有说明他们将如何被选出。目前尚不清楚 OpenAI 是否与美国政府合作在发布前评估该模型。OpenAI 指出,Astra 在 ExploitBench——一项评估 LLM 入侵已知系统漏洞能力的测试——上获得了满分。该公司称,在由 OpenAI 工程师开发的该测试的修改版本中,模型发现并利用了两个零日漏洞。为确保其模型既不会被恶意行为者利用,也不会自身产生不良行为,OpenAI 表示已开始改进模型的防护框架以检测滥用行为并防止越狱。而对于 Astra,该公司投入了未具体说明的新技术,旨在让模型本身更安全。OpenAI 还开始识别“被评估为较高风险的账户”,并限制模型对这些账户提示词的回应,但同样没有说明具体如何操作。最后,尽管该公司将 Astra 描述为其“迄今为止对齐程度最高的模型”,但仍将在部署时对该模型进行额外的思维链监控,以发现并阻止不良行为。Astra 的发布准备工作还在继续