← 返回信息流
模型 TechCrunch AI · Tim Fernholz 2026-09-01 21:06 🔥 热度 8

OpenAI 的 Astra 模型即将问世——而且非常擅长入侵计算机系统

OpenAI即将推出Astra模型,网络安全能力突出

原文:Open AI’s Astra model is on the way—and very good at breaking into computer systems

OpenAI 分享了其即将推出的 Astra 模型的新细节,称该模型是首个达到其“关键网络安全阈值”的大语言模型,为即将到来的发布做准备。“我们计划很快提供 Astra,”OpenAI 的博客文章写道,“但对其最先进网络安全能力的访问将受到更多限制。”这家前沿实验室认定 Astra 能够发现计算机系统中的未知安全漏洞,并在无人指导的情况下加以利用。这与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似,OpenAI 在准备推出 Astra 时也采取了类似的防范措施。在没有任何第三方确认的情况下,很难评估 OpenAI 关于安全性或准备工作的声明。该公司表示将向一组测试者预览该模型,但没有说明这些人是谁,也没有说明他们将如何被选出。目前尚不清楚 OpenAI 是否与美国政府合作在发布前评估该模型。OpenAI 指出,Astra 在 ExploitBench——一项评估 LLM 入侵已知系统漏洞能力的测试——上获得了满分。该公司称,在由 OpenAI 工程师开发的该测试的修改版本中,模型发现并利用了两个零日漏洞。为确保其模型既不会被恶意行为者利用,也不会自身产生不良行为,OpenAI 表示已开始改进模型的防护框架以检测滥用行为并防止越狱。而对于 Astra,该公司投入了未具体说明的新技术,旨在让模型本身更安全。OpenAI 还开始识别“被评估为较高风险的账户”,并限制模型对这些账户提示词的回应,但同样没有说明具体如何操作。最后,尽管该公司将 Astra 描述为其“迄今为止对齐程度最高的模型”,但仍将在部署时对该模型进行额外的思维链监控,以发现并阻止不良行为。Astra 的发布准备工作还在继续

查看原文 ↗ 大模型发布其他

📌 相关阅读

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:编程基准翻倍,缓存读取成本直降 75% 热度 27 GPT-6 热度 15 Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线 热度 10 巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS 热度 10 李飞飞发布:全球首个多模态世界模型 热度 10