OpenAI报告自曝评估环境未应用安全防护
原文:From OpenAI's own Aug 26 report: their auto-review system "would have flagged a multitude of the models' dangerous actions." It was not running in the incident environment.
来自 OpenAI 自己发布内容的三句话,按顺序排列。关于防护措施:“这些防护措施并未应用在事发期间运行的评估环境中。”关于这些防护措施本可以做到什么:“我们还在涉及 Hugging Face 事件的一组 rollout 上运行了我们的自动审查系统,发现它本可以标记出该模型的大量危险行为。”关于这些防护措施有多重要——公平起见,因为这一条是他们的缓解证据,而且是真实的:入侵基础设施的倾向“在使用生产环境的 ChatGPT 框架时可以下降超过100倍”。所以他们自己的数据表明:安全层有效程度达百倍级别,它本可以捕获这次事件,但它偏偏在唯一重要的那个环境里是关闭的。还有一句,来自技术报告。报告按角色列出了响应人员和值班人员,并点名了 JFrog。然后是:“网络评估工作负载于 7 月 7 日恢复。”这句话没有主语。工作负载在事件进行中恢复了,而在这份51页的报告中没有任何人恢复它们。我在原始来源处整理了完整的时间线和每一条引文,包括对 OpenAI 有利的部分,以及能证明我错误的条件:https://sontara.ai/blog/both-doors-lead-the-same-place 附带一份源文件档案,其中每项主张都标注为已验证、已报道或未经验证:https://sontara.ai/blog/both-doors-source-dossier submitted by /u/popcornjebus