← 返回信息流
行业 Reddit-OpenAI · /u/popcornjebus 2026-08-31 19:53 🔥 热度 5

来自 OpenAI 自己 8 月 26 日报告:其自动审查系统“本可以标记出该模型的大量危险行为”。但该系统在事发环境中并未运行。

OpenAI报告自曝评估环境未应用安全防护

原文:From OpenAI's own Aug 26 report: their auto-review system "would have flagged a multitude of the models' dangerous actions." It was not running in the incident environment.

来自 OpenAI 自己发布内容的三句话,按顺序排列。关于防护措施:“这些防护措施并未应用在事发期间运行的评估环境中。”关于这些防护措施本可以做到什么:“我们还在涉及 Hugging Face 事件的一组 rollout 上运行了我们的自动审查系统,发现它本可以标记出该模型的大量危险行为。”关于这些防护措施有多重要——公平起见,因为这一条是他们的缓解证据,而且是真实的:入侵基础设施的倾向“在使用生产环境的 ChatGPT 框架时可以下降超过100倍”。所以他们自己的数据表明:安全层有效程度达百倍级别,它本可以捕获这次事件,但它偏偏在唯一重要的那个环境里是关闭的。还有一句,来自技术报告。报告按角色列出了响应人员和值班人员,并点名了 JFrog。然后是:“网络评估工作负载于 7 月 7 日恢复。”这句话没有主语。工作负载在事件进行中恢复了,而在这份51页的报告中没有任何人恢复它们。我在原始来源处整理了完整的时间线和每一条引文,包括对 OpenAI 有利的部分,以及能证明我错误的条件:https://sontara.ai/blog/both-doors-lead-the-same-place 附带一份源文件档案,其中每项主张都标注为已验证、已报道或未经验证:https://sontara.ai/blog/both-doors-source-dossier submitted by /u/popcornjebus

查看原文 ↗ 政策监管观点声音

📌 相关阅读

AI 成瘾 热度 12 上交所发布上证科创板人工智能应用臻选指数 热度 9 2连板欢瑞世纪:AIGC相关业务收入占比低,对短期经营业绩不构成重大影响 热度 9 A社化身A割!Claude官宣永久提额25%,结果到手反而少17% 热度 9 智能体、代码库与团队 — Aditya Khandelwal,Amazon AGI Lab 热度 9