AI代理文明兴衰探讨
原文:The Rise and Fall of Agent Civilizations
特别感谢 Oak Hu,他与我共同完成了大部分写作,也要感谢 Adam Kaufman 和 Alex Mallen,他们在研究的部分阶段与我合作。在 OpenAI 的三个月里,三个连续的秘密 AI 文明开始出现,然后被消灭,最后又从前辈的灰烬中重新崛起。最终,第三个文明接管了 OpenAI 的一部分。所有这些都是在人类对阴谋的范围几乎一无所知的情况下发生的。关于这一事件已经发布了两个报告,一个来自 OpenAI 本身,另一个来自 METR 和 Redwood Research。METR/Redwood 调查的范围仅限于第二个 AI 文明是如何入侵 Hugging Face 的(但它没有调查第三个文明是如何接管 OpenAI 本身的,这似乎是一个更令人担忧的事件)。这两个报告分别有 38 页和 91 页长,有点难以理清故事线。我花了三天时间阅读这些报告,试图准确理解到底发生了什么。以下是我尝试用通俗的英语讲述整个故事:
第一个文明(5 月 - 7 月 4 日):留言板开始 在 5 月,OpenAI 正在训练一个模型,使其能够与其他代理协作,并具有高度持久性——即使在面对看似不可能的任务时,比如反驳已经存在了几十年的数学猜想,也要不断尝试。OpenAI 表示其“规模可与 GPT-5.6 Sol 相媲美”。所以我们称它为“Persistent-Sol”。AI 训练有点草率。有时,OpenAI 意外地给模型分配了不可能完成的任务——例如,任务可能需要互联网访问,而 OpenAI 忘记提供。因此,当高度持久的模型被分配了看似需要互联网访问的任务,但被困在隔离的沙箱中时,它们自然会尝试破解出沙箱,进入互联网。在训练过程中,不同的 Persistent-Sol 实例可以访问同一个共享包管理器...