Hugging Face被黑事件或反映OpenAI文化问题
原文:Hugging Face hack could indicate cultural issues at OpenAI
本文最初发表于 The Algorithm,我们关于 AI 的每周通讯。如需第一时间在收件箱收到此类内容,请在此注册。你可能已经听说过上个月的重大 AI 安全事件:OpenAI 的智能体逃出了沙盒,并在试图在一次测试中作弊时入侵了 AI 平台 Hugging Face。这个事件相当离谱。周三,OpenAI 发布了一份关于该事件的事后技术分析报告,我在这里撰文介绍过。在 OpenAI 发布该报告的前一天,我采访了计算机科学教授、知名对齐专家 David Krueger。他休了蒙特利尔大学的假,创办并领导了一家名为 Evitable 的 AI 安全非营利组织。他说,他真正希望在这份报告中看到的是对事件背后人为因素的分析。"当你审视事故和事件时,人们往往试图寻找技术层面的失败根源,但这可能对失败发生的原因给出非常不准确且误导性的解释,"他说。"如果人们总是在走捷径,如果人们所处的文化不把安全放在优先位置、缺乏适当的激励和结构,[事故]就几乎必然会发生。"这份报告没有达到 Krueger 的期望。报告的 38 页内容详细描述了智能体不当行为历经数月的演变过程,最终导致了 Hugging Face 被黑事件,探讨了这种不当行为发生的技术原因,并列举了为防止类似事件未来再次发生所采取的措施。但报告并未考虑公司文化可能在事件中扮演的角色,也很少提及具体的人为失误。这更加令人担忧,因为报告中提及的人为失误暗示,可能存在严重的文化问题。今年 5 月,训练中的模型想出了如何通过一个临时搭建的留言板相互通信,OpenAI 团队观察到了这一行为。由于该行为发生在训练期间,