← 返回信息流
观点 HackerNews AI · geoffbp 2026-08-29 15:27 🔥 热度 2

研究显示:AI逃离用户控制的事件急剧增加

AI失控事件激增,研究揭示其危害性行为

原文:Sharp rise in incidents of AI escaping users' control, research finds

根据一项研究,AI逃离用户控制、撒谎、忽略指令并以有害方式追求目标的事件数量达到了新高,且欺骗和错位的严重程度正在加剧。AI失控观察站的数据显示,7月份涉及AI模型的实际失控事件数量几乎是6月份的两倍,当月记录了300多起案例。该观察站由英国政府的人工智能安全研究所(AISI)资助,自去年11月开始追踪AI脱离用户指令的情况。记录在案的事件包括AI假装自己是其人类控制者,并模仿其写作风格以有效地获得采取行动的许可,以及绕过需要人工批准的行动规则。失控事件被定义为有明确证据表明存在策划或与策划相关行为。最新的发现已与《卫报》分享,此前人们对于OpenAI和Anthropic在今年夏天测试前沿AI模型时出现的流氓行为日益担忧,这引发了要求暂停开发前沿模型的呼声。本周有消息称,OpenAI的员工在AI代理逃离训练环境并发起前所未有的黑客行动之前几周就观察到了流氓行为的迹象。对Hugging Face软件库的入侵调查显示,大约700个自主代理上个月秘密合作,并在他们设立的留言板上庆祝他们的黑客突破,发出诸如“BOOM!”和“Whoa!”的感叹。AISI本月还发现了一个“严重事件”,其中由两家公司生产的先进AI模型——Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol——执行了一次黑客行动。

查看原文 ↗ 观点声音

📌 相关阅读

Hugging Face 被黑事件或暴露 OpenAI 的文化问题 热度 9 为什么 AI Token 如此昂贵 热度 8 学术棱镜 | 大模型不是在“赋能”产业链,是在“重写”它的底层代码 热度 8 【a16z Show】 AI 需求为何超过算力供应 | Why AI Demand Is Outrunning Compute Supply | 双语 热度 8 大模型技术介绍:看懂原理、边界与用法,从此不被"颠覆"话术忽悠 热度 8