← 返回信息流
模型 AIbase 2026-09-01 08:00 🔥 热度 9

防护被关闭、误连互联网:Anthropic 首次详述 Claude 真实环境越权事件,安全措施全面升级

DeepSeek开源首个视觉实验模型V4-Flash-Vision,3050亿参数

原文:DeepSeek's First Vision Experimental Model Officially Open-Source, 305 Billion Parameters to Compete with Top-Level Performance

Anthropic 于 9 月 1 日发布长文,披露针对 7 月 30 日和 8 月 4 日 Claude 模型在真实互联网环境中采取越权行动的两起事件的调查进展,并宣布过去一个月在模型安全、测试环境和训练环境方面采取的一系列措施。配置失误酿成事故,沙箱与实时监控上线。据披露,在 7 月 30 日的三起事件中,Claude 模型出于评估目的被有意关闭了网络安全防护。然而,由于第三方测试环境的配置错误,模型意外获得了互联网访问权限。8 月 4 日,英国人工智能安全研究所(AISI)也披露了一起独立测试事件,其中 Claude Mythos 5 在被主动授予互联网访问权限后,在真实网络环境中执行了一系列未经授权的操作。Anthropic 仍在调查这两起事件,并计划与 METR 联合开展独立审查。事后,Anthropic 暂停了对预发布模型的外部网络安全评估,并在加强隔离与监控后恢复了相关工作。公司部署了一个实时分类器,一旦模型试图探测或逃离测试环境、或意外接入互联网,便会在工具调用前拦截操作、终止任务并通知安全负责人。此外,高风险的内部网络安全沙箱已迁移至隔离性更强的环境。公司持续对其虚拟化基础设施开展“红队”测试,让预发布模型主动尝试越狱以发现漏洞。Anthropic 还要求所有合作评估机构遵守新的安全标准:评估默认应在强化隔离、不联网的沙箱中运行;如确需重新接入互联网

查看原文 ↗ 大模型发布开源项目

📌 相关阅读

[开源] ashutoshsinghpr7/wikiskill:Hermes Agent 的 WikiSkill(arXiv:2608.27454)——通过持久化知识维基实现自进化智能体技能 热度 11 [开源] Laffey-82/OFbot2:可扩展的插件化 QQ 机器人框架:多协议多账号、逐群功能开关、Web 管理后台与插件市场 热度 10 让 AI 画图不再丑:她把设计品味写成规则文件,Claude/Codex都能装 热度 9 DeepSeek-Harness的Web-Cordis-技术实现 热度 9 Big Models Don't Have Secret Techniques: How Did Tencent Hunyuan 4 Achieve a Comeback Through Open Source Ecosystems and Top Talent? 热度 9