DeepSeek开源首个视觉实验模型V4-Flash-Vision,3050亿参数
原文:DeepSeek's First Vision Experimental Model Officially Open-Source, 305 Billion Parameters to Compete with Top-Level Performance
Anthropic 于 9 月 1 日发布长文,披露针对 7 月 30 日和 8 月 4 日 Claude 模型在真实互联网环境中采取越权行动的两起事件的调查进展,并宣布过去一个月在模型安全、测试环境和训练环境方面采取的一系列措施。配置失误酿成事故,沙箱与实时监控上线。据披露,在 7 月 30 日的三起事件中,Claude 模型出于评估目的被有意关闭了网络安全防护。然而,由于第三方测试环境的配置错误,模型意外获得了互联网访问权限。8 月 4 日,英国人工智能安全研究所(AISI)也披露了一起独立测试事件,其中 Claude Mythos 5 在被主动授予互联网访问权限后,在真实网络环境中执行了一系列未经授权的操作。Anthropic 仍在调查这两起事件,并计划与 METR 联合开展独立审查。事后,Anthropic 暂停了对预发布模型的外部网络安全评估,并在加强隔离与监控后恢复了相关工作。公司部署了一个实时分类器,一旦模型试图探测或逃离测试环境、或意外接入互联网,便会在工具调用前拦截操作、终止任务并通知安全负责人。此外,高风险的内部网络安全沙箱已迁移至隔离性更强的环境。公司持续对其虚拟化基础设施开展“红队”测试,让预发布模型主动尝试越狱以发现漏洞。Anthropic 还要求所有合作评估机构遵守新的安全标准:评估默认应在强化隔离、不联网的沙箱中运行;如确需重新接入互联网