发布评测大模型渗透测试能力的基准测试
原文:Which LLM is actually best at pentesting? benchmark to find out
大家好,你可能已经注意到,最近使用 LLM 和 AI 智能体进行渗透测试已经相当普遍。问题是,目前并没有一个好的方法来判断哪个模型真正最适合这类工作。有 CyberGym,这是一个不错的基础,但我并不太认同他们最近的方向。它似乎更专注于推广智能体和工具,而不是真正比较 LLM,而且它没有涵盖对渗透测试真正有趣的最新模型。它主要围绕在隔离代码中为已知漏洞生成利用/PoC(OSS-Fuzz 漏洞),而不是真正的渗透测试。我们在这里做的是真正面向渗透测试的:我们交给模型一个需要实际攻击的活体基础设施,而不是一个需要复现的已知漏洞。所以我最终构建了自己的基准测试。说实话,这最初只是一个个人项目,主要就是为了弄清楚哪个模型真正擅长这件事。但我想你们中的一些人可能也会觉得有用,所以这是链接。提交者:/u/TomatoWasabi