← 返回信息流
论文 Reddit-LocalLLaMA · /u/TomatoWasabi 2026-08-30 23:08 🔥 热度 5

哪个 LLM 真正最擅长渗透测试?用基准测试来找出答案

发布评测大模型渗透测试能力的基准测试

原文:Which LLM is actually best at pentesting? benchmark to find out

大家好,你可能已经注意到,最近使用 LLM 和 AI 智能体进行渗透测试已经相当普遍。问题是,目前并没有一个好的方法来判断哪个模型真正最适合这类工作。有 CyberGym,这是一个不错的基础,但我并不太认同他们最近的方向。它似乎更专注于推广智能体和工具,而不是真正比较 LLM,而且它没有涵盖对渗透测试真正有趣的最新模型。它主要围绕在隔离代码中为已知漏洞生成利用/PoC(OSS-Fuzz 漏洞),而不是真正的渗透测试。我们在这里做的是真正面向渗透测试的:我们交给模型一个需要实际攻击的活体基础设施,而不是一个需要复现的已知漏洞。所以我最终构建了自己的基准测试。说实话,这最初只是一个个人项目,主要就是为了弄清楚哪个模型真正擅长这件事。但我想你们中的一些人可能也会觉得有用,所以这是链接。提交者:/u/TomatoWasabi

🖼 相关图片

查看原文 ↗ 技术论文

📌 相关阅读

专刊征稿——大模型赋能智慧农业应用 热度 8 MIT最新研究显示:AI文明可能根本不需要语 热度 8 如果禁用 H-Neurons,Qwen3.8-27B 或 GLM-5.3-Flash 这类模型会变得多差? 热度 7 智能体适应度函数:将演进式架构扩展至确定性规则之外 热度 7 演讲:在边缘运行 AI——直接在浏览器中运行真实工作负载 热度 6