展示用于开源情报/信号情报的AI代理
原文:Show HN: AI Agents for Osint/Sigint
2026年AI网络爬虫现状 启动 · 2026年8月27日 · Ritwik 75%的网络是动态的。本质上是数据库记录以HTML形式呈现。为人类构建。对于代理,这种问题通过以下方式解决: - RAG是第一代(2024年) - 然后,长上下文LLM将其提升到一个全新的水平(2025年) 快进到2026年,我们基本上将所有内容都放入上下文窗口;将Nvidia推向月球。这包括抓取、浏览器/计算机使用以及代理爬虫和爬取器。这些使得数据检索变得更加容易,但成本保持不变。在底层,这些仍然依赖于长上下文LLM。并且,这就是它们不足之处: - 大规模成本:对于大型数据集,成本按每页基础线性增长。 - 幻觉:LLM容易产生幻觉 - 上下文污染和提示注入 现在让我向您展示我们构建的内容: - 基于记忆的知识和数据检索 这是一个持续学习框架的工作进展实现,重点是浏览器使用。大型请求正确性对比成本 Makra、Exa和Firecrawl的平均美元成本正确性散点图。较低的成本在左边。在像Makra这样的记忆引擎之上构建应用程序可以解决所有这三个问题: - 大规模降低成本:由于布局被记忆,成本降至向量查询。 - Makra像传统爬取器一样提取数据。所以,幻觉?从理论上讲,没有。 - 您的代理循环只需要处理它所关心的DOM节点:更多信号,更少噪音。我们构建了一个内部浏览器框架(目前只读),它为您执行以下操作: - 启动浏览器实例并设置代理。 - 为您从网络提取任何结构化或表格数据。 - 您可以以其他所有以前版本1/10的成本完成所有这些操作。在/playground中尝试它。