在4B模型上构建本地Agent的尝试
原文:[Show / Question] Building an on-device, fully local Agent on a 4B model (Gemma 4 / Ministral) across Mobile & Desktop. Facing the reality of on-device limits—where should on-device agents go from here?
英语不是我的第一语言,抱歉有任何奇怪的措辞,这里使用翻译器!像这里的许多人一样,我对真正的隐私主权和本地优先的AI充满热情。在过去的几个月里,我一直在开发Agro——一个开源的、100%在设备上的跨平台LLM和自主代理客户端,运行在Android、iOS、macOS、Windows和Linux上。该项目基于Kotlin Multiplatform(Compose Multiplatform),在Google的原生LiteRT-LM C++运行时之上(带有Apple Metal、WebGPU Dawn、Vulkan和OpenCL加速)。它在高端手机和现代笔记本电脑上运行Gemma 3/4(4B)和Ministral-3-3B模型相当流畅。GitHub:https://github.com/Onion99/Agro Releases(APK、DMG、EXE、AppImage):https://github.com/Onion99/Agro/releases 🧗 困境 虽然基本的工具调用在3B~4B模型上运行良好,但我发现自己处于一个架构十字路口。在边缘设备上本地运行自主代理面临着残酷的硬件限制(热节流、4-8GB移动RAM上限、缓慢的token生成和微小的有效上下文窗口)。我很想向这个社区有经验的构建者学习:如果你的目标是使设备端代理真正有用(而不仅仅是一个玩具),你会考虑哪些可能的方向?任何关于架构的反馈、技术批评或方向建议都将不胜感激!如果你有设备,欢迎尝试发布页面上的二进制文件,并让我知道它在你的硬件上的表现。