← 返回信息流
产品 Reddit-LocalLLaMA · /u/Adventurous_Onion189 2026-08-30 12:45 🔥 热度 3

[展示/问题] 在4B模型(Gemma 4 / Ministral)上构建一个完全本地的设备端Agent,跨移动和桌面。面对设备端限制——设备端Agent应该何去何从

在4B模型上构建本地Agent的尝试

原文:[Show / Question] Building an on-device, fully local Agent on a 4B model (Gemma 4 / Ministral) across Mobile & Desktop. Facing the reality of on-device limits—where should on-device agents go from here?

英语不是我的第一语言,抱歉有任何奇怪的措辞,这里使用翻译器!像这里的许多人一样,我对真正的隐私主权和本地优先的AI充满热情。在过去的几个月里,我一直在开发Agro——一个开源的、100%在设备上的跨平台LLM和自主代理客户端,运行在Android、iOS、macOS、Windows和Linux上。该项目基于Kotlin Multiplatform(Compose Multiplatform),在Google的原生LiteRT-LM C++运行时之上(带有Apple Metal、WebGPU Dawn、Vulkan和OpenCL加速)。它在高端手机和现代笔记本电脑上运行Gemma 3/4(4B)和Ministral-3-3B模型相当流畅。GitHub:https://github.com/Onion99/Agro Releases(APK、DMG、EXE、AppImage):https://github.com/Onion99/Agro/releases 🧗 困境 虽然基本的工具调用在3B~4B模型上运行良好,但我发现自己处于一个架构十字路口。在边缘设备上本地运行自主代理面临着残酷的硬件限制(热节流、4-8GB移动RAM上限、缓慢的token生成和微小的有效上下文窗口)。我很想向这个社区有经验的构建者学习:如果你的目标是使设备端代理真正有用(而不仅仅是一个玩具),你会考虑哪些可能的方向?任何关于架构的反馈、技术批评或方向建议都将不胜感激!如果你有设备,欢迎尝试发布页面上的二进制文件,并让我知道它在你的硬件上的表现。

🖼 相关图片

查看原文 ↗ Agent

📌 相关阅读

模型 再强也救不了 Agent:语义和记忆才是真正的瓶颈| AI Agent| AI 大模型 |Agent 记忆 热度 8 从单Agent到Multi-Agent:企业级智能体的7层核心能力一次讲透!| AI大模型 |Agent| AI |项目实战| 热度 8 GLM 5.3 和 GLM 5.3 Flash 在 RTX PRO 6000 WS 上本地运行,用 BlenderMCP 建了一座顶层豪华公寓 热度 7 千问创作上线Agent Teams,覆盖专业视频制作场景 热度 6 AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验 热度 6