← 返回信息流
论文 Reddit-LocalLLaMA · /u/kuaythrone 2026-08-30 19:40 🔥 热度 4

我们用HFlow评测了最新的开源权重VLM处理第一人称视角数据的能力

用HFlow评测开源VLM处理第一视角数据

原文:We used HFlow to evaluate the latest open weights VLMs for processing egocentric data

我们使用HFlow评测了最新的开源权重VLM(视觉语言模型)在处理第一人称视角(egocentric)数据方面的表现。评测基于Build AI的Egocentric-10k基准,该基准曾使用Gemini 2.5 Flash来测量手部可见度和主动操作。我们保持了相同的提示词和相同的数据集,仅更换模型。各模型与原始结果的一致度如下:Gemini 2.5 Flash:91.65%(基准)GLM 5.3 Flash:91.00% Gemma 4 26B-A4B:90.87% Qwen 3.8 27B:90.79% Inkling Small:85.21% Gemma表现最为亮眼,其结果与Gemini持平,但成本仅为其1/19。Gemma和Qwen模型都可实际自托管,能在数据不外流的情况下进行私有化处理。这表明现代开源权重VLM已经足以胜任大规模第一人称视角数据处理。主要的差异化因素越来越体现在成本、吞吐量、输出可靠性和自托管便利性上。如果你正在为第一人称视角数据优化多模态处理,可以使用Hflow,用任意提示词和模型自行运行此评测。https://github.com/Hebbian-Robotics/hflow git clone https://github.com/Hebbian-Robotics/hflow.git cd hflow/examples/build_ai_evaluation 来自 /u/kuaythrone

🖼 相关图片

查看原文 ↗ 技术论文

📌 相关阅读

专刊征稿——大模型赋能智慧农业应用 热度 8 MIT最新研究显示:AI文明可能根本不需要语 热度 8 如果禁用 H-Neurons,Qwen3.8-27B 或 GLM-5.3-Flash 这类模型会变得多差? 热度 7 智能体适应度函数:将演进式架构扩展至确定性规则之外 热度 7 演讲:在边缘运行 AI——直接在浏览器中运行真实工作负载 热度 6