用HFlow评测开源VLM处理第一视角数据
原文:We used HFlow to evaluate the latest open weights VLMs for processing egocentric data
我们使用HFlow评测了最新的开源权重VLM(视觉语言模型)在处理第一人称视角(egocentric)数据方面的表现。评测基于Build AI的Egocentric-10k基准,该基准曾使用Gemini 2.5 Flash来测量手部可见度和主动操作。我们保持了相同的提示词和相同的数据集,仅更换模型。各模型与原始结果的一致度如下:Gemini 2.5 Flash:91.65%(基准)GLM 5.3 Flash:91.00% Gemma 4 26B-A4B:90.87% Qwen 3.8 27B:90.79% Inkling Small:85.21% Gemma表现最为亮眼,其结果与Gemini持平,但成本仅为其1/19。Gemma和Qwen模型都可实际自托管,能在数据不外流的情况下进行私有化处理。这表明现代开源权重VLM已经足以胜任大规模第一人称视角数据处理。主要的差异化因素越来越体现在成本、吞吐量、输出可靠性和自托管便利性上。如果你正在为第一人称视角数据优化多模态处理,可以使用Hflow,用任意提示词和模型自行运行此评测。https://github.com/Hebbian-Robotics/hflow git clone https://github.com/Hebbian-Robotics/hflow.git cd hflow/examples/build_ai_evaluation 来自 /u/kuaythrone