← 返回信息流
产品 钛媒体 · Chelsea_Sun 2026-08-31 07:18 🔥 热度 5

StartLux 27B 本地模型在中国官方智能体基准测试中排名第二,关键任务媲美更大模型

StartLux 27B本地模型登中国Agent官方评测榜第二

原文:27B Local Model From StartLux Ranks Second in Official Chinese Agent Benchmark, Matching Larger Rivals on Key Tasks

NextFin 新闻——一款小型本地模型在中国官方智能体性能评测中取得了优异成绩。由上海远店星汇科技(StartLux)开发的 StartLux-V1.0-27B-Preview 综合得分 39.25,在中国信通院人工智能研究所发布的可信AI大模型基准 MCP 专项测试中总体排名第二,多家科技媒体对此均有报道。本次评测涵盖六项专项任务——位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理和3D设计,另有一项综合评估。评测考察了多工具协调、复杂任务执行以及与真实环境的交互,部分基于开源 MCP-Universe 框架。据报告中列出的对比模型包括 DeepSeek-V4-Pro(1.6万亿参数)、DeepSeek-V4-Flash-0731(2840亿参数)、Step-3.7-Flash(1980亿参数)、同尺寸的 Qwen-3.6-27B,以及一个被识别为 AgentCPM-Explore 的40亿参数模型。据相关转述报道,StartLux 的270亿参数模型排名超过了2840亿参数的 DeepSeek Flash 模型和1980亿参数的 Step 模型,比 Qwen-3.6-27B 高出5.34分。在单项类别中,该模型在位置导航上排名第一,在浏览器自动化和金融分析方面与规模大得多的 DeepSeek-V4-Pro 持平或领先。StartLux 表示,该模型基于 Qwen3.6-27B 底座并进行了针对性后训练。公司称这一过程依赖于“AI训练AI”即 Auto Research 循环,系统自行设计实验、评估结果并迭代优化策略。公司将这款 27B 预览版定位为首个以这种方式训练的国产本地智能体模型。该模型设计可在消费级设备上运行

查看原文 ↗ Agent

📌 相关阅读

模型 再强也救不了 Agent:语义和记忆才是真正的瓶颈| AI Agent| AI 大模型 |Agent 记忆 热度 8 从单Agent到Multi-Agent:企业级智能体的7层核心能力一次讲透!| AI大模型 |Agent| AI |项目实战| 热度 8 GLM 5.3 和 GLM 5.3 Flash 在 RTX PRO 6000 WS 上本地运行,用 BlenderMCP 建了一座顶层豪华公寓 热度 7 千问创作上线Agent Teams,覆盖专业视频制作场景 热度 7 AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验 热度 7