国产Lux-27B端侧模型对标DeepSeek获信通院测试
原文:Domestic Dark Horse Local Large Model StartLux-27B Faces DeepSeek Head-On, Pioneering a New Era of Edge AI
中国信息通信研究院人工智能研究所近日发布的测试报告显示,上海元典星光电科技有限公司开发的本地大模型StartLux-V1.0-27B-Preview在可信AI大模型基准测试(MCP专项测试)中表现突出。该模型凭借27B参数在综合性能上排名第二,超越DeepSeek-V4-Flash,其能力正式进入以DeepSeek-V4-Pro为代表的万亿参数模型能力区间。此次MCP专项测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理和3D设计六大专项任务及综合评估,重点考察大模型在多工具协作、复杂任务执行和真实场景交互方面的综合表现。测试结果显示,StartLux-V1.0-27B-Preview综合得分39.25,超过了参数量284B的DeepSeek-V4-Flash-0731和参数量198B的Step-3.7-Flash。在同等参数规模下,其得分比Qwen-3.6-27B高出5.34个百分点。在单项任务中,该模型在位置导航上排名第一,并在浏览器自动化和金融分析任务上与1.6T参数的DeepSeek-V4-Pro持平或领先。这一突破源于技术创新。StartLux基于Qwen3.6-27B进行了后训练定向增强,团队自主设计了全新的、多维度的、可验证且可扩展的模型优化升级技术。训练过程中,团队采用“AI训练AI”(Auto Research)方法自主开展训练实验,并通过反馈不断优化策略,成为国内首个采用该方法进行后训练的本地Agent模型。这一进展折射出行业的深刻转变:当行业天花板