陈大年复出创业,27B模型首秀逼近DeepSeek旗舰
陈大年复出,入局大模型
首秀逼近DeepSeek万亿旗舰
鹭羽 发自 凹非寺
量子位 | 公众号 QbitAI
不得了!国产大模型第一梯队,最近爆了个冷门。
一家新公司,首款模型只有27B,却在信通院MCP专项测试中拿下综合第二。
排在它前面的,是梁文锋藏了近一年的大杀器——参数量高达1.6万亿的DeepSeek-V4-Pro。
两者差距,只区区1.3个百分点。
这匹黑马就是StartLux-V1.0-27B-Preview,来自StartLux(原点星辉)。
有点面生是吧?别急,它的创始人兼CEO可是老熟人:陈大年。
AKA互联网时期的初代程序员「教父」,战绩可查:
盛大网络联合创始人、连尚网络掌门人,中国最早引入“共享软件”概念的编程者……
退隐十年再度归来,这一次,他把赌注押在了本地模型上。
这就不得不提陈大年最近一次的罕见露面。
他在盛大创新院18周年老友聚会上公开喊话,“AI时代有八条非共识”,其中四条都在强调本地模型。
本地模型会完全摧毁云端市场,3年时间打平Claude,占据80%的市场。模型拼参数的玩法要OUT了……
StartLux就是他理念的最好展现。
公司业务没随行业大流,专注小而美的本地模型商业化,它也是全球第一家真正意义上的本地模型公司。
而作为第一张面向市场的成绩单,StartLux-V1.0-27B-Preview不依赖云端,可直接运行在消费级PC上。
也就是说,这个小了近60倍的本地模型,Agent能力却能够追平万亿级云端旗舰。
凭什么?
27B对上1.6T,小模型打出大结果
在谜底揭晓之前,咱们不妨先来看看这次对标的是谁。
常言道,没人会记得第二名,除非第一是DeepSeek。
更何况,差距只有毫厘之间,非常值得说道说道。
成绩出自权威机构,中国信通院的可信AI大模型基准测试MCP专项,其围绕真实应用场景设置六类任务:
位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计。
再加一项综合评估,重点考察Agent多工具协同、复杂任务执行和真实环境交互。
简单来说,MCP-Universe不看模型回答得好不好,看的是事情究竟能不能做出来。这也是判断Agent好坏最本质的地方。
结果显示,StartLux-V1.0-27B-Preview综合得分39.25%,排名第二。
超过284B参数的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash,仅落后DeepSeek-V4-Pro 1.3个百分点。
同为27B参数规模,StartLux也比Qwen 3.6要高出5.34个百分点。
单项成绩也很能打,位置导航、金融分析和浏览器自动化均位列第一,其余细分项也同样名列前茅。
除去数据,咱们再来看两场实战。
第一道题,是一笔跨越两年的微软股票投资,同题PK的是Claude Sonnet 4.6。
Prompt:如果在2023年1月9日往微软投入25000美元,一直持有到2025年1月8日收盘,最终价值和总收益率分别是多少?
Claude的答案是:47254美元、89.02%。
而StartLux则给出:47499.09美元、90.00%。
看起来似乎差不多?但金融行业差之毫厘失之千里。
仔细看两个模型的思考过程,由于原始数据缺失,Claude Sonnet 4.6直接把2025年1月8日误判为非交易日,计算的是前一天的收盘价。
同样的情况下,StartLux分别回查当初数据,再验证目标日期附近的行情,确认准确收盘价后,才完成计算并生成可视化。
最终StartLux得出的结论才是正确的、可复核可追溯的。
第二道题则更直观,让两个模型同时帮忙在浏览器上查询机票。
Prompt:浏览器打开Google Flights,找一班从新加坡飞北京的单程航班,5天后出发,我要最便宜的直飞经济舱,而且不要落在大兴机场。只看价格,任务结束后关闭浏览器。
其中,StartLux-V1.0-27B-Preview用时约95秒完成搜索,找到了价格为299美元的国航机票。
反观Claude Sonnet 4.6在日期选择、弹窗关闭和筛选菜单之间经历了更多截图确认,还一度误触时间筛选面板。
两百多秒后,它给出的最低报价是556美元。价格更高,搜索时间还是StartLux的两倍。
尤其是在操作路径上,StartLux要简洁得多,全程只用了12步,而Sonnet足足用了21步。
这足以说明,在Agent任务上,参数规模已然不是唯一的决定性变量。
新的变量,是后训练。
参数做减法,能力不打折
StartLux-V1.0-27B-Preview并非从零开始训练。
其实它也是以Qwen3.6-27B为基座的,最终测试分数却要比Qwen高不少,原因就藏在任务数据和自动化后训练方法里。
简单来说,StartLux训练的是一个更会干活的Agent,训练数据重点强化任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等能力。
模型要学会的不只是给出最终文本,还包括什么时候调用哪个工具、工具返回异常后如何调整,以及什么情况下才能宣布任务完成。
接着后训练将这个过程推得更远。
团队自主研发出一套全新的多维度、可验证、可规模化的模型迭代优化技术,其中采用AI训练AI(Auto Research)的方法,让模型能在真实工具环境中自主执行任务,再根据环境反馈持续调整策略。
比如前文提到的金融分析案例,其中的回查修正,以及浏览器任务里的约束识别和路径选择,正是这种后训练最直观的体现。
据官方介绍,StartLux-V1.0-27B-Preview也是国内首个采用Auto Research方式完成后训练的本地Agent模型。
诚然,这并不意味着Scaling Law失效了。
大参数云端模型仍然是当下的主流选择,但StartLux也给出了清晰的信号:这并非唯一通解。
用陈大年的话来说:
Scaling Law是“过路神仙”,没有它,AI起不来。但它只是从AI的发展路径上路过,未来不一定属于它。
行业同样也意识到了这个问题,目前大模型技术路径正呈现出显著分野的趋势:
一边是“大力出奇迹”的忠实信徒,参数从百亿卷到千亿,再卷到万亿,训练成本也跟着指数级攀升;
另一边是以Harness为代表的Agentic评估体系迅速走红,越来越多专家学者开始明确“少即是多”。
化用王阳明的说法,知行合一,更高质量的行动才是关键。StartLux为模型做减法提供了又一例证。
这也可以解释StartLux为什么坚持本地模型。
模型一旦进入PC,对于长时任务,其成本结构可以从持续累积的云端Token费用,转化为更可控的设备算力和电力消耗,同时模型也能更好地理解用户的长上下文,实现更个性化的目标。
不止StartLux,Meta、Google、NVIDIA最近也在加码本地小模型方向。
不过这些大多还都停留在实验阶段或偏向极客,以本地模型产品化为主的,目前只此一家。
StartLux也表示,后续它们将稳步推进自有基模训练,探究扩散式语言模型等新架构,总之路线对了,那就未来可期。
StartLux接棒本地模型
既然这是一条非共识的路线,掌舵的就需要两种人:敢下注的和能做出来的。
StartLux的明星天团恰是如此,企业家+科学家强强联合。
CEO陈大年此前已经简单介绍过了,是连续创业者也是中国初代程序员,跟张小龙、雷军同期成名,创业时间跟马云、马化腾同代。
他是中国最早引入“共享软件”概念的人,和二哥陈天桥一起创办盛大网络以及互联网创新摇篮之一的盛大创新院,国民级产品“WiFi万能钥匙”也是由他一手孵化。
可以说,他对中国市场的用户和产品了如指掌,本地模型也算他的舒适区。
负责把技术路线落地的,是StartLux联合创始人兼CTO郭权玮。
郭权玮拥有国立阳明交通大学计算机科学与工程博士学位,研究方向覆盖本地部署大模型、Agentic AI、AI for Science、AI for Finance和隐私保护机器学习等领域。
加入StartLux前,他曾任AI科学公司幻量科技首席算法科学家,更早之前在台湾工业技术研究院从事数据隐私、数据去标识化和隐私保护机器学习研发。
他还是2024年TAAI最佳论文奖获得者,并以第一发明人身份拥有数据隐私相关发明专利。
而StartLux另一位联合创始人罗永祥,则是前摩根士丹利亚洲董事总经理。
陈大年懂产品和用户,郭权玮长期研究本地模型、Agent和数据隐私,罗永祥负责市场和投融资。这套组合高度适配StartLux,也将助力StartLux长线发展。
至于团队最终想交付的,也不只是一份模型权重。
在StartLux的构想中,本地智能解决方案应该像安装Office一样,一键完成部署。用户不需要理解量化、显存配置和推理框架,也不用自己反复调优。
所以目前,团队计划面向企业和个人用户,在年内推出第一代本地智能解决方案。
这样看来,StartLux的横空出世绝非“又多了一个玩家”那么简单。
它也代表着,继DeepSeek、Kimi等云端模型公司涌现之后,国产本地模型也开始陆续补位。
从智能时代的后起之秀又兜兜转转回到互联网时代的初代程序员,模型基本范式在换挡,但始终有中国公司在接力往前跑。
官网链接:https://startlux.com/
世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!2026-09-03
杭州95后小伙,5亿买走硅谷城堡2026-08-16
114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型2026-08-05
米哈游蔡浩宇AI创业生变2026-07-31