← 返回信息流
模型 AIbase 2026-09-01 08:00 🔥 热度 9

大模型没有秘籍:腾讯混元4如何靠开源生态与顶尖人才实现逆袭?

姚顺雨谈腾讯混元4:开源生态实现逆袭,大模型无秘籍

原文:Big Models Don't Have Secret Techniques: How Did Tencent Hunyuan 4 Achieve a Comeback Through Open Source Ecosystems and Top Talent?

大模型真的存在隐藏的技术壁垒吗?近日,从OpenAI转会腾讯的姚顺雨曾说:“做大模型没有真正的秘密。”起初人们以为这只是句玩笑话,但在腾讯混元4(Hy4 preview)近期公布成绩后,这句话的分量才显现出来。面对智谱、月之暗面、DeepSeek、Qwen等强劲对手,腾讯在四个月内完成了混元大语言与多模态部门的重组,并推出了参数规模达770B、支持百万级上下文的混元4。仔细审视其技术配置就会发现,所谓大模型的独家秘籍早已被开源机制和顶尖人才的快速流动彻底解构。从底层结构来看,混元4直接对齐了智谱GLM-5(744B)此前在700B中大尺度层面验证过的工程最优解。其主干网络隐藏维度为6144,共78层、64个注意力头,这决定了Transformer网络在深度、宽度和注意力并行结构上的统一选择。对于迫切需要突围的腾讯而言,站在前人验证过的共识基础上,避免了重复踩坑。在核心技术迁移方面,混元4在注意力模块上巧妙整合了多项开源成果。其主体借鉴了DeepSeek在V3.2中开源的稀疏注意力机制(DSA),使用轻量级索引器在超长上下文中筛选Top-K Token,从而避免扫描全部历史记录。随后,它还吸收了智谱团队在IndexCache中验证的跨层索引复用机制,让相邻的Transformer层直接复用已有的索引结果,将索引器计算量最多降低75%,实现了端到端的性能提升。此外,

查看原文 ↗ 观点声音大模型发布

📌 相关阅读

高盛等机构预计韩元有进一步上涨空间,AI热潮将带来资金流入 热度 9 韩国8月出口继续强劲增长,AI需求推动芯片热潮 热度 9 白宫科技主任:白宫 人工智能 战略内幕 热度 9 中信证券:AI液冷、测试设备、算力新技术、消费电子新品的主题热情有望升温 热度 9 让 AI 画图不再丑:她把设计品味写成规则文件,Claude/Codex都能装 热度 9