← 返回信息流
模型 arXiv 论文 · Yuheng Zhang, Yizhao Wang, Da Zhu, Hua Zhou, Yue He 2026-08-31 10:42 🔥 热度 5

TuringLLM:高效扩展基础模型,迈向物理 AI

发布20B参数MoE模型Turing,面向物理AI

原文:TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI

我们推出 Turing-20B-A2B,一个 200 亿参数的混合专家(MoE)语言模型,每个 token 仅激活约 20 亿参数,专为长上下文和延迟敏感的物理 AI 应用而设计。该模型采用动态 top-k 配置的分位数路由(Quantile Routing),在保持专家利用均衡和受控平均计算预算的同时,实现按 token 自适应的专家分配。在部署阶段,我们进一步对提示预填充应用容量受限路由,以实现更规整、更高效的专家执行,同时在预训练期间保留无损路由。Turing-20B-A2B 还采用了混合注意力架构,将 Lightning Attention 与少量全注意力层相结合,实现高效的长上下文建模。模型通过渐进式三阶段课程进行预训练,并通过持续预训练扩展到 128K 的原生上下文长度,再借助 YaRN 在推理时进一步扩展至 512K。尽管激活参数预算紧凑,Turing-20B-A2B 在基础模型阶段实现的总体通用能力超越了 Qwen3-8B Base,并接近 Qwen3.5-9B Base,同时保持了出色的长上下文性能和良好的预填充延迟扩展性。这些结果表明,该模型在模型能力、长上下文可扩展性和实际推理效率之间实现了有效平衡。作者:Yuheng Zhang, Yizhao Wang, Da Zhu, Hua Zhou, Yue He 分类:cs.AI

查看原文 ↗ 大模型发布硬件算力

📌 相关阅读

GPT-6 热度 26 「GPT-6」灰测demo刷屏!周四发布在即 热度 16 国产黑马!腾讯混元HY4地狱测试,实测秒写操作系统与3D游戏,外国老哥看傻了! AI大模型 新猛将! 热度 9 129亿美元买下 AI 心脏,NVIDIA收购Hugging Face底层逻辑 热度 9 科大讯飞开源两款端侧通用大模型 热度 9