← 返回信息流
论文 arXiv 论文 · Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky 2026-08-31 16:45 🔥 热度 3

没有输出头的模型,却拥有万千思绪

提出无词表头新型解码架构降低LLM计算成本

原文:A Model with No Head and Many Thoughts

大型语言模型在解码时,每一步都要通过一个大型词表输出头(LM head)将隐藏状态投影到词表空间。这一操作计算成本高昂,并迫使所有推理都以离散 token 的形式表达。我们提出 Soft Latent Thinking,一种在推理阶段用轻量级投影器替代 LM head 的方法,使得自回归展开能够在嵌入空间中进行,推理步骤保持连续而非被 token 化。在 DeepSeek-Qwen-1.5B 和 LLaMA-3.2-3B 上的实验表明,Soft Latent Thinking 在所有 k 值下都能持续提升 pass@k,同时降低思维链推理过程中的每步计算量。我们的方法在所有软思维方法中取得了最高的 pass@32,证明有效的推理可以在连续空间中进行,而无需生成离散 token。作者:Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky。分类:cs.LG,cs.CL

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 9 LLM量化损伤的结构:为何应将额外比特全局分配 热度 9 揭开人类丝滑变道的秘密,计算神经科学新成果绘出三大脑区连续决策地图 热度 8 BenchMIRT:LLM 基准测试到底在测什么? 热度 8