提出无词表头新型解码架构降低LLM计算成本
原文:A Model with No Head and Many Thoughts
大型语言模型在解码时,每一步都要通过一个大型词表输出头(LM head)将隐藏状态投影到词表空间。这一操作计算成本高昂,并迫使所有推理都以离散 token 的形式表达。我们提出 Soft Latent Thinking,一种在推理阶段用轻量级投影器替代 LM head 的方法,使得自回归展开能够在嵌入空间中进行,推理步骤保持连续而非被 token 化。在 DeepSeek-Qwen-1.5B 和 LLaMA-3.2-3B 上的实验表明,Soft Latent Thinking 在所有 k 值下都能持续提升 pass@k,同时降低思维链推理过程中的每步计算量。我们的方法在所有软思维方法中取得了最高的 pass@32,证明有效的推理可以在连续空间中进行,而无需生成离散 token。作者:Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky。分类:cs.LG,cs.CL