J-lens从首Token解读LLM多Token概念的可解释性研究
原文:The First Token Is a Clue: Verbalizing Multi-Token Concepts from the J-lens
Jacobian Lens(J-lens)是一种近期出现的用于解释大语言模型的工具。它将隐藏状态读取为一个按排名排列的词表token列表,但多token概念在其中缺乏自己的表示。原始的J-lens工作用Template Lens来解决这一局限,即预先为一个固定短语词表计算向量;以及Oracle Lens,即微调模型组件来提出短语并重建短语向量。我们探究多token概念及其向量能否直接从J-lens和冻结模型中恢复。我们发现,多token概念的首个token的可读性与单token概念相当。给定正确的首token和源提示,冻结模型在两token情形中能以88.3%的比例恢复第二个token。我们证明,完整概念的向量可以在单次前向传播中从后续隐藏状态恢复。因此,我们用J-lens提出首token,并让冻结模型补全候选概念。然后我们为每个候选恢复向量,并将其与完整词表一起评分。在Gemma-3-12B-IT、Llama-3.1-8B和Qwen3-14B上的496个多跳完形填空任务中,我们的方法平均Rank@10达到43.1%,而Template Lens为27.6%。若没有J-lens线索,性能降至21.6%,表明首token线索能显著提升读取效果。使用恢复向量进行的因果概念交换实验平均succ@10达到61.4%,而Template Lens在相同干预下为26.2%。这些结果表明,首token线索可以引导多token概念恢复,而后续隐藏状态则为读取和干预提供了向量。作者:Xijie Gong, Tonghan Wang 分类:cs.CL