← 返回信息流
论文 arXiv 论文 · Xijie Gong, Tonghan Wang 2026-08-31 16:56 🔥 热度 3

首Token即线索:从 J-lens 中解读多Token概念

J-lens从首Token解读LLM多Token概念的可解释性研究

原文:The First Token Is a Clue: Verbalizing Multi-Token Concepts from the J-lens

Jacobian Lens(J-lens)是一种近期出现的用于解释大语言模型的工具。它将隐藏状态读取为一个按排名排列的词表token列表,但多token概念在其中缺乏自己的表示。原始的J-lens工作用Template Lens来解决这一局限,即预先为一个固定短语词表计算向量;以及Oracle Lens,即微调模型组件来提出短语并重建短语向量。我们探究多token概念及其向量能否直接从J-lens和冻结模型中恢复。我们发现,多token概念的首个token的可读性与单token概念相当。给定正确的首token和源提示,冻结模型在两token情形中能以88.3%的比例恢复第二个token。我们证明,完整概念的向量可以在单次前向传播中从后续隐藏状态恢复。因此,我们用J-lens提出首token,并让冻结模型补全候选概念。然后我们为每个候选恢复向量,并将其与完整词表一起评分。在Gemma-3-12B-IT、Llama-3.1-8B和Qwen3-14B上的496个多跳完形填空任务中,我们的方法平均Rank@10达到43.1%,而Template Lens为27.6%。若没有J-lens线索,性能降至21.6%,表明首token线索能显著提升读取效果。使用恢复向量进行的因果概念交换实验平均succ@10达到61.4%,而Template Lens在相同干预下为26.2%。这些结果表明,首token线索可以引导多token概念恢复,而后续隐藏状态则为读取和干预提供了向量。作者:Xijie Gong, Tonghan Wang 分类:cs.CL

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 9 LLM量化损伤的结构:为何应将额外比特全局分配 热度 9 揭开人类丝滑变道的秘密,计算神经科学新成果绘出三大脑区连续决策地图 热度 8 BenchMIRT:LLM 基准测试到底在测什么? 热度 8