Murano开源框架:可组合管道做机制可解释性实验
原文:MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines
本文介绍了 Murano,一个用于设计、运行和复现大语言模型机制可解释性研究的开源框架,面向跨学科的研究人员。这类研究通常涉及加载、记录、归因、干预和评估等环节的组合,而现有库往往只关注该工作流的不同部分。因此,同时使用多个库的研究人员可能需要将一个库的输出适配后才能供另一个库使用。为弥合这一差距,Murano 将这五个领域的操作表示为可组合的步骤。步骤之间交换命名的结果工件,并声明各自所需的输入和产生的输出。流水线按给定顺序执行各步骤,当组件标识在操作之间传递时,Murano 使用规范化的地址。Murano 构建在现有的可解释性和机器学习库之上。我们通过复现两项已有的可解释性研究以及一个演示性的稀疏自编码器案例研究来展示 Murano 的能力。作者:Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang, Federico Tiblias, Jingcheng Niu 分类:cs.CL