← 返回信息流
论文 arXiv 论文 · Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang, Federico Tiblias, Jingcheng Niu 2026-08-31 12:02 🔥 热度 5

MURANO:将机制可解释性实验设计为可组合流水线进行设计、运行与复现

Murano开源框架:可组合管道做机制可解释性实验

原文:MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines

本文介绍了 Murano,一个用于设计、运行和复现大语言模型机制可解释性研究的开源框架,面向跨学科的研究人员。这类研究通常涉及加载、记录、归因、干预和评估等环节的组合,而现有库往往只关注该工作流的不同部分。因此,同时使用多个库的研究人员可能需要将一个库的输出适配后才能供另一个库使用。为弥合这一差距,Murano 将这五个领域的操作表示为可组合的步骤。步骤之间交换命名的结果工件,并声明各自所需的输入和产生的输出。流水线按给定顺序执行各步骤,当组件标识在操作之间传递时,Murano 使用规范化的地址。Murano 构建在现有的可解释性和机器学习库之上。我们通过复现两项已有的可解释性研究以及一个演示性的稀疏自编码器案例研究来展示 Murano 的能力。作者:Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang, Federico Tiblias, Jingcheng Niu 分类:cs.CL

查看原文 ↗ 开源项目技术论文

📌 相关阅读

【开源】Player-YN/PawWork_ZhuaZhua:Paw Work——面向 Chrome 的“先选中”网页代理 热度 10 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 9 [开源] ashutoshsinghpr7/wikiskill:Hermes Agent 的 WikiSkill(arXiv:2608.27454)——通过持久化知识维基实现自进化智能体技能 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 科大讯飞开源两款端侧通用大模型 热度 8