← 返回信息流
论文 Reddit-MachineLearning · /u/Glabmayt2075 2026-08-31 16:21 🔥 热度 6

你的 GNN 可能只是一个过度复杂的 MLP(表格数据泄露)。我们构建了 SynthFin-AML 来强制执行严格的因果边界

发现GNN反洗钱模型实为复杂MLP,存在表格数据泄露问题

原文:Your GNN is probably just an overcomplicated MLP (Tabular Leakage). We built SynthFin-AML to enforce strict causal boundaries. [P]

我们注意到反洗钱模型的表现好得可疑。在深入研究动态图上的标准基线后,我们发现消息传递中普遍存在时间泄露问题。如果你在动态图的静态快照上训练 GNN,模型很可能通过在训练时"看到"未来的边而作弊。我们受够了评审那些评估有缺陷的论文,因此发布了 SynthFin-AML v10.0(10万节点、120万条边),以强制执行严格的因果边界。时间泄露陷阱:标准的直推式随机划分在金融交易网络上根本行不通,因为它们违背了时间箭头。如果节点 A 在第2天向 B 转账,B 在第10天向 C 转账,标准的2跳 GNN 会把第10天的边拉入第2天的损失计算中。模型实际上是在窥探未来来计算嵌入。解决方案:3快照架构。为了阻止模型通过提前偷看交易图作弊,我们强制执行了严格的3快照时点划分:训练图(边 ≤ 第7天)、验证图(边 ≤ 第8天)、测试图(边 ≤ 第10天)。通过在物理上分离时间窗口,我们将 GNN 的感受野限制在真实的因果范围内。图 vs 表格的现实检验:大多数合成数据集存在分布泄露问题,即欺诈交易金额在统计上可与正常零售流量区分开。我们消除了"金额划分作弊",确保欺诈和零售交易金额共享完全相同的对数正态分布(μ=8.517,σ=0.8)。修复了表格泄露后,我们将调优过的 LightGBM 与 GraphSAGE 进行了对比,看看 GNN 的额外开销对反洗钱是否真的值得。我们为树模型设计了11个时点图特征(加权 PageRank、邻居交易量聚合等)。结果(严格时间划分下的 PR-AUC):LightGBM(11个特征):0.848;GraphSAGE(归纳式):0.881。剧透:除非你的边特征非常丰富,否则 GraphSAGE 在这里只是勉强胜过树模型。差距并非天文数字。

查看原文 ↗ 技术论文

📌 相关阅读

别再无脑卷 模型 参数了!JIT-Agent 告诉你:自适应 Harness 才是下一代 AI 的真正胜负手! 热度 9 网络数据基础设施如何驱动下一代AI 热度 9 CaaS的崛起:面向智能体AI的“上下文即服务”——Omer Primor,Bright Data 热度 8 AI 拿诺贝尔物理奖?详解Hinton与Hopfield|诺奖真正表彰的不是 大模型 热度 8 滑动窗口注意力在长上下文推理上胜过线性注意力 热度 6