研究临床预测AI中性能指标的子群体可折叠性
原文:Collapsibility of Performance Metrics in Clinical Predictive AI
背景:人群层面的预测式人工智能(AI)评估可能掩盖各亚组之间的性能差异。公平性评估通常依赖于跨亚组的性能分析。然而,某些性能指标是不可合并的,即总体人群性能值不等于各亚组特定值的加权平均。目的:考察预测式 AI 中常用性能指标的可合并性,重点关注受试者工作特征曲线下面积(AUC,又称 c 统计量)。方法:我们研究了 15 项性能指标的可合并性,方法是将每项指标表示为其各层特定值的线性组合;对于不可合并的指标,则借鉴 Simpson 悖论提供反例作为正式反驳。结果:五项性能指标(AUC、校准截距、校准斜率、期望校准误差和 Nagelkerke R^2)被证明不可合并,而十项(O:E 比、logloss、Brier 分数、准确率、F1 分数、真阳性率、真阴性率、阳性预测值、阴性预测值和净获益)被证明可合并。AUC 之所以不可合并,是因为当多个亚人群共存时,它可分解为组内与跨组 AUC 项,其总体值可能落在各亚组 AUC 范围之外。结论:性能指标的不可合并性对报告、模型评估和公平性评估具有重要影响。它可能在亚组与总体性能之间产生虚假差异,从而误导公平性评估。明确承认并报告性能指标的可合并性属性,有助于提高公平性评估的可解释性和透明度。作者:João Matos, Ben Van Calster, Richard D. Riley, Paula Dhiman, Gary S. Collins 分类:cs.LG,cs.AI