← 返回信息流
行业 arXiv 论文 · João Matos, Ben Van Calster, Richard D. Riley, Paula Dhiman, Gary S. Collins 2026-08-31 10:43 🔥 热度 5

临床预测式 AI 中性能指标的可合并性问题

研究临床预测AI中性能指标的子群体可折叠性

原文:Collapsibility of Performance Metrics in Clinical Predictive AI

背景:人群层面的预测式人工智能(AI)评估可能掩盖各亚组之间的性能差异。公平性评估通常依赖于跨亚组的性能分析。然而,某些性能指标是不可合并的,即总体人群性能值不等于各亚组特定值的加权平均。目的:考察预测式 AI 中常用性能指标的可合并性,重点关注受试者工作特征曲线下面积(AUC,又称 c 统计量)。方法:我们研究了 15 项性能指标的可合并性,方法是将每项指标表示为其各层特定值的线性组合;对于不可合并的指标,则借鉴 Simpson 悖论提供反例作为正式反驳。结果:五项性能指标(AUC、校准截距、校准斜率、期望校准误差和 Nagelkerke R^2)被证明不可合并,而十项(O:E 比、logloss、Brier 分数、准确率、F1 分数、真阳性率、真阴性率、阳性预测值、阴性预测值和净获益)被证明可合并。AUC 之所以不可合并,是因为当多个亚人群共存时,它可分解为组内与跨组 AUC 项,其总体值可能落在各亚组 AUC 范围之外。结论:性能指标的不可合并性对报告、模型评估和公平性评估具有重要影响。它可能在亚组与总体性能之间产生虚假差异,从而误导公平性评估。明确承认并报告性能指标的可合并性属性,有助于提高公平性评估的可解释性和透明度。作者:João Matos, Ben Van Calster, Richard D. Riley, Paula Dhiman, Gary S. Collins 分类:cs.LG,cs.AI

查看原文 ↗ 技术论文政策监管

📌 相关阅读

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 10 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 10 苹果指控OpenAI“销毁证据”,称前工程师“带走机密并在OpenAI使用” 热度 9 《微短剧发展管理办法》今起正式施行 热度 9 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9