YOLO姿态估计结合CLIP实现实时视频异常检测
原文:Real-Time Video Anomaly Detection Using YOLO Pose Estimation and CLIP-Based Semantic Scoring
我们提出了一种轻量级的两阶段实时视频异常检测框架。第一阶段使用 YOLO v11n-pode 在单次前向传播中检测行人并提取十七个骨骼关键点。第二阶段通过 CLIP ViT-B/32 对每个裁剪出的行人区域进行编码,并计算其与预定义异常行为文本描述之间的余弦相似度。该架构无需光流、独立的姿态估计器和基于密度的评分模块。在 CUHK Avenue、ShanghaiTech Campus 以及在朱拉隆功大学采集的自建室内数据集上的实验表明,该框架在 NVIDIA Titan XP GPU 上的端到端吞吐量约为 51 FPS,相比多特征基线实现 3.36 倍加速,同时分别保持 89.26%、70.26% 和 84.13% 的帧级 AUROC。作者:Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang, Supavadee Aramvith。分类:cs.CV,cs.AI,eess.IV