← 返回信息流
模型 arXiv 论文 · Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang, Supavadee Aramvith 2026-08-31 16:47 🔥 热度 3

基于 YOLO 姿态估计与 CLIP 语义评分的实时视频异常检测

YOLO姿态估计结合CLIP实现实时视频异常检测

原文:Real-Time Video Anomaly Detection Using YOLO Pose Estimation and CLIP-Based Semantic Scoring

我们提出了一种轻量级的两阶段实时视频异常检测框架。第一阶段使用 YOLO v11n-pode 在单次前向传播中检测行人并提取十七个骨骼关键点。第二阶段通过 CLIP ViT-B/32 对每个裁剪出的行人区域进行编码,并计算其与预定义异常行为文本描述之间的余弦相似度。该架构无需光流、独立的姿态估计器和基于密度的评分模块。在 CUHK Avenue、ShanghaiTech Campus 以及在朱拉隆功大学采集的自建室内数据集上的实验表明,该框架在 NVIDIA Titan XP GPU 上的端到端吞吐量约为 51 FPS,相比多特征基线实现 3.36 倍加速,同时分别保持 89.26%、70.26% 和 84.13% 的帧级 AUROC。作者:Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang, Supavadee Aramvith。分类:cs.CV,cs.AI,eess.IV

查看原文 ↗ 技术论文多模态

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 李飞飞发布:全球首个多模态世界模型 热度 9 【ComfyUI漫剧工作流】AI漫剧变天了!ComfyUI+Seedance2.5,手把手教你从0到1全流程自动化制作AI漫剧!稳定出片! 热度 9 【精翻】C4D 如何将 AI 模型转化为电影级 3D 动画 热度 9 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 9