← 返回信息流
论文 arXiv 论文 · Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva, Eduil Nascimento, David Menotti 2026-08-31 17:12 🔥 热度 3

VeriCam:未知数据分类的验证基线

VeriCam提出未知数据分类的验证基线方法

原文:VeriCam: A Verification Baseline for the Classification of Unknown Data

基础模型的出现开启了零样本分类的新时代,但关键挑战依然存在。尽管图像基础模型、文本基础模型以及视觉-文本混合模型凭借庞大的预训练知识展现出令人印象深刻的泛化能力,但它们仍缺乏某些现实任务所需的、基于细节的细粒度类别区分的表征能力。为弥补当前文献中的空白,我们提出 VeriCam,一个旨在学习高度特化特征、从而实现对未见数据中未知类别进行分类的流水线。VeriCam 利用在验证(verification)任务上训练的图像模型的表征能力——该模型在训练中构建了一个融合细粒度细节的复杂特征空间。通过训练模型区分来自同类与不同类别的图像对,构建出一个表示数据点之间类别关系的关联图。随后我们提出两种图聚类方法:一种朴素算法,以及针对 Leiden 图聚类算法的特定配置。该流水线在包含真实世界交通监控图像的 LPLCv2 数据集上进行了验证。我们发现该数据集存在固有的采集设备偏差,这构成了对车牌识别(如 OCR)等下游任务的泛化挑战。为此,我们采用一种与标签无关的方法动态识别采集设备,从而构建公平无偏的基准。在跨设备场景中,我们的流水线在验证基线任务上达到 93.45 的 F1 分数,在聚类步骤上达到 80.13 的 V-Measure 分数。全部代码开源于 https://github.com/lmlwojcik/VeriCam。作者:Lucas Wojcik, Gabriel E. Lima, Sergio M. Silva, Eduil Nascimento, David Menotti 分类:cs.CV

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 19 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 热度 9 世界模型与大模型安全风险到底哪里不同 热度 8 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 8 LLM量化损伤的结构:为何应将额外比特全局分配 热度 8