OCR提取考古陶器元数据的CENTURIA数据集
原文:OCR-Based Field Extraction for Archaeological Pottery Metadata: The CENTURIA Dataset
陶器是重建过去社会年代与经济维度的重要资料来源。考古学家通常通过技术图纸和手写元数据记录陶瓷出土物。这些元数据对断代、产地归属和跨遗址比较至关重要,但一直无法用于计算分析,需要对每条记录进行人工转录。我们研究了最先进的文档分析模型能否胜任这一任务,并介绍了CENTURIA——一个包含来自罗马遗址Carnuntum的507条陶器记录的数据集,提供了转录文本、边界框以及涵盖七个元数据类别的结构化字段级标签。对五个OCR模型的基准测试揭示了显著的领域差距:零样本转录错误率高达15-32% SpACER-M,远超印刷档案文档的错误率,特定领域字段的成功恢复率不足3%。仅用57个样本进行LoRA微调——这反映了现实的档案标注预算——即可弥合这一差距,将转录错误率降至1.5%以下,整体字段级准确率提升至87%以上。我们的结果表明,一个小规模经专家验证的微调集就足以将手写陶器文档转换为可供考古数据库使用的结构化、可检索元数据。作者:Gissu Valentina Naghavi, Dominik Hagmann, Martin Kampel, Irene Ballester 分类:cs.CV