← 返回信息流
论文 arXiv 论文 · Gissu Valentina Naghavi, Dominik Hagmann, Martin Kampel, Irene Ballester 2026-08-31 11:26 🔥 热度 5

基于OCR的考古陶器元数据字段提取:CENTURIA数据集

OCR提取考古陶器元数据的CENTURIA数据集

原文:OCR-Based Field Extraction for Archaeological Pottery Metadata: The CENTURIA Dataset

陶器是重建过去社会年代与经济维度的重要资料来源。考古学家通常通过技术图纸和手写元数据记录陶瓷出土物。这些元数据对断代、产地归属和跨遗址比较至关重要,但一直无法用于计算分析,需要对每条记录进行人工转录。我们研究了最先进的文档分析模型能否胜任这一任务,并介绍了CENTURIA——一个包含来自罗马遗址Carnuntum的507条陶器记录的数据集,提供了转录文本、边界框以及涵盖七个元数据类别的结构化字段级标签。对五个OCR模型的基准测试揭示了显著的领域差距:零样本转录错误率高达15-32% SpACER-M,远超印刷档案文档的错误率,特定领域字段的成功恢复率不足3%。仅用57个样本进行LoRA微调——这反映了现实的档案标注预算——即可弥合这一差距,将转录错误率降至1.5%以下,整体字段级准确率提升至87%以上。我们的结果表明,一个小规模经专家验证的微调集就足以将手写陶器文档转换为可供考古数据库使用的结构化、可检索元数据。作者:Gissu Valentina Naghavi, Dominik Hagmann, Martin Kampel, Irene Ballester 分类:cs.CV

查看原文 ↗ 技术论文

📌 相关阅读

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 9 【中/英】 AI 时代,类型检查会变得更重要吗?🤔 热度 9