控制实验研究LLM规模对本体学习性能的影响
原文:When Does Bigger Help? A Controlled Study of LLM Scale for Ontology Learning
大语言模型(LLM)规模对本 体学习(OL)性能的影响仍未得到充分刻画。我们对 13 个模型进行了受控评估,涵盖来自 Qwen3.5 和 Qwen3.6 系列的稠密和混合专家(Mixture-of-Experts)变体,以及专有 GPT 发布版本,并使用 OntoLearner 检索增强生成流水线。所有模型在相同的嵌入模型、检索配置、提示模板、解码设置、数据集和指标下,针对四个生物医学和材料科学与工程本体,评估术语类型标注、分类体系发现和非分类关系抽取任务。在稠密的 Qwen3.5 系列内,增加参数量主要提升精确率而非召回率,最大增益出现在 9B 到 27B 参数之间。然而,规模的影响在任务和领域间既非单调也不一致。稠密 27B 模型在术语类型标注上大幅超越更大的稀疏模型,而更大的混合专家模型在分类体系发现上取得最强的开源权重结果。非分类关系抽取在各个模型规模下仍然困难,尤其是在 Materials Data Science 本体上。匹配的 Qwen 变体与专有 GPT 版本之间的性能差异进一步表明,架构和模型谱系的影响可能超过名义参数量。这些发现表明,仅凭模型规模不足以作为 OL 的选型标准,并为可复现的 LLM 辅助本体工程提供了实证指导。作者:Hamed Babaei Giglou, Sören Auer, Jennifer D'Souza 分类:cs.AI