持续预训练使LLM适配瑞典新闻领域
原文:Reading the News: Adapting Large Language Models to Swedish Journalism Through Continued Pre-Training
大语言模型在通用任务上的能力日益增强,但在小众或研究不足的领域,其效用可能仍然有限。解决这一局限的一种方法是在目标领域语料上进行额外训练,使现有模型实现专门化。在这项工作中,我们研究了这种继续预训练方法,利用从数百万篇新闻文章中精心整理的高质量数据集,将大语言模型适配到瑞典语新闻领域。为评估适配效果,我们还构建了一个涵盖六项编辑任务的新型领域专用基准。通过在两种模型规模上进行全参数和参数高效微调,我们发现继续预训练在目标领域带来收益,但前提是必须配合经验回放来缓解遗忘。我们观察到模型生成质量和事实知识获得一致提升,但在判别式任务上的熟练度并无改善。在探索一种无需训练的指令遵循促进方法时,我们看到了进一步提升,但仅适用于采用低秩适配训练的模型。至关重要的是,我们证明了适配过程中针对性评估的重要性,因为现有的瑞典语基准在很大程度上无法捕捉模型在领域内的性能提升。作者:Lukas Borggren, Jenny Kunz, Marco Kuhlmann 分类:cs.CL,cs.AI,cs.LG