用学习型查询改进信息抽取效果
原文:Improving Information Extraction with Learned Queries
当信息抽取失败时,人们的本能反应是改进执行抽取的模型:例如扩大模型规模或优化其推理。在本文中,我们表明流水线中的另一个环节同样重要甚至更重要:用于引出信息的查询。在四个临床基准和五个LLM上,仅改进问题设计就能将性能提高18.6个F1分值,超过使用更大的抽取模型所带来的提升。为使这种问题设计可学习,我们提出List of Questions(LoQ),用于生成针对特定文档的问题集合,以及FeedQ,一种反馈驱动的优化方法,根据抽取结果迭代改进问题。优化后的问题可用于训练轻量级生成器:经过微调后,4B参数模型可达到甚至超越专家设计基线,并大幅超越规模大得多的未调优模型。我们发布了包含12,820条优化问题的数据集,以推动信息抽取研究将问题设计视为一等公民问题的更广泛转变。