← 返回信息流
论文 arXiv 论文 · Omar Sharif, Soroush Vosoughi, Nikhil Singh 2026-08-31 16:35 🔥 热度 3

用可学习的查询改进信息抽取

用学习型查询改进信息抽取效果

原文:Improving Information Extraction with Learned Queries

当信息抽取失败时,人们的本能反应是改进执行抽取的模型:例如扩大模型规模或优化其推理。在本文中,我们表明流水线中的另一个环节同样重要甚至更重要:用于引出信息的查询。在四个临床基准和五个LLM上,仅改进问题设计就能将性能提高18.6个F1分值,超过使用更大的抽取模型所带来的提升。为使这种问题设计可学习,我们提出List of Questions(LoQ),用于生成针对特定文档的问题集合,以及FeedQ,一种反馈驱动的优化方法,根据抽取结果迭代改进问题。优化后的问题可用于训练轻量级生成器:经过微调后,4B参数模型可达到甚至超越专家设计基线,并大幅超越规模大得多的未调优模型。我们发布了包含12,820条优化问题的数据集,以推动信息抽取研究将问题设计视为一等公民问题的更广泛转变。

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 9 LLM量化损伤的结构:为何应将额外比特全局分配 热度 9 揭开人类丝滑变道的秘密,计算神经科学新成果绘出三大脑区连续决策地图 热度 8 BenchMIRT:LLM 基准测试到底在测什么? 热度 8