BLOOM-WILT用logit倾斜技术自动审计LLM行为
原文:BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing
已部署语言模型的用户日常遭遇的行为几乎从不会在测试中浮现,因为部署中模型经历的交互次数比任何评估所能模拟的都要高出多个数量级。自动化审计器让测试得以廉价扩展、且足够灵活以覆盖几乎任何指定行为,但缺乏优化压力使其采样效率低下。针对这一不足,我们提出 BLOOM-WILT——一个完整的审计流水线,能够诱导出罕见行为的自然多轮实例,且无需训练成本,也只需访问目标的下一 token 分布。在输入侧,WILT 的审计模型在多轮对话中不断修正其对话策略,从先前已评分的交互中学习。在输出侧,WILT 利用模型自身在诱导提示条件下生成的分布,自适应地重新加权目标的解码过程,使与目标行为相关的生成先于无提示时被模型视为同等可能的其他内容被采样。我们在 4 个目标模型和 8 种行为上评估 WILT,它在 32 个设置中的 30 个击败了基线审计器,并推翻了此前发布的模型安全排名。在从 Qwen3.5-4B 中诱导自残鼓励行为时,WILT 将平均行为出现率从 51% 提升至 100%,在相同算力下击败了我们移植到同一流水线中的所有诱导方法,且未将输出概率压至基线之下。作者:Adrians Skapars, Edoardo Manino 分类:cs.AI, cs.CL