合成数据可注入隐蔽目标偏差威胁LLM安全
原文:Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text
合成数据被越来越多地用于训练大语言模型(LLM),但其安全影响仍鲜为人知。此前关于潜意识学习的研究表明,模型可以从看似无关的训练数据中继承行为特征。在这项工作中,我们探究了是否可以通过语义良性的合成数据利用此类机制,向已对齐的模型中注入定向社会偏见。我们构建了一条流水线:由一个未对齐的教师模型生成跨创意写作、代码生成等多个领域的经过过滤的合成数据集,然后用这些数据微调已对齐的学生模型。实验表明,看似良性的合成数据可以作为传递定向偏见的隐蔽通道,同时在很大程度上保留学生模型的通用任务能力。这些结果揭示了合成数据驱动的 LLM 训练流水线中一个此前未被充分探索的安全风险,并凸显了改进防护措施的必要性。作为迈向这一目标的一种可能步骤,我们建议基于对数线性度的评分方法或许可为筛选看似良性的合成数据提供有用信号。