← 返回信息流
模型 arXiv 论文 · Minkyung Cho, Jihyo Kim, SeungWoo Song, Junghun Yuk, Minjoon Kee 2026-08-31 11:28 🔥 热度 5

合成数据中的隐形威胁:通过良性文本进行的隐蔽定向偏见注入

合成数据可注入隐蔽目标偏差威胁LLM安全

原文:Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

合成数据被越来越多地用于训练大语言模型(LLM),但其安全影响仍鲜为人知。此前关于潜意识学习的研究表明,模型可以从看似无关的训练数据中继承行为特征。在这项工作中,我们探究了是否可以通过语义良性的合成数据利用此类机制,向已对齐的模型中注入定向社会偏见。我们构建了一条流水线:由一个未对齐的教师模型生成跨创意写作、代码生成等多个领域的经过过滤的合成数据集,然后用这些数据微调已对齐的学生模型。实验表明,看似良性的合成数据可以作为传递定向偏见的隐蔽通道,同时在很大程度上保留学生模型的通用任务能力。这些结果揭示了合成数据驱动的 LLM 训练流水线中一个此前未被充分探索的安全风险,并凸显了改进防护措施的必要性。作为迈向这一目标的一种可能步骤,我们建议基于对数线性度的评分方法或许可为筛选看似良性的合成数据提供有用信号。

查看原文 ↗ 技术论文大模型发布

📌 相关阅读

GPT-6 热度 24 「GPT-6」灰测demo刷屏!周四发布在即 热度 15 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 国产黑马!腾讯混元HY4地狱测试,实测秒写操作系统与3D游戏,外国老哥看傻了! AI大模型 新猛将! 热度 9