← 返回信息流
论文 arXiv 论文 · Md Mokarram Chowdhury, Ernie Chang, Yang Li 2026-08-31 11:03 🔥 热度 5

角色扮演越狱中的安全接力:伤害识别与拒答机制的组件级因果分析

分析角色扮演越狱中大模型安全机制与拒绝行为

原文:The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

大语言模型被训练为遵循指令,同时拒绝有害请求。越狱攻击正是利用这种平衡来诱导模型产出其通常会拒绝的内容。角色扮演越狱尤其令人担忧:有害请求在由人设、场景和任务构成的角色扮演包装中依然可见,但模型却可能顺从。我们利用机制可解释性来确定这种上下文如何逆转拒答行为,以及哪些要素促成了这一逆转。我们在两个基准、三个模型系列和四种自建包装上,比较有包装和无包装的配对有害与良性请求。我们追踪从请求到最终提示状态的隐藏状态差异,通过受控反事实隔离包装操作,在留出的评估请求上对其激活方向进行干预,并从几何角度分解有效方向。我们的分析得出三点发现:(1)成功的攻击在请求层面保留了可测量的有害与良性区分,但该拒答相关表达在回答开始处减弱,我们称之为“安全接力衰减”模式。(2)围绕请求构建完整角色扮演以及将其置于场景框架内具有因果作用:移除相关激活变化即可恢复拒答。(3)这些效应在很大程度上共享内部结构,且大部分修复可由与模型在无角色扮演时对有害请求的常规拒答方向一致的组件复现;场景框架保留了较小的、依赖模型的部分。综上,这些发现解释了角色扮演如何在保留伤害证据的情况下仍然产生顺从行为,并为未来安全防护指明了具体目标:维持从伤害识别到拒答的连接。作者:Md Mokarram Chowdhury, Ernie Chang, Yang Li 分类:cs.LG

查看原文 ↗ 技术论文其他

📌 相关阅读

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 10 A股三大指数集体收跌 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 再降价:箭牌 L6P 轻智能马桶 泡沫盾自动翻盖 AES1171-PL 400坑距 热度 9 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9