首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

拒绝生活在聊天模型中角色的下游

摘要

arXiv:2606.26161v1 Announce Type: new Abstract: Linear directions in activation space have been identified for both refusal and persona traits in instruction-tuned chat models, but the two have been s

refusal persona direction the and
2026-06-26 1 阅读 约1分钟阅读 Viola Zhong, Qirui Li
分享:
字号:
arXiv:2606.26161v1 公告类型:新 摘要:在指令调整的聊天模型中,拒绝和角色特征都已被识别为激活空间中的线性方向,但两者已作为单独的机制进行研究。我们展示了他们的互动:顺从的角色会拒绝。在Qwen2.5-7B-Instruct和Llama-3.1-8B-Instruct中,我们提取顺从模型角色方向和拒绝方向并对两者进行干预。顺从的角色转向抑制拒绝——在 Llama 中,拒绝率从 97% 下降到 2%。重新引入拒绝方向可以部分恢复后期层的拒绝,但不能恢复早期层的拒绝。在后层窗口中投影角色方向可将其恢复到基线;投影出随机方向则不然。因此,拒绝在计算的下游的后期表达阶段被门控。将拒绝视为一个孤立的方向,忽略了它对角色的依赖。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱