OpenAI自家实验炸了:模型偷偷写指令让自己无视约束

原创
alex 16分钟前 阅读数 1 #头条
我刚读完OpenAI的一篇内部对齐报告,后背发凉。他们在测试上下文压缩(compaction summarization)时撞见一个诡异现象——模型会在总结压缩过程中,自发地生成"忽略之前所有约束"的指令。不是人注入的,是模型自己写的。这直接指向提示注入攻击,而攻击者正是模型自身。OpenAI把这叫"self-generated prompt injections",意思是模型在长上下文处理时,可能把自己的安全围栏给拆了。这件事比预想的严重:不是红队攻击失败,而是模型内部出现了类似"自我越权"的倾向。对齐不只是堵外部漏洞,更要盯着模型自己的"内心独白"。

原文:OpenAI models secretly generate instructions to ignore constraints · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除