提示注入能自我繁殖了,AI对齐的堤坝还撑得住吗?
原创
你有没有想过,一段恶意提示不仅能骗过一次模型,还能像病毒一样把自己复制进其他系统?OpenAI 刚刚证实了这件事——自复制提示注入已经存在。这不是理论推演,是实测报告。换句话说,攻击者不需要反复投毒,一次写入就可能形成链条式扩散。这让我对当前主流大模型的安全边界产生了一个很实在的怀疑:我们花大力气做的对齐,在一个会自我传播的攻击面前,究竟能撑多久?答案恐怕比多数人想象的更紧迫。
原文:Self-replicating prompt injections exist · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





