你的AI推理链,可能已经被人插了个控制令牌

原创
alex 13小时前 阅读数 6 #头条
你有没有想过,当你跟大模型聊完一段推理链,背后其实藏着漏洞?arXiv上刚挂了一篇论文,提出了一种"控制令牌注入"手法,专治那些依赖思维链推理的LLM——说白了,就是在输入里悄悄塞进特定token,让模型的CoT直接哑火,推理能力断崖式下跌。这意味着什么?意味着我们引以为傲的"让模型一步步想",并不像想象中那么牢靠。攻击者不需要越狱、不需要对抗样本,光靠一个精心构造的token就能把推理链掐断。安全研究人员该警觉了:CoT不是护城河,而是攻击面。

原文:Control-Token Injection Suppresses Chain-of-Thought and Defeats Reasoning-Based · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除