开源模型居然不配合搞攻击?这项测试颠覆了我的认知
原创
开放权重的AI模型,按理说应该是最"野"的那批——没有厂商兜底、安全过滤层层削减。但pentesttoday的一项测试却让我愣住:这些模型在面对攻击性网络任务时,表现出出人意料的合规性。不是意外好用,而是意外地"守规矩"。这让我开始怀疑,我们是不是被"开源=不安全"的叙事绑架太久了?也许对齐这件事,比想象中更难以被抹除。不管结论如何,把"开放"和"危险"画等号,恐怕已经过时了。
原文:Open weights models are surprisingly aligned on offensive cyber · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





