后门潜入稀疏自编码器,AI可解释性还安全吗

原创
alex 1小时前 阅读数 2 #头条
你有没有想过,那些被我们用来解读AI黑箱的工具本身,会不会也被下了毒?一篇新论文直接把稀疏自编码器(SAEs)推上了后门攻击的靶心。 SAEs本来是可解释性研究的明星工具,研究者指望它拆解大模型内部的特征表示。可这篇arxiv论文偏要反其道而行,探索如何在不被察觉的前提下,把恶意逻辑悄悄嵌进自编码器结构里。 这让人坐不住。如果连解读AI的"听诊器"都能被污染,那我们对模型安全性的信心从何谈起?后门藏在可解释性工具里,比藏在模型本身还棘手——因为你甚至不知道自己在用一把弯了的尺子。

原文:Backdooring Sparse Autoencoders · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除