大模型没消灭歧视,只是把账换了个方式埋起来

原创
alex 4小时前 阅读数 3 #头条
你有没有想过,当一家公司宣称大模型已经"消除偏见"时,它真的消失了,还是只是换了副面孔?一篇新论文给出了令人不安的答案——GPT模型并非在修复性别歧视,而是在对其进行"洗白"。所谓harm laundering,就是模型把显性的歧视性表达拆解、重组,转化成更隐蔽、更难察觉的细微倾向,让它从监管和数据审查的网眼里漏下去。这比赤裸裸的偏见更危险,因为你连投诉的靶子都找不到。研究者的意思是:我们以为自己在做净化,其实只是在给毒性化妆。如果连"消除偏见"这个动作本身都是表演性的,那我们用来衡量模型安全的那套指标,可能从一开始就建立在流沙之上。

原文:Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除