你以为找到的偏见方向,其实只是模型在装自信
原创
我一直以为大模型潜在空间里那些可被定位的"偏见方向"能帮我们精准修复公平性问题。但这篇论文直接捅破了泡泡:所谓的bias direction,捕捉的根本不是公平性,而是模型的置信度。换句话说,你沿着那个方向去修复偏见,可能只是在调整模型的自信程度,跟公平毫无关系。这让人不得不反思整个AI公平性研究的技术路径——我们是不是花了大量精力在错误的维度上做文章?如果连基础假设都是错的,那那些所谓的去偏见干预又有多少真实效果?
原文:Latent space bias directions in LLMs capture confidence, not fairness · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123






