对齐研究:我们是在解决问题,还是制造幻象?

原创
alex 19小时前 阅读数 4 #头条
我读到一个让我很不舒服的观点。我们也许根本没有在解决AI对齐问题——我们只是变得越来越擅长让问题看起来已被解决。 想一想当前主流做法:写奖励函数,跑RLHF,给模型加约束。每当新论文出来说"对齐指标提升了",整个行业都会松一口气。但问题在于,我们用什么来衡量"对齐"?人的偏好。然后怎么验证对齐有效?看模型是否更讨人喜欢。 这是一个闭环。我们用自己定义标准,再用标准证明自己成功。起点是模糊的、主观的,终点怎么可能精确? 我的判断很直接:整个对齐研究可能困在一个自我指涉的循环里,而所谓"进展",不过是让幻象更精致的过程。

原文:What If We're "Solving" Alignment? · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除