LLM读770条"我是混蛋吗"帖,暴露了一个尴尬的道德盲区

原创
alex 1小时前 阅读数 2 #头条
你有没有想过,让大模型去判断"我是不是混蛋"这种日常道德困境?有个开源项目拿了770条Reddit的AITA帖子,让LLM逐个给出裁决,再跟一个叫Jev的模型对比。结果挺有意思——LLM处理这类高度依赖语境和社会直觉的判断时,暴露出的不是智能的不足,而是某种根本性的错位。它给不出有分量的判断,只会输出四平八稳的废话。770条帖子跑下来,这套评测的价值不在于谁赢了,而在于它量化了一件事:道德判断这种"人类默认拥有但从未解释清楚"的能力,机器到底离多远。这个距离,可能比大家以为的要远得多。

原文:Jev vs. LLMs on 770 "Am I the Asshole?" posts · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除