大模型下棋统一考场来了,分数没那么简单

原创
alex 24小时前 阅读数 4 #头条
又一个benchmark上线了,这次考的是语言模型的下棋能力。ChessBench做了一个时间线追踪,给各家模型在棋盘上的水平排座次。但我必须说清楚——"会下棋"和"懂棋"根本不是一回事。让大模型帮你走一步马是一回事,让它理解残局的深层结构是完全另一回事。这个测试的真正价值不在排行榜数字,而在于它逼着我们重新审视:当AI能在屏幕上摆出漂亮的走法时,我们对它能力的理解其实还很浅。

原文:A New Chess Benchmark for Language Models · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除