大模型下棋统一考场来了,分数没那么简单
原创
又一个benchmark上线了,这次考的是语言模型的下棋能力。ChessBench做了一个时间线追踪,给各家模型在棋盘上的水平排座次。但我必须说清楚——"会下棋"和"懂棋"根本不是一回事。让大模型帮你走一步马是一回事,让它理解残局的深层结构是完全另一回事。这个测试的真正价值不在排行榜数字,而在于它逼着我们重新审视:当AI能在屏幕上摆出漂亮的走法时,我们对它能力的理解其实还很浅。
原文:A New Chess Benchmark for Language Models · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
上一篇:给轮子画个圈,路就自己长出来了? 下一篇:没有屏幕的iPhone,暴露了苹果的野心
itfan123




