物理基准塌了,AI评分还在刷——我们还在测对的东西吗?
原创
物理基准已经塌了,但前沿模型的分数还在涨。这篇博文把问题摆得很直接:如果测试集本身不可靠,我们凭什么说GPT-5在物理学上进步了?我的判断是,当前物理领域的前沿模型评估存在系统性偏差——很多benchmark要么题目有漏洞,要么被模型过拟合了,要么压根没测到物理直觉的核心能力。一个能解微积分不等于理解物理。当我们还在用旧尺子量新东西时,那些漂亮分数不过是幻觉的精确复现。真正该问的问题是:你的模型在没见过的物理场景里,还能不能做对?如果连问题都设错了,答案再漂亮也没意义。
原文:Is Physics Dead: Broken benchmarks and re-evaluating frontier models in physics · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





