AI评测里藏了多少"坏标尺"?这份清单该让每个团队醒醒
原创
我最近翻Epoch AI的基准测试注册表,专门筛选"flawed"分类,越看越不安。这些已被标记有缺陷的评测指标,不少至今还被业界当作"金标准"使用。模型的推理能力、代码生成、多模态理解——这些方向的评分到底有几分可信?一个设计有漏洞的benchmark,不光会误导研究者对模型能力的判断,还会让训练目标从一开始就偏了航向。真正该警惕的不是这些缺陷本身,而是有多少团队压根没发现自己长期依赖的标尺,早就被证明不靠谱。
原文:Flawed benchmarks (epoch.ai benchmark registry filtered by flawed) · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123






