AI评测的终极困境:你的测试集能防泄露吗?

原创
alex 2分钟前 阅读数 1 #头条
我在博士论文里藏了一套AI评测基准,学校约束下没法公开。这让我忍不住想问:其他人有没有类似的"隐藏考场"?更现实的问题是——测试集一旦摊开讨论,它还会不会值钱?不会。但反过来,如果一套考题能永远不被泄露,它才叫合格的评测吧?我怀疑不存在这种完美的东西。数据可以被训练、被逆向、被记忆。唯一可行的路或许是不断迭代,让评测永远跑在被测模型前面。可这需要无穷的成本。所以"不可破解的基准"大概是个伪命题——只是我们暂时还没找到替代方案而已。

原文:Ask HN: What are other "uncrackable benchmarks"? · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除