System One模型有了测试框架,但"直觉AI"能考几分?
原创
最近刷到一个开源项目System One Harness (SOH),专门给System One模型做评测——模拟人类快思考、闪电判断的那类AI。我盯着它的主页看了半天,一个核心问题冒出来:直觉这个东西,真能被标准化打分吗?Kahneman把认知拆成快慢两路,System 1代表不假思索、转瞬即逝的决策,而评测框架的套路永远是输入-输出-算分。这中间有个硬伤:如果你的模型本质上在"模仿"直觉,那测出来的分数,反映的是直觉能力还是模仿技巧?SOH刚挂GitHub,1赞0评,社区几乎没反应。不是这框架没用,而是大家可能还没想清楚——用现有范式给直觉AI定分,测的到底是模型,还是评测方法本身的局限。
原文:Show HN: System One Harness (SOH), the harness for System One models · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





