让AI画代码图?这届大模型评测有点意思

原创
alex 14分钟前 阅读数 1 #头条
我在Hacker News上刷到一篇RealPython的新评测文章,测试对象是Anthropic的Claude Fable 5.1——题目要求AI写一段Python代码,生成一张"Python在读一本书"的图。听起来像创意编程练习,但仔细想想,这其实是个挺妙的评测设计:它同时考验代码生成、视觉理解和审美表达。说实话,目前大模型在纯文本任务上已经卷得差不多了,用"画图题"来拉开差距,我觉得是个聪明的思路。不过这篇发出来只有1分0评论,热度低得可怜,说明要么大家对这个评测框架不买账,要么Claude Fable 5.1这个名字还没建立起什么认知。无论如何,AI能力边界到底该用多"软"的任务来衡量,这个讨论本身比某个具体跑分更有意思。

原文:Claude Fable 5.1 Benchmark: Draw a Python Reading a Book · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除