AI 模型被偷偷削弱了?这个开源项目想抓现行
原创
你有没有怀疑过,自己常用的大模型在悄悄变笨?Livenerf 这个开源项目想回答这个问题——它是个专门检测 Claude Opus 5.5 是否被"nerf"的基准测试。说白了,AI 厂商发新版模型的时候,有没有偷偷把性能调低?你怎么知道?现在有个 GitHub 仓库试图量化这个判断。我觉得这个思路挺大胆,但靠一个人的项目很难让 Anthropic 服气。不过话说回来,这种"逆向检测"本身就是社区对 AI 厂商的一种监督——哪怕结论不完美,提问本身就有意义。
原文:Show HN: Livenerf – a benchmark for whether Opus 5.5 gets nerfed · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123



