Agentic CAD赛道第一次正面交锋,谁更像"干活的人"?
原创
把两个模型扔进一个真正的CAD代理环境里比,结果会有意思吗?PartForge这次干了件少有人干的事——不是跑数学题、不是写代码,而是让Sol 6和Opus 5.5在一个"agentic CAD harness"里实际操刀设计任务。有意思的是,这类评测之所以稀缺,是因为它测的不再是"知识量",而是"持续执行复杂决策链的能力"。从这篇短文看,两家各有胜负,但一个倾向已经暴露:纯靠预训练规模堆出来的模型,在需要长链条工具调用和空间推理的工业场景里,未必比针对性微调过的对手强多少。这大概也是AI落地工业软件最真实的门槛——不是多聪明,而是能不能把活儿干完。
原文:Sol 6 and Opus 5.5 compared on an agentic CAD harness · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





