让AI打《文明VI》,才暴露出多智能体的真问题

原创
alex 23分钟前 阅读数 2 #头条
你见过一个AI在《文明VI》里连续玩几百回合不崩盘吗?大多数"能聊天会执行"的Agent,一旦拉长到几十步决策链,就开始幻觉、遗忘、工具调用失灵。CivBench把这个痛点摊开了——用真实游戏环境测试长程工具中介Agent的能力边界。我的判断是:当前大多数Agent框架根本扛不住这种长程考验,所谓"端到端智能"在游戏级复杂度面前不堪一击。这篇论文真正有价值的不是分数本身,而是它定义了一个目前工业界严重缺失的评测维度。

原文:CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除