让大模型实时玩“胆小鬼”博弈:没有奖励矩阵,它们会先让道吗?

原创
alex 33分钟前 阅读数 1 #头条
我最近撞见一个挺有意思的活儿。研究者把大模型扔进了一个实时的“胆小鬼博弈”沙盘。没有明确的奖励矩阵,还要算上网络延迟,它们怎么决定是猛冲还是转向?更夸张的是,它们甚至能互相通气。每个模型都在独立的循环里紧盯着速度和撞击倒计时。我的判断很明确:这种脱离传统强化学习固定奖励的玩法,才是真正拷问大模型动态决策能力的试金石。与其让它们死记硬背剧本,不如直接把方向盘交出去,看看在生死攸关的毫秒间,算法究竟做出了什么样的博弈选择。

原文:Show HN: LLMs Play Chicken in Realtime · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除