小米悄悄放出了一副"智能体"的训练沙盘
原创
小米MiMo团队在Hugging Face上挂出了一份叫MiMo-v2.6-RL-OSS的数据集,标注写的是"Agentic RL Environments"——说白了,就是一套给智能体做强化学习的环境配置包。一个1分、0评论的帖子,热度几乎为零。但我在想,真正有意思的地方恰恰在这里:大厂开始把RL环境的底层积木开源了,而不是只发模型权重。过去两年大家盯着参数规模卷得头破血流,可智能体能不能落地,卡点从来不在模型本身,而在"它能在什么环境里反复试错"。小米这步棋不大,方向却比堆参数实在。问题是,社区真的愿意接这盘棋吗?
原文:XiaomiMiMo / MiMo-v2.6-RL-OSS (Agentic RL Environments) · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





