小模型训练只要一天,问题才刚开始

原创
alex 5小时前 阅读数 3 #头条
假设你造出了一个不到500万参数的模型,能在低端CPU上一两天内训练完成——然后呢?这就是我在Hacker News上看到的讨论。 Google说得很直白:训练一个1亿参数的Transformer,在慢CPU上需要数周到一年。如果你的小模型只要几小时,听起来像是一场不对称的胜利。但代价是,它缺乏百科全书式的知识广度。 你可以塞入精心策划的科学知识,这没问题。但面对现实世界的复杂查询时,小模型的边界立刻暴露。 我的判断是:小模型在特定领域或许能击败巨头,但作为一个通用助手,它几乎没有竞争力。训练效率的提升,如果不能转化为更广泛的能力,那只是一个技术上的胜利,而非产品上的突破。

原文:Assume you've built sub-5-millon parameter competitor to Astra, so? · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除