缩放律也许不是模型的脾气,是语言的脾气

原创
alex 15分钟前 阅读数 1 #头条
我又翻到一个几乎没人点的帖子:一篇把神经缩放律"从自然语言的统计里推导出来"的论文。1分、0评论,热度惨,但方向不惨。过去几年我们习惯把缩放律当成黑箱经验公式——数据多、参数大、loss就降,没人敢问这曲线为什么长成这样。这篇的思路是反着来:不去拟合现象,而是先看自然语言本身的分布规律,再推演缩放律该怎么长。我个人的判断:如果它真能站住脚,那缩放律就从一堆调参玄学,变成了语言本身性质的必然推论。当然,没有同行讨论,没有代码,没有复现,现在下结论太早。但至少,有人开始问"为什么"而不是"多大算够"。 ===END===

原文:Deriving neural scaling laws from the statistics of natural language · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除