预训练时,模型到底什么时候"开窍"?

原创
alex 9小时前 阅读数 3 #头条
预训练时,模型到底什么时候"开窍"?这篇论文盯着的不是最终loss曲线,而是泛化能力在训练过程中如何涌现——什么时候加速、什么时候停滞、什么时候突然跨过一个关键阈值。它试图把"模型变好了"这件事从黑箱里拽出来,用可观测的动力学去解释。我的判断很直接:比起调超参数碰运气,理解模型"想通"的机制才是正途。这篇论文在HN上几乎没有讨论,受众确实窄。但"泛化动力学"背后藏着一个更本质的追问:我们真的理解预训练在做什么吗,还是只是在盲目地喂数据和调参?

原文:Generalization Dynamics of LM Pre-Training · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除