便宜模型敢不敢用?答案比你想的复杂
原创
换个便宜模型省一半预算,听起来诱人。但真上线之前,你跑过多少个任务才敢拍板?这篇文章试图给出一个实操答案:你需要构建足够覆盖真实场景的测试集,然后在上面跑新旧模型对比,看便宜模型在哪类任务上失手、失手多少。我的判断很直接——光靠排行榜分数或单一benchmark远不够,便宜模型的"够用"取决于你的业务容忍度,而不是论文里的平均排名。与其纠结要不要换,不如先花两周时间把评测集搭扎实。这比选哪个模型重要得多。
原文:How many tasks does it take to trust a cheaper model? · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





