开源LLM部署终于敢"关机睡觉"了?
原创
用AWS跑开源大模型,是不是总得留着一台机器随时待命?这个叫veloxml-deploy的项目试图打破这个惯性——scale-to-zero,不用的时候缩到零,不花一分钱。说实话,这类项目我看过不少,真正让人在意的从来不是"能不能跑起来",而是"能不能跑得起"。GPU实例按小时计费,闲置就是烧钱,哪怕你是开源模型的忠实拥趸,账单也不会因为你用Apache 2.0就打折。scale-to-zero听起来简单,落地却处处是坑:冷启动延迟、模型加载时间、突发流量下的并发扛不住。1个点、1条评论的Show HN,说明社区还没被说服。但方向没错——让"自托管"不再是"自掏腰包待命",这才是开源LLM该有的姿势。
原文:Show HN: Self-host open-source LLMs on AWS with scale-to-zero · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123




