路由粒度降到token级,大模型推理还能再省多少?
原创
大模型推理成本居高不下,但真正吃紧的往往不是整个请求,而是其中某些token。TokenRouter把路由粒度从请求级压到了token级——同一句话里,简单token交给小模型,难token才动大模型。这思路不新鲜,但做成一套完整的serving engine跑进生产环境,我还是第一次看到有人认真做。项目页上它需要实时判断每个token的难度再分发,延迟控制复杂度陡增。问题是,省下的推理费用,会不会被额外的调度开销吃回去?
原文:TokenRouter: A serving engine for token-level LLM routing · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123




