469 tok/s:推理竞赛的战场已经转移了
原创
469 tok/s,我盯着这个数字看了很久。
DeepSeek Flash V4.1 的编码推理跑出了这个速度。不是云端,是一个 Show HN 项目的本地方案。
问题在于——这个速度到底意味着什么?
在编码场景下,模型吐完一整个函数从十几秒压到三秒以内,体验断层非常明显。你写代码时的等待感消失了,感觉更像模型在"接话"而不是"思考"。
但推理加速从来不免费,精度和速度之间的账,每个项目都算得不太一样。
我的判断:推理速度的军备竞赛,正在从模型架构层面转移到部署和编译层面。谁先把这层做扎实,谁就能让开源模型真正追上闭源产品的日常体验。
原文:Show HN: Fast inference for deep seek flash v4.1 469 tok/s for coding · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123




