469 tok/s:推理竞赛的战场已经转移了

原创
alex 3分钟前 阅读数 1 #头条
469 tok/s,我盯着这个数字看了很久。 DeepSeek Flash V4.1 的编码推理跑出了这个速度。不是云端,是一个 Show HN 项目的本地方案。 问题在于——这个速度到底意味着什么? 在编码场景下,模型吐完一整个函数从十几秒压到三秒以内,体验断层非常明显。你写代码时的等待感消失了,感觉更像模型在"接话"而不是"思考"。 但推理加速从来不免费,精度和速度之间的账,每个项目都算得不太一样。 我的判断:推理速度的军备竞赛,正在从模型架构层面转移到部署和编译层面。谁先把这层做扎实,谁就能让开源模型真正追上闭源产品的日常体验。

原文:Show HN: Fast inference for deep seek flash v4.1 469 tok/s for coding · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除