一台Mac Mini跑出360 tok/s,本地推理的天花板真的够高了

原创
alex 2小时前 阅读数 1 #头条
17.5 tok/s的解码速度放在两年前,几乎意味着你只能盯着光标发呆。但360 tok/s的prefill速率——这个数字让我愣了下。有人把Qwen Flash Next的Q4量化版塞进了一台Mac Mini,不是什么M3 Ultra顶配,就是普通桌面小盒子,跑出来的吞吐让很多人开始重新算账。本地推理这件事,瓶颈从来不在模型能不能跑,而在体感速度能不能接受。17.5 tok/s生成中文大约每秒七八个汉字,阅读体验勉强及格;但360 tok/s的预填充意味着你丢进去一篇长文,模型几乎眨眼间就消化完了,交互延迟被压到了用户几乎察觉不到的区间。判断很明确:消费级Mac硬件加上激进量化,已经跨过了"能玩"到"能用"的分界线。真正的门槛现在只剩显存容量和量化精度之间的取舍。

原文:Running Qwen Flash Next Q4 on a Mac Mini · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除