不聊天只管干活:29MB模型凭什么对标DeepSeek
原创
8MB模型真能追平DeepSeek V4 Flash?说实话我第一反应是质疑。但Cactus Needle 3的赌注确实有意思:他们放弃通用聊天,只做工具调用和结构化JSON输出。每一层(2到20层)都能独立部署,8-29MB二进制文件,树莓派5上解码速度达4k tokens/sec。Mobile Actions基准上20层2-bit模型拿到86.0分,干掉了1.2B参数的LFM2.5和苹果端侧模型。架构上用Monarch Hadamard MLP替代传统FFN,把O(d²)的计算量压到O(d√d)。窄任务上微调4层即可逼近Flash水准。我的判断:这条路线赌的不是算力,而是"够用"本身的价值——当模型小到能塞进任何设备,AI的落地方式会完全不同。
原文:Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123




