java加载pmml模型文件报错_PMML总结与思考PMML模型生成和加载示例

最新推荐文章于 2024-07-17 20:59:32 发布

阿里巴巴淘系技术

最新推荐文章于 2024-07-17 20:59:32 发布

阅读量1.2k

点赞数

文章标签： java加载pmml模型文件报错

本文链接：https://blog.csdn.net/weixin_29672983/article/details/114725037

版权

本文介绍了如何使用PMML解决跨平台的机器学习模型部署问题。通过将模型转换为PMML格式，可以在不同环境中加载和预测。文章展示了使用Python的sklearn训练决策树模型，然后利用sklearn2pmml生成PMML文件，最后在Java环境中使用JPMML加载模型并进行预测的示例。同时，文章还探讨了PMML的局限性，包括文件大小、加载速度和预测精度的轻微损失。

摘要由CSDN通过智能技术生成

在机器学习用于产品的时候，我们经常会遇到跨平台的问题。比如我们用Python基于一系列的机器学习库训练了一个模型，但是有时候其他的产品和项目想把这个模型集成进去，但是这些产品很多只支持某些特定的生产环境比如Java，为了上一个机器学习模型去大动干戈修改环境配置很不划算，此时我们就可以考虑用预测模型标记语言(Predictive Model Markup Language,以下简称PMML)来实现跨平台的机器学习模型部署了。

1. PMML概述

PMML是数据挖掘的一种通用的规范，它用统一的XML格式来描述我们生成的机器学习模型。这样无论你的模型是sklearn,R还是Spark MLlib生成的，我们都可以将其转化为标准的XML格式来存储。当我们需要将这个PMML的模型用于部署的时候，可以使用目标环境的解析PMML模型的库来加载模型，并做预测。

可以看出，要使用PMML，需要两步的工作，第一块是将离线训练得到的模型转化为PMML模型文件，第二块是将PMML模型文件载入在线预测环境，进行预测。这两块都需要相关的库支持。

2. PMML模型的生成和加载相关类库

PMML模型的生成相关的库需要看我们使用的离线训练库。如果我们使用的是sklearn，那么可以使用sklearn2pmml这个python库来做模型文件的生成，这个库安装很简单，使用"pip install sklearn2pmml"即可，相关的使用我们后面会有一个demo。如果使用的是Spark MLlib, 这个库有一些模型已经自带了保存PMML模型的方法，可惜并不全。如果是R，则需要安装包"XML"和“PMML”。此外，JAVA库JPMML可以用来生成R,SparkMLlib,xgBoost,Sklearn的模型对应的PMML文件。github地址是：https://github.com/jpmml/jpmml。

加载PMML模型需要目标环境支持PMML加载的库，如果是JAVA，则可以用JPMML来加载PMML模型文件。相关的使用我们后面会有一个demo。

3. PMML模型生成和加载示例

下面我们给一个示例，使用sklearn生成一个决策树模型，用sklearn2pmml生成模型文件，用JPMML加载模型文件，并做预测。

完整代码参见我的github:https://github.com/ljpzzz/machinelearning/blob/master/model-in-product/sklearn-jpmml

首先是用用sklearn生成一个决策树模型，由于我们是需要保存PMML文件，所以最好把模型先放到一个Pipeline数组里面。这个数组里面除了我们的决策树模型以外，还可以有归一化，降维等预处理操作，这里作为一个示例，我们Pipeline数组里面只有决策树模型。代码如下:

importnumpy