- 项目中需要实现一个简单的聚类,初步衡量了下样本数量在2000W左右,第一次写spark还是14年的时候,而且都是基于java实现的模型算法,这次就简单用pyspark实现了特征的Id化, 即将字符串类型的特征转为数字表示的Id。这个在模型中相对比较常见, 比较主要的点应该是使用broadcast广播了特征和id的映射关系。
聚类(一)pyspark 实现特征的ID化
最新推荐文章于 2024-08-01 17:39:08 发布
该博客介绍了如何使用pyspark将字符串类型的特征转换为数字ID,通过广播映射关系提高效率。示例代码展示了从样本文件读取,创建特征到ID的映射,然后将样本ID化并保存结果。

最低0.47元/天 解锁文章
3752

被折叠的 条评论
为什么被折叠?



