Spark MLlib 特征抽取、转化和选择 -- 特征抽取1 TF-IDF(HashingTF and IDF)

最新推荐文章于 2022-12-27 21:14:11 发布

studiousq

最新推荐文章于 2022-12-27 21:14:11 发布

阅读量1.5k

点赞数 1

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/zhaoqqa/article/details/81877654

版权

本文详细介绍了Spark MLlib中用于特征处理的TF-IDF方法，包括HashingTF和IDF的概念及作用。通过将文本划分为单个词语，使用HashingTF转换为固定长度的特征向量，再用IDF调整权重，从而提升文本特征的区分能力。最终，通过实例展示了如何在DataFrame上实现这一过程。

摘要由CSDN通过智能技术生成

这一部分主要介绍和特征处理相关的算法，大体分为以下三类：
1）特征抽取：从原始数据中抽取特征

2）特征转换：特征的维度、特征的转化、特征的修改

3）特征选取：从大规模特征集中选取一个子集

特征提取：

TF-IDF(HashingTF and IDF)

“词频－逆向文件频率”（TF-IDF）是一种在文本挖掘中广泛使用的特征向量化方法，它可以体现一个文档中词语在语料库中的重要程度。

词语由t表示，文档由d表示，语料库由D表示。词频TF(t,d)是词语t在文档d中出现的次数。文件频率DF(t,D)是包含词语的文档的个数。如果我们只使用词频来衡量重要性，很容易过度强调在文档中经常出现，却没有太多实际信息的词语，比如“a”，“the”以及“of”。如果一个词语经常出现在语料库中，意味着它并不能很好的对文档进行区分。TF-IDF就是在数值化文档信息，衡量词语能提供多少信息以区分文档。其定义如下：

公式中使用log函数，当词出现在所有文档中时，它的IDF值变为0。加1是为了避免分母为0的情况。TF-IDF 度量值表示如下：

$IDF(t,D) = log \frac{\left| D \right| + 1}{DF(t,D) + 1}$ ，此处的

最低0.47元/天解锁文章

关注

1
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。