利用python进行tf-idf算法绘制词云图_python TF-IDF算法实现文本关键词提取

江湖上都叫我big飞

于 2021-01-30 17:39:56 发布

阅读量1.6k

点赞数

文章标签：利用python进行tf-idf算法绘制词云图

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_42494796/article/details/113552422

版权

本文介绍了TF-IDF算法，用于衡量词的重要性和文本关键词提取。通过计算词频和逆文档频率，得到TF-IDF值，从而确定文章的关键内容。代码示例展示了如何在Python中实现这一算法，并应用于文件夹中的多个文本文件，生成关键词提取结果。

摘要由CSDN通过智能技术生成

TF(Term Frequency)词频，在文章中出现次数最多的词，然而文章中出现次数较多的词并不一定就是关键词，比如常见的对文章本身并没有多大意义的停用词。所以我们需要一个重要性调整系数来衡量一个词是不是常见词。该权重为IDF(Inverse Document Frequency)逆文档频率，它的大小与一个词的常见程度成反比。在我们得到词频(TF)和逆文档频率(IDF)以后，将两个值相乘，即可得到一个词的TF-IDF值，某个词对文章的重要性越高，其TF-IDF值就越大，所以排在最前面的几个词就是文章的关键词。

TF-IDF算法的优点是简单快速，结果比较符合实际情况，但是单纯以“词频”衡量一个词的重要性，不够全面，有时候重要的词可能出现的次数并不多，而且这种算法无法体现词的位置信息，出现位置靠前的词和出现位置靠后的词，都被视为同样重要，是不合理的。

TF-IDF算法步骤：

(1)、计算词频：

词频 = 某个词在文章中出现的次数

考虑到文章有长短之分，考虑到不同文章之间的比较，将词频进行标准化

词频 = 某个词在文章中出现的次数/文章的总词数

词频 = 某个词在文章中出现的次数/该文出现次数最多的词出现的次数

(2)、计算逆文档频率

需要一个语料库(corpus)来模拟语言的使用环境。

逆文档频率 = log(语料库的文档总数/(包含该词的文档数 + 1))

(3)、计算TF-IDF

TF-IDF = 词频(TF)* 逆文档频率(IDF)

详细代码如下：

#!/usr/bin/env python

最低0.47元/天解锁文章

江湖上都叫我big飞

关注

0
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。