TF-IDF原理理解

最新推荐文章于 2024-07-30 18:04:32 发布

壑壑哒

最新推荐文章于 2024-07-30 18:04:32 发布

阅读量7.3k

点赞数 3

分类专栏：大数据项目过程文章标签： TF-IDF

本文链接：https://blog.csdn.net/qq_39493274/article/details/80460054

版权

TF-IDF是一种统计方法，评估词语在文件中的重要性，适用于资讯检索和语料库分析。它由词频TF和逆文件频率IDF组成，通过计算公式确定词的重要性，过滤常见词语，保留关键信息。在信息检索中，TF-IDF用于计算搜索结果的相关性，值越高，相关性越强。

摘要由CSDN通过智能技术生成

什么是TF-IDF：

TF-IDF(Term Frequency-Inverse DocumentFrequency, 词频-逆文件频率)，一种用于资讯检索和资讯探勘的常用加权技术。

TF-IDF是一种统计方法，用以评估一字词对于一个文件集或一个语料库中的其中一份文件的重要程度。字词的重要性随着它在文件中出现的次数成正比增加，但同时会随着它在语料库中出现的频率成反比下降。TF-IDF加权的各种形式常被搜寻引擎应用，作为文件与用户查询之间相关程度的度量或评级。

相关原理：

词频TF（item frequency）：某一给定词语在该文本中出现次数。该数字通常会被归一化（分子一般小于分母），以防止它偏向长的文件，因为不管该词语重要与否，它在长文件中出现的次数很可能比在段文件中出现的次数更大。

需要注意的是有一些通用词对文章主题没有太大作用，如“的”“是”等，而有一些频率出现少的词如一些专业词更能表现文章主题，所以为词语设置权重，权重的设计满足：一个词预测主题的能力越强，权重越大，反之，权重越小。也就是说，一些词只在很少几篇文章中出现，那么这样的词对文章主题的判断能力很大，这些词的权重应该设计的较大。IDF完成这样的工作。

逆向文件频率IDF（inverse document frequency）：一个词语普遍重要性的度量。主要思想是：如果包含词条t的文档越少, IDF越大，则说明词条具有很好的类别区分能力。某一特定词语的IDF，可以由总文件数目除以包含该词语之文件的数目&#

最低0.47元/天解锁文章

壑壑哒

关注

3
点赞
踩
38

收藏

觉得还不错? 一键收藏
2
评论
TF-IDF原理理解

什么是TF-IDF： TF-IDF(Term Frequency-Inverse DocumentFrequency, 词频-逆文件频率)，一种用于资讯检索和资讯探勘的常用加权技术。 TF-IDF是一种统计方法，用以评估一字词对于一个文件集或一个语料库中的其中一份文件的重要程度。字词的重要性随着它在文件中出现的次数成正比增加，但同时会随着它在语料库中出现的频率成反比下降。T...
复制链接

扫一扫

专栏目录