TFIDF

概念:

         TFIDF中的TF是termFrequency即词频,是词在文档中出现的频率,用词出现的次数除以文档中词的总数。以防止它偏向长的文件。这里词的总数是词1出现3次,词2出现5次,总数就是3+5=8次。

         而IDF是InverseDocument Frequency,可以由总的文件数目除以包含该词的文件数目,再取对数。10为底的对数。

         文档i中词j的tfidf权重值就是词j在文档i中的TF乘以词j在文档集合上计算出来的的IDF(这是一个全局因子)。

实际操作:

         对于一组文档集合,可以通过以上的方法计算出词的IDF并保存作为全局因子。

         对于这组文档集合中的每一篇文档,通过其TF和这个IDF就可以得到文档向量空间。

         当有新的一篇文档时,需要使用TFIDF权重来生成文档向量空间时。就先计算这个文档中包含词的TF,然后查找这个词的IDF。如果没有这个词,就忽略,如果有就计算该词的tfidf权重。这个和上面的区别是:文档集合中的文档中的词在IDF中必能找到对应的idf全局值。但是新的文档中的词就不能保证这点。
  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值