TF-IDF(词频-逆文档频率)是一种bag-of-words模型的统计方法,用以评估一个单词在一个文档集合或语料库中的重要程度。经常被用作信息检索、文本挖掘以及用户模型的权重因素。
tf-idf的值会随着单词在文档中出现的次数的增加而增大,也会随着单词在语料库中出现的次数的增多而减小。tf-idf是如今最流行的词频加权方案之一。
- TF(Term Frequency,词频):表示一个给定词语t在一篇给定文档d中出现的频率。公式表示为:
其中 n i , j n_{i,j} ni,j 是该词在文件 d j d_j dj中出现的次数,分母则是文件 d j d_j d