概念 : TF-IDF(term frequency–inverse document frequency)是一种用于资讯检索与资讯探勘的常用加权技术。TF-IDF是一种统计方法,用以评估一字词对于一个文件集或一个语料库中的其中一份文件的重要程度。字词的重要性随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
缺点:单纯以"词频"衡量一个词的重要性,不够全面,有时重要的词可能出现次数并不多。而且,这种算法无法体现词的位置信息,出现位置靠前的词与出现位置靠后的词,都被视为重要性相同,这是不正确的。也没有考虑词性。
思路 : 一篇文章一般是由标题、正文组成,其中最重要的部分往往是标题、文章开头、文章结尾,而正文又由句子构成。一般来说一个句子最重要的部分一般是主谓宾,而主语和宾语一般是名词,谓语一般是动词,当然形容词可以修饰名词,副词可以修饰动词。
方案 : 可以给标题、文章开头、文章结尾出现的词较高的权重,计算关键词权重的时候,可以考虑词性, 一般来说 名词 > 动词 > 形容词、副词 > 其他
缺点:单纯以"词频"衡量一个词的重要性,不够全面,有时重要的词可能出现次数并不多。而且,这种算法无法体现词的位置信息,出现位置靠前的词与出现位置靠后的词,都被视为重要性相同,这是不正确的。也没有考虑词性。
思路 : 一篇文章一般是由标题、正文组成,其中最重要的部分往往是标题、文章开头、文章结尾,而正文又由句子构成。一般来说一个句子最重要的部分一般是主谓宾,而主语和宾语一般是名词,谓语一般是动词,当然形容词可以修饰名词,副词可以修饰动词。
方案 : 可以给标题、文章开头、文章结尾出现的词较高的权重,计算关键词权重的时候,可以考虑词性, 一般来说 名词 > 动词 > 形容词、副词 > 其他