达观杯文本智能挑战赛任务二（TF-IDF）

最新推荐文章于 2021-03-08 14:31:02 发布

Dxy17

最新推荐文章于 2021-03-08 14:31:02 发布

阅读量190

点赞数

分类专栏：数据挖掘

本文链接：https://blog.csdn.net/m0_37548423/article/details/89075861

版权

数据挖掘专栏收录该内容

9 篇文章 0 订阅

订阅专栏

简介

TF-IDF（term frequency–inverse document frequency）是一种用于信息检索与数据挖掘的常用加权技术。TF意思是词频(Term Frequency)，IDF意思是逆文本频率指数(Inverse Document Frequency)。

原理

TFIDF的主要思想是：如果某个词或短语在一篇文章中出现的频率TF高，并且在其他文章中很少出现，则认为此词或者短语具有很好的类别区分能力，适合用来分类。TFIDF实际上是：TF * IDF。

计算

词频（TF） = 某个词在文章中出现的次数 / 文章中的总词数

逆文本频率（IDF） = log （语料库的文档总数 / （包含该词的文档数+1）） $词频(TF) =$

代码实现

import pandas as pd
import numpy as np
from sklearn.cross_validation import train_test_split
from sklearn.feature_extraction.text import CountVectorizer

print("data read begin...")
train_data = pd.read_csv('./new_data/train_set.csv')
test_data = pd.read_csv('./new_data/test_set.csv')
train_data.drop(columns=['article','id'], inplace = True)
test_data.drop(columns=['article'], inplace = True)
print("data read end...")

"""提取特征"""
vectorizer = CountVectorizer(ngram_range=(1, 2), min_df = 3, max_df = 0.9, max_features = 100000)
vectorizer.fit(train_data['word_seg'])

Dxy17

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
达观杯文本智能挑战赛任务二（TF-IDF）

简介TF-IDF（termfrequency–inverse document frequency）是一种用于信息检索与数据挖掘的常用加权技术。TF意思是词频(Term Frequency)，IDF意思是逆文本频率指数(Inverse Document Frequency)。原理TFIDF的主要思想是：如果某个词或短语在一篇文章中出现的频率TF高，并且在其他文章中很少出现，则认为此词...
复制链接

扫一扫