特征工程
主要介绍数据清洗阶段的工作,例如TF IDF 卡方计算等等
知然xu
这个作者很懒,什么都没留下…
展开
-
特征工程—TFIDF、卡方计算、信息增益、N-Gram模型(一)
TFIDF、卡方计算、信息增益的介绍 信息增益详细介绍 N-Gram介绍 下一篇:特征工程之N-Gram(二)原创 2018-08-01 15:53:18 · 2293 阅读 · 0 评论 -
特征工程之N-Gram(二)
一、N-Gram模型 (1)什么是n-gram模型 N-Gram是一种基于统计语言模型的算法。它的基本思想是将文本里面的内容按照字节进行大小为N的滑动窗口操作,形成了长度是N的字节片段序列。 每一个字节片段称为gram,对所有gram的出现频度进行统计,并且按照事先设定好的阈值进行过滤,形成关键gram列表,也就是这个文本的向量特征空间,列表中的每一种gram就是...原创 2018-08-12 18:50:14 · 5529 阅读 · 2 评论