使用Gensim库对文本进行词袋、TF-IDF和n-gram方法向量化处理

最新推荐文章于 2024-02-25 15:17:58 发布

今天喝奶茶了嗎

最新推荐文章于 2024-02-25 15:17:58 发布

阅读量1.5k

点赞数

分类专栏：自然语言处理文章标签： python 机器学习自然语言处理人工智能

本文链接：https://blog.csdn.net/weixin_44804517/article/details/115439106

版权

本文介绍了Gensim库在自然语言处理中的关键作用，通过词袋、TF-IDF和n-gram展示了向量化文本的不同方法。重点讲解了如何使用Spacy和Gensim进行数据预处理，以及这些表示在机器学习中的应用价值。

摘要由CSDN通过智能技术生成

Gensim库简介

机器学习算法需要使用向量化后的数据进行预测，对于文本数据来说，因为算法执行的是关于矩形的数学运算，这意味着我们必须将字符串转换为向量。从数学的角度看，向量是具有大小和方向的几何对象，不需过多地关注概念，只需将向量化看作一种将单词映射到数学空间的方法，同时保留其本身蕴含的信息。

Gensim是世界上最大的NLP/信息检索Python库之一，兼具内存高效性和可扩展性。Gensim的可扩展性体现为它采用了Python内置的生成器和迭代器进行流式数据处理，所以数据集事实上并未完全加载到内存中。Gensim的主要特性有内存无关、潜在语义分析的多核实现、潜在Dirichlet分布、随即投影、分层Dirichlet过程，Word2Vec深度学习，以及在计算集群上运行LSA和LDA的能力。

1、数据预处理

本文通过处理部分新闻文本数据的test.txt，使用spacy和Gensim模块包对该文件进行去除停用词等预处理如下：

import spacy
from spacy.lang.zh.stop_words import STOP_WORDS
import pandas as pd
from gensim import corpora
from gensim import models
import gensim

#去除停用词
def stopwords(article):
    nlp = spacy.load("zh_core_web_sm")
    texts = []
    doc = nlp(

最低0.47元/天解锁文章

今天喝奶茶了嗎

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
3
评论
使用Gensim库对文本进行词袋、TF-IDF和n-gram方法向量化处理

自然语言处理作业（4.5）本次作业的要求是：通过处理部分新闻文本数据的test.txt，使用spacy和Gensim模块包在进行数据预处理后，使用词袋、TF-IDF和n-gram三种方法向量化，并分别输出成三份txt。对于存有部分新闻文本的test.txt文件，先对该文件进行去除停用词等相关处理如下：import spacyfrom spacy.lang.zh.stop_words import STOP_WORDSimport pandas as pdfrom gensim import co
复制链接

扫一扫

专栏目录