Python3-LDA主题模型+TF/IDF gensim实现,中文案例
LDA主题模型+TF/IDF gensim实现
文本预处理
当我们拿到文本数据时,我们需要将其转化为词袋,才能进行标准化处理,但是往往在这些数据中存在着一些噪音数据,如“的、我、吗、需要”这些对我们结果没有意义的词语,同时在进行切词时可能将一个词切成多个,如将“泸州老窖”切成“泸州”,“老窖”两个词,其次繁体字英文也会对结果进行一些干扰,综上所述我们将进行数据清晰,生成规范的数据。
#导入库
from gensim import corpora
from gensim.models import LdaMo
原创
2020-08-07 16:00:28 ·
7354 阅读 ·
5 评论