- 博客(1)
- 收藏
- 关注
原创 Python3-LDA主题模型+TF/IDF gensim实现,中文案例
LDA主题模型+TF/IDF gensim实现 文本预处理 当我们拿到文本数据时,我们需要将其转化为词袋,才能进行标准化处理,但是往往在这些数据中存在着一些噪音数据,如“的、我、吗、需要”这些对我们结果没有意义的词语,同时在进行切词时可能将一个词切成多个,如将“泸州老窖”切成“泸州”,“老窖”两个词,其次繁体字英文也会对结果进行一些干扰,综上所述我们将进行数据清晰,生成规范的数据。 #导入库 from gensim import corpora from gensim.models import LdaMo
2020-08-07 16:00:28 7354 5
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人