python27使用jieba分词，去除停用词

最新推荐文章于 2024-05-12 16:30:17 发布

Yan456jie

最新推荐文章于 2024-05-12 16:30:17 发布

阅读量1.7w

点赞数

分类专栏： NLP

本文链接：https://blog.csdn.net/Yan456jie/article/details/60476457

版权

NLP 专栏收录该内容

34 篇文章 6 订阅

订阅专栏

# -*- coding: utf-8 -*-
import jieba
import jieba.analyse
import sys
import codecs
reload(sys)
sys.setdefaultencoding('utf-8')

#使用其他编码读取停用词表
#stoplist = codecs.open('../../file/stopword.txt','r',encoding='utf8').readlines()
#stoplist = set(w.strip() for w in stoplist)
#停用词文件是utf8编码
stoplist = {}.fromkeys([ line.strip() for line in open("../../file/stopword.txt") ])

#经过分词得到的应该是unicode编码，先将其转成utf8编码
segs = jieba.cut('北京附近的租房', cut_all=False)
segs = [word.encode('utf-8') for word in list(segs)]

segs = [word for word in list(segs) if word not in stoplist]

for seg in segs:
    print seg

Yan456jie

关注

0
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
python27使用jieba分词，去除停用词

# -*- coding: utf-8 -*-import jiebaimport jieba.analyseimport sysimport codecsreload(sys)sys.setdefaultencoding('utf-8')#使用其他编码读取停用词表#stoplist = codecs.open('../../file/stopword.txt','r',enco
复制链接

扫一扫

专栏目录