import jieba
jieba.setLogLevel(jieba.logging.INFO)
import jieba.analyse
# 支持四种分词模式
# 1、使用paddle模式,利用PaddlePaddle深度学习框架,训练序列标注(双向GRU)网络模型实现分词
seg_list = jieba.cut("我来到北京清华大学",use_paddle=True)
print("paddle模式: " + '/'.join(seg_list))
得到结果:
paddle模式: 我/来到/北京清华大学
# 2、全模式,把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义
seg_list = jieba.cut("我来到北京清华大学", cut_all=True)
print("全模式: " + "/ ".join(seg_list))
得到结果:
全模式: 我/ 来到/ 北京/ 清华/ 清华大学/ 华大/ 大学
# 3、精确模式,试图将句子最精确地切开,适合文本分析
seg_list = jieba.cut("我来到北京清华大学", cut_all=False)
print("精确模式: " + "/ ".join(seg_list))
得到结果:
精确模式: 我/ 来到/ 北京/ 清华大学