安装 jieba 库:
pip intall jieba
使用 jieba 库:import jieba
jieba.cut()
- 返回词语组成的生成器
jieba.lcut()
- 将返回的对象转化为list对象返回
参数:
sentence
: 需要分词的字符串cut_all
: 参数用来控制是否采用全模式
精准模式(默认) cut_all=False
:试图将句子最精确地切开,适合文本分析
seg_list = jieba.cut("我来到北京清华大学", cut_all=False)
print("精准模式: " + "/ ".join(seg_list)) # 精确模式
# -----output-----
精准模式: 我/ 来到/ 北京/ 清华大学
全模式 cut_all=True
:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义
seg_list = jieba.cut("我来到北京清华大学", cut_all=True)
print("全模式: " + "/ ".join(seg_list)) # 全模式
# -----output-----
全模式: 我/ 来到/ 北京/ 清华/ 清华大学/ 华大/ 大学