文章目录
基于python中jieba包的中文分词中详细使用(一)
01.前言
之前的文章中也是用过一些jieba分词但是基本上都是处于皮毛,现在就现有的python环境中对其官方文档做一些自己的理解以及具体的介绍。本文主要内容也是从官网文档中获取。
02.jieba的介绍
02.1 What
“jieba” (Chinese for “to stutter”)Chiese text segmention:built to be the best Python Chinse word segmenmtation module.
"jieba"中文分词:做最好的Python中文分词组件
02.2特点
- 支持三种分词模式:
精确模式,试图将句子最精确地切开,适合文本分析;
全模式,把句子中所有的可以成词的词语都扫描处理,速度非常快,但是不能解决歧义;
搜索引擎模式,在精确模式的基础上,对长词再次切分,提高召回率,适合用于引擎分词。 - 支持繁体分词
- 支持自定义词典
- MIT授权协议
02.3安装与使用
鉴于当前提供各大包的组织