hanlp的安装
首先在命令提示符中输入pip install pyhanlp
然后提示如下错误:
building‘_jpype’extension
error:Microsoft Visual C++ 14.0 is required. 表面看是需要下载VC++,但实际上是通过下载JDK才能解决问题(Hanlp主项目是采用Java开发的)
JDK
下载了JDK 8. 然后配置JAVA_HOME,PATH等环境变量。具体步骤在这里
jpype1
配置好环境变量之后,执行如下命令
conda install -c conda-forge jpype1
pip install pyhanlp
提示failed building wheel for jpype1
然后需要下载并安装对应的wheel文件
点击此处,即可找到并下载相对应的whl文件,
使用pip install “文件路径+whl文件名”即可成功安装对应的whl文件。
比如:pip install D:\ruanjian\python\python_Levenshtein-0.12.0-cp35-cp35m-win_amd64.whl
修改配置文件中的root
hanlp配置错误 data不存在 请修改配置文件中的root
处理方法:
下载data.zip(http://nlp.hankcs.com/download.php?file=data),解压后放到/site-packages/pyhanlp/static下
安装完成
再次执行pip install pyhanlp
即可安装成功。随后可以通过执行hanlp命令,可以验证安装结果。
from pyhanlp import *
print(HanLP.segment("你好,欢迎在Python中调用HanLP的API").toString())
testCases = [
"商品和服务",
"结婚的和尚未结婚的确实在干扰分词啊",
"买水果然后来世博园最后去世博会",
"中国的首都是北京",
"欢迎新老师生前来就餐",
"工信处女干事每月经过下属科室都要亲口交代24口交换机等技术性器件的安装工作",
"随着页游兴起到现在的页游繁盛,依赖于存档进行逻辑判断的设计减少了,但这块也不能完全忽略掉。"]
for sentence in testCases: print(HanLP.segment(sentence))
# 命名实体识别与词性标注
NLPTokenizer = JClass('com.hankcs.hanlp.tokenizer.NLPTokenizer')
print(NLPTokenizer.segment('中国科学院计算技术研究所的宗成庆教授正在教授自然语言处理课程'))
# 关键词提取
document = "水利部水资源司司长陈明忠9月29日在国务院新闻办举行的新闻发布会上透露," \
"根据刚刚完成了水资源管理制度的考核,有部分省接近了红线的指标," \
"有部分省超过红线的指标。对一些超过红线的地方,陈明忠表示,对一些取用水项目进行区域的限批," \
"严格地进行水资源论证和取水许可的批准。"
print(HanLP.extractKeyword(document, 2))
# 自动摘要
print(HanLP.extractSummary(document, 3))
# 依存句法分析
print(HanLP.parseDependency("徐先生还具体帮助他确定了把画雄鹰、松鼠和麻雀作为主攻目标。"))
验证成功: