hanlp

1、词性标准

from pyhanlp import *
NLPTokenizer = JClass("com.hankcs.hanlp.tokenizer.NLPTokenizer")
text = "于2017-04-27 14:42:31在中国医学科学院北京协和医院诊断为良性高血压花费1539.45元**于2017-04-27 15:04:59在中国医学科学院北京协和医院诊断为良性高血压花费1138.5元**于2017-08-29 00:00:00在中国医学科学院北京协和医院诊断为右肾上腺占位高血压病3级高危花费19190.2元**于2017-04-27 14:59:25在中国医学科学院北京协和医院诊断为良性高血压花费599.8元**于2017-04-10 03:19:53在北京市昌平区天通苑中医医院诊断为急性冠脉综合征、胸痛待查、发热待查、冠状动脉供血不足、电解质紊乱花费20.0元**于2017-04-10 02:15:51在北京市昌平区天通苑中医医院诊断为急性冠脉综合征、胸痛待查、发热待查、冠状动脉供血不足、电解质紊乱花费572.5元"
term_list = NLPTokenizer.segment(text)
print(term_list)

2、基本用法

from pyhanlp import *
from pyhanlp import HanLP
print(HanLP.segment('你好,欢迎在Python中调用HanLP的API'))
for term in HanLP.segment('下雨天地面积水'):
    print('{}\t{}'.format(term.word, term.nature)) # 获取单词与词性
testCases = [
    "商品和服务",
    "结婚的和尚未结婚的确实在干扰分词啊",
    "买水果然后来世博园最后去世博会",
    "中国的首都是北京",
    "欢迎新老师生前来就餐",
    "工信处女干事每月经过下属科室都要亲口交代24口交换机等技术性器件的安装工作",
    "随着页游兴起到现在的页游繁盛,依赖于存档进行逻辑判断的设计减少了,但这块也不能完全忽略掉。"]
for sentence in testCases: print(HanLP.segment(sentence))
# 关键词提取
document = "水利部水资源司司长陈明忠9月29日在国务院新闻办举行的新闻发布会上透露," \
           "根据刚刚完成了水资源管理制度的考核,有部分省接近了红线的指标," \
           "有部分省超过红线的指标。对一些超过红线的地方,陈明忠表示,对一些取用水项目进行区域的限批," \
           "严格地进行水资源论证和取水许可的批准。"
print(HanLP.extractKeyword(document, 2))
# 自动摘要
print(HanLP.extractSummary(document, 3))
# 依存句法分析
print(HanLP.parseDependency("徐先生还具体帮助他确定了把画雄鹰、松鼠和麻雀作为主攻目标。"))

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值