python NLTK、中文分词

本文介绍了Python中进行中文分词和词性标注的相关资源,包括NLTK库、jieba分词、ICTCLAS汉语词性标注集等,并展示了汉语文本处理的基本操作,如词性标注代码解释。
摘要由CSDN通过智能技术生成

http://blog.csdn.net/huyoo/article/details/12188573

http://www.zhihu.com/question/19842722

https://github.com/fxsjy/jieba

http://ictclas.org



ICTCLAS 汉语词性标注集

汉语文本词性标注标记集

Ag 形语素 形容词性语素。形容词代码为a,语素代码g前面置以A。

a 形容词 取英语形容词adjective的第1个字母。

ad 副形词 直接作状语的形容词。形容词代码a和副词代码d并在一起。

an 名形词 具有名词功能的形容词。形容词代码a和名词代码n并在一起。

b 区别词 取汉字“别”的声母。

c 连词 取英语连词conjunction的第1个字母。

Dg 副语素 副词性语素。副词代码为d,语素代码g前面置以D。

d 副词 取adverb的第2个字母,

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值