NLPIR词性标记集

计算所汉语词性标记集

Version 3.0

制订人:刘群 张华平 张浩

 

1.          名词  (1个一类,7个二类,5个三类)

名词分为以下子类:

n 名词

nr 人名

nr1 汉语姓氏

nr2 汉语名字

nrj 日语人名

nrf 音译人名

ns 地名

nsf 音译地名

nt 机构团体名

nz 其它专名

nl 名词性惯用语

ng 名词性语素

2.          时间词(1个一类,1个二类)

t 时间词

tg 时间词性语素

3.          处所词(1个一类)

s 处所词

4.          方位词(1个一类)

f 方位词

5.          动词(1个一类,9个二类)

v 动词

vd 副动词

vn 名动词

vshi 动词“是”

vyou 动词“有”

vf 趋向动词

vx 形式动词

vi 不及物动词(内动词)

vl 动词性惯用语

vg 动词性语素

6.          形容词(1个一类,4个二类)

a 形容词

ad 副形词

an 名形词

ag 形容词性语素

al 形容词性惯用语

7.          区别词(1个一类,2个二类)

b 区别词

 

bl 区别词性惯用语

8.          状态词(1个一类)

z 状态词

9.          代词(1个一类,4个二类,6个三类)

r 代词

rr 人称代词

rz 指示代词

rzt 时间指示代词

rzs 处所指示代词

rzv 谓词性指示代词

ry 疑问代词

ryt 时间疑问代词

rys 处所疑问代词

ryv 谓词性疑问代词

rg 代词性语素

10.     数词(1个一类,1个二类)

m 数词

mq 数量词

11.     量词(1个一类,2个二类)

q 量词

qv 动量词

qt 时量词

12.     副词(1个一类)

d 副词

13.     介词(1个一类,2个二类)

p 介词

pba 介词“把”

pbei 介词“被”

14.     连词(1个一类,1个二类)

c 连词

    cc 并列连词

15.     助词(1个一类,15个二类)

u 助词

uzhe 着

ule 了 喽

uguo 过

ude1 的 底

ude2 地

ude3 得

usuo 所

udeng 等 等等 云云

uyy 一样 一般 似的 般

udh 的话

uls 来讲 来说 而言 说来

 

uzhi 之

ulian 连 (“连小学生都会”)

 

16.     叹词(1个一类)

e 叹词

17.     语气词(1个一类)

y 语气词(delete yg)

18.     拟声词(1个一类)

o 拟声词

19.     前缀(1个一类)

h 前缀

20.     后缀(1个一类)

k 后缀

21.     字符串(1个一类,2个二类)

x 字符串

    xe  Email字符串

xs 微博会话分隔符

xm 表情符合

xu 网址URL

 

  

22.     标点符号(1个一类,16个二类)

w 标点符号

wkz 左括号,全角:( 〔  [  {  《 【  〖 〈   半角:( [ { <

wky 右括号,全角:) 〕  ] } 》  】 〗 〉 半角: ) ] { >

wyz 左引号,全角:“ ‘ 『  

wyy 右引号,全角:” ’ 』

wj 句号,全角:。

ww 问号,全角:? 半角:?

wt 叹号,全角:! 半角:!

wd 逗号,全角:, 半角:,

wf 分号,全角:; 半角: ;

wn 顿号,全角:、

wm 冒号,全角:: 半角: :

ws 省略号,全角:……  …

wp 破折号,全角:――   --   ――-   半角:---  ----

wb 百分号千分号,全角:% ‰   半角:%

wh 单位符号,全角:¥ $ £  °  ℃  半角:$

  • 1
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
### 回答1: conll2003数据是一种常用的用于词性标注的数据。该数据包含了多个英文语料库,其中包括了不同领域的文本,如新闻、百科和社交媒体等。 在conll2003数据中,每个词被标注了其相应的词性。常见的词性标记包括名词(NN)、动词(VB)、形容词(JJ)等。这些词性标记对于理解句子的语法结构和词汇含义非常重要。 使用conll2003数据进行词性标注的目的是训练机器学习模型,使其能够自动识别并为输入文本中的每个词汇赋予正确的词性标记。这些模型通常使用监督学习方法,将标记正确的数据作为训练样本,学习特征并进行预测。 词性标注在自然语言处理中有许多应用。例如,在文本分析中,词性标注可以帮助识别实体(如人名、地名)、构建句法树以及进行机器翻译和信息检索。 conll2003数据是长期以来被广泛使用的标准数据之一。它的特点是数据较大、标注准确性较高,因此被广泛用于评估和比较不同的词性标注模型的性能。 虽然conll2003数据主要是用于英文的词性标注,但类似的数据也存在其他语言中。这些数据的使用可以加速自然语言处理模型的开发和改进,并对信息提取、机器翻译等任务产生积极的影响。 ### 回答2: CONLL2003数据是一个常用的用于词性标注的数据,它主要用于在自然语言处理任务中对词性进行标注和分类。该数据是由语料库中的英文新闻文章采而来的,其中包含有大约20万个单词,分为四个分类标签,分别是实体名词(PER、ORG、LOC、MISC),以及其他非实体名词(O)。 在CONLL2003数据中,每个单词都被标注了其对应的词性,如动词(VB)、名词(NN)、形容词(JJ)等。这些标注的词性信息可以帮助机器理解自然语言文本,并进行一系列的自然语言处理任务,如命名实体识别、句法分析等。 对于词性标注的任务,一般采用机器学习的方法进行。首先,需要将CONLL2003数据划分成训练、验证和测试。然后,利用训练的数据来训练一个词性标注模型,常见的模型包括隐马尔可夫模型(HMM)、最大熵模型(MaxEnt)和条件随机场(CRF)等。训练过程中,模型会学习到每个单词和其对应词性之间的概率分布。 训练好的模型可以用来对新的文本进行词性标注。给定一句话或段落,模型会根据之前学习到的概率分布,为每个单词预测最可能的词性。这样,就可以得到词性标注后的文本。 总之,CONLL2003数据是一个广泛应用于词性标注任务的数据。通过使用这个数据,我们可以构建出词性标注模型,并应用于实际的自然语言处理任务中,提高文本处理的准确性和效率。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值