自然语言处理 第三期

NLP

内容

  1. 基本文本处理技能
    1.1 分词的概念(分词的正向最大、逆向最大、双向最大匹配法);
    1.2 词、字符频率统计;(可以使用Python中的collections.Counter模块,也可以自己寻找其他好用的库)
  2. 2.1 语言模型中unigram、bigram、trigram的概念;
    2.2 unigram、bigram频率统计;(可以使用Python中的collections.Counter模块,也可以自己寻找其他好用的库)
  3. 文本矩阵化:要求采用词袋模型且是词级别的矩阵化
    步骤有:
    3.1 分词(可采用结巴分词来进行分词操作,其他库也可以);
    3.2 去停用词;构造词表。
    3.3 每篇文档的向量化。

实现

  1. 中文分词:汉语自然语言处理的第一部分是中文分词。因为中文不像英文那样,实行分词连写,即词与词之间用空格分隔。
    在分析中文文本之前必须将一个汉字序列切分成一个一个单独的词,这个过程称为中文分词。

中文分词主要分为机械师分词法(基于词典),基于语法和规则分词法,基于统计分词法。

最大匹配法:最大匹配是指以词典为依据,取词典中最长单词为第一个次取字数量的扫描串,在词典中进行扫描(为提升扫描效率,还可以跟据字数多少设计多个字典,然后根据字数分别从不同字典中进行扫描)。例如:词典中最长词为“中华人民共和国”共7个汉字,则最大匹配起始字数为7个汉字。然后逐字递减,在对应的词典中进行查找。
(1)正向最大匹配法:正向即从前往后取词,从7->1,每次减一个字,直到词典命中或剩下1个单字。
(2)逆向最大匹配法:逆向即从后往前取词,其他逻辑和正向相同。
(3)双向最大匹配法:两种算法都切一遍,然后根据大颗粒度词越多越好,非词典词和单字词越少越好的原则,选取其中一种分词结果输出。
2. 词、字符频率统计:

import jieba
txt = open("红楼梦.txt", "r", encoding="gb18030").read()

import collections

txt1 = txt
txt1 = txt1.replace('\n', '')  # 删掉换行符
txt1 = txt1.replace(',', '')  # 删掉逗号
txt1 = txt1.replace('。', '')  # 删掉句号
mylist = list(txt1)
mycount = collections.Counter(mylist
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
该资源内项目源码是个人的课程设计、毕业设计,代码都测试ok,都是运行成功后才上传资源,答辩评审平均分达到96分,放心下载使用! ## 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.md文件(如有),仅供学习参考, 切勿用于商业用途。 该资源内项目源码是个人的课程设计,代码都测试ok,都是运行成功后才上传资源,答辩评审平均分达到96分,放心下载使用! ## 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.md文件(如有),仅供学习参考, 切勿用于商业用途。
自然语言处理综论第二版pdf是一本涵盖了自然语言处理的基本原理、技术和应用的书籍。该书主要分为六个部分,分别是基础知识、词汇处理、语法与语义、自然语言生成、自然语言理解和应用。这六部分通过实际案例和丰富的示例来解释自然语言处理的概念和技术,具有很高的可读性和实用性。 该书的第一个部分“基础知识”主要介绍自然语言处理的概念和应用领域,以及相关的学科和技术。第二个部分“词汇处理”则重点介绍对自然语言中的词语进行处理和分析的方法和技术,包括词形还原、词性标注和词向量等。第三个部分“语法与语义”则解释自然语言中的语言结构和语义表达方法,包括句法结构分析和语义角色标注等。 第四个部分“自然语言生成”则着重解释如何通过计算机程序来生成自然语言的过程,包括文本生成和对话系统等。第五个部分“自然语言理解”则介绍了如何将自然语言转化为计算机能够理解的形式,包括语音识别和自然语言理解等。最后一个部分“应用”则介绍了如何在具体的应用场景中使用自然语言处理技术,例如信息检索、机器翻译、文本分类和情感分析等方面。 总之,自然语言处理综论第二版pdf是一本权威且实用的自然语言处理领域的经典教材,适合从事自然语言处理相关工作或者对该领域感兴趣的读者阅读和学习。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值