2. NLP 前置技术解析

NLP 的前置技术

  1. 很多的数据科学库、框架、模块以及工具箱可以有效地实现 NLP 大部分常见的算法与技术
  2. 需要掌握 Numpy、正则表达式

2.1 搭建 Python 开发环境

Python 处理 NLP 的优势

  • 具有丰富的自然语言处理库
  • 编程语法相对简单
  • 具有很多数据科学相关的库

2.1.1 Python 的科学计算发行版 — Anaconda

2.2 正则表达式在 NLP 中的基本应用

  1. 正则表达式是一种定义了搜索模式的特征序列,主要是用于字符串的模式匹配,或是字符的匹配。
  2. NLP 通常所需要处理的语料,一部分来自于 web 网页的信息抽取,一部分来自于文本格式的文档

两种语料的特点:

  1. Web 网页具有很强的开发价值,具有时效性强、信息量大、结构稳定、价值高等特点
  2. 文本格式的文档多来源于人为编写或系统生成,其中包含了非结构化文本、半结构化文本、结构化文本

正则表达式的作用:

  1. 将这些文档内容从非结构化转为结构化,以方便后续的文本挖掘
  2. 去噪声(URL 或链接、语气助词、标点符号等)

2.2.1 匹配字符串

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值