python基础教程：在Python中使用NLTK库实现对词干的提取的教程

最新推荐文章于 2024-08-03 20:56:21 发布

adrrry

最新推荐文章于 2024-08-03 20:56:21 发布

阅读量2.4k

点赞数

分类专栏： python 文章标签： python 大数据编程语言

本文链接：https://blog.csdn.net/adrrry/article/details/105567561

版权

本文介绍了如何在Python中使用NLTK库进行词干提取，结合Pandas和IPython进行文本处理。通过PorterStemmer算法处理文本，使用正则表达式分词器，同时探讨了拼写检查和相似度计算在处理用户拼写错误时的作用。

摘要由CSDN通过智能技术生成

@本文来源于公众号：csdn2299，喜欢可以关注公众号程序员学府
这篇文章主要介绍了在Python中使用NLTK库实现对词干的提取的教程,其中还用到了Pandas和IPython,需要的朋友可以参考下
什么是词干提取？

在语言形态学和信息检索里，词干提取是去除词缀得到词根的过程─—得到单词最一般的写法。对于一个词的形态词根，词干并不需要完全相同；相关的词映射到同一个词干一般能得到满意的结果，即使该词干不是词的有效根。从1968年开始在计算机科学领域出现了词干提取的相应算法。很多搜索引擎在处理词汇时，对同义词采用相同的词干作为查询拓展，该过程叫做归并。

一个面向英语的词干提取器，例如，要识别字符串“cats”、“catlike”和“catty”是基于词根“cat”；“stemmer”、“stemming”和“stemmed”是基于词根“stem”。一根词干提取算法可以简化词 “fishing”、“fished”、“fish”和“fisher” 为同一个词根“fish”。
技术方案的选择

Python和R是数据分析的两种主要语言；相对于R，Python更适合有大量编程背景的数据分析初学者，尤其是已经掌握Python语言的程序员。所以我们选择了Python和NLTK库（Natual Language Tookit）作为文本处理的基础框架。此外，我们还需要一个数据展示工具；对于一个数据分析师来说，数据库的冗繁安装、连接、建表等操作实在是不适合进行快速的数据分析，所以我们使用Pandas作为结构化数据和分析工具。
环境搭建

我们使用的是Mac OS X，已预装Python 2.7.

安装NLTK