本文主要来介绍使用NLP来进行文本相似度分析
什么是NLP?
NLP(Natural Language Processing,自然语言处理)是研究实现人与计算机之间用自然语言进行有效通信的各种理论和方法,也是AI领域中一个最重要、最艰难的方向。近些年,NLP在中文分词、词性标注、词汇语义、句法解析方面均获得了很大的突破。大量的技术都应用于商业实践,并在商业领域获得了良好的市场和经济效益。文本方面主要有:基于自然语言理解的智能搜索引擎和智能检索、智能机器翻译、自动摘要与文本综合、文本分类与文件整理、自动阅卷系统、信息过滤与垃圾邮件处理、文学研究与古文研究、语法校对、文本数据挖掘与智能决策、基于自然语言的计算机程序设计等。语音方面主要有:机器同声传译、智能客户服务、聊天机器人、语音挖掘与多媒体挖掘、多媒体信息提取与文本转化、对残疾人智能帮助系统等。
文本相似符度分析步骤
- 把评论翻译成机器看的懂的语言(把中文/英文 翻译成数字)
- 使用机器看的懂得算法轮询去比较每一条和所有评论的相似程度
- 把相似的评论挑出来
把评论翻译成机器看的懂的语言步骤
1、分词:把句子拆分成词语(主要针对中文,英文不需要分词)
2、制作词袋模型(bag-of-word):可以理解成装着所有词的袋子
3、用词袋模型制作语料库(corpus)
4、把评论变成词向量