今天我们用R语言来处理一下。我们会用到一下技术:、
(1)正则表达式
(2)词频统计
(3)文本可视化
(4)ggplot2绘图
(5)中文分词
一.数据处理
首先我们要讲QQ聊天记录导出成txt文件,至于怎么导,我相信大家都会,不会自行百度。导出来之后我们打开文件看看
首先读入数据
root<-"C:/Users/henry wang/Documents/"
file<-paste(root,"18考研备战群.txt",sep="")
#读取数据
file.data<-scan(file,what = "",sep="\n",encoding = "UTF-8")
通过head(file.data)查看数据如下,可以看到前5行都是一些没有的信息,我们需要删掉。