【NLP】NO3：文本可视化

最新推荐文章于 2022-10-31 00:31:37 发布

VIP文章 c.x.y.07.30

最新推荐文章于 2022-10-31 00:31:37 发布

阅读量402

点赞数

分类专栏： NLP

本文链接：https://blog.csdn.net/MARY197011111/article/details/99876458

版权

常用可视化图：词云、分布图、Document Cards、树状图、网络图、力导向图、叠式图、Word Tree、地理热力图、ThemeRiver、SparkClouds、TextFlow、基于矩阵视图的情感分析可视化。

前端可视化网站：百度的 Echarts https://echarts.baidu.com/echarts2/doc/example.html

一、词云

分词、去停用词、统计词频、绘制词云

#引入所需要的包
import jieba
import pandas as pd
import numpy as np
from scipy.misc import imread
from wordcloud import WordCloud,ImageColorGenerator #词云显示
import matplotlib.pyplot as plt # plt 用于显示图片


#定义文件路径
dir =  "/Users/jianliu/Downloads/chat1/wordcloud/"
#定义语料文件路径
file = "".join([dir,"z_m.csv"])
#定义停用词文件路径
stop_words = "".join([dir,"stopwords.txt"])
#定义wordcloud中字体文件的路径
simhei = "".join([dir,"simhei.ttf"])
#读取语料
df = pd.read_csv(file, encoding='utf-8')
#如果存在nan，删除
df.dropna(inplace=True)
#将content一列转为list
content=df.content.values.tolist()
#用jieba进行分词操作
segment=[]
for line in content:
    try:
        segs=jieba.cut_for_search

最低0.47元/天解锁文章

c.x.y.07.30

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
【NLP】NO3：文本可视化

常用可视化图：词云、分布图、Document Cards、树状图、网络图、力导向图、叠式图、Word Tree、地理热力图、ThemeRiver、SparkClouds、TextFlow、基于矩阵视图的情感分析可视化。一、词云分词、去停用词、统计词频、绘制词云#引入所需要的包import jiebaimport pandas as pdimport numpy as npfrom s...
复制链接

扫一扫