用Python来描述红楼梦里的关系

本文使用Python的jieba库处理红楼梦TXT文件,通过分词和定制词典识别人物,建立人物关系表和比重表,并利用pyecharts绘制关系图表,揭示红楼梦中人物的紧密联系。
摘要由CSDN通过智能技术生成

数据准备

  1. 红楼梦 TXT 文件一份
    2.金陵十二钗 + 贾宝玉 人物名称列表
    3.人物列表内容如下:

宝玉 nr

黛玉 nr

宝钗 nr

湘云 nr

凤姐 nr

李纨 nr

元春 nr

迎春 nr

探春 nr

惜春 nr

妙玉 nr

巧姐 nr

秦氏 nr

这份列表,同时也是为了做分词时使用,后面的 nr 就是人名的意思。

数据处理
读取数据并加载词典

 with open("红楼梦.txt", encoding='gb18030') as f: honglou = f.readlines() jieba.load_userdict("renwu_forcut") renwu_data = pd.read_csv("renwu_forcut", header=-1) mylist = [k[0].split(" ")[0] for k in renwu_data.values.tolist()] 

这样,我们就把红楼梦读取到了 honglou 这个变量当中,同时也通过 load_userdict 将我们自定义的词典加载到了 jieba 库中。

对文本进行分词处理并提取

tmpNames = [] names = {
   } relationships = {
   } for h in honglou: h.replace("贾妃", "元春") h.replace("李宫
  • 0
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值