python爬虫知识图谱_电影知识图谱问答（一）|爬取豆瓣电影与书籍详细信息

最新推荐文章于 2023-01-14 16:30:00 发布

weixin_39786617

最新推荐文章于 2023-01-14 16:30:00 发布

阅读量990

点赞数

文章标签： python爬虫知识图谱

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39786617/article/details/111436057

版权

最近在做关于知识图谱方面的实验，需要一些数据，于是爬取了豆瓣上关于电影和书籍的信息。两天时间内共爬取20W+条数据，包括电影信息、电影演员信息、书籍信息、书籍作者信息，GitHub链接为https://github.com/weizhixiaoyi/DouBan-Spider。

1. 数据说明电影信息包括电影id、图片链接、名称、导演名称、编剧名称、主演名称、类型、制片国家、语言、上映日期、片长、季数、集数、其他名称、剧情简介、评分、评分人数，共67245条数据信息。虽说是电影信息，但其中也包括电视剧、综艺、动漫、纪录片、短片。

电影演员信息包括演员id、姓名、图片链接、性别、星座、出生日期、出生地、职业、更多中文名、更多外文名、家庭成员、简介，共89592条数据信息。这里所指的演员包括电影演员、编剧、导演。

书籍信息包括书籍id、图片链接、姓名、子标题、原作名称、作者、译者、出版社、出版年份、页数、价格、内容简介、目录简介、评分、评分人数，共64321条数据信息。

书籍作者信息包括作者id，姓名、图片链接、性别、出生日期、国家、更多中文名、更多外文名、简介，共6231条数据信息。这里作者包括书籍作者和译者。

2. 配制环境系统环境：ubuntu 18.04

python环境：python3.6

python依赖包：requests, bs4, redis, yaml, multiprocessing

3. 爬虫思路

3.1电影爬虫

打开上述Request URL，能够看到一系列电影信息，我们只需要拿到其中的id即可。为了确保不重复爬取相同的电影，每拿到一个id之后，都存到redis已爬取队列之中。如果下次再

最低0.47元/天解锁文章

weixin_39786617

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
python爬虫知识图谱_电影知识图谱问答（一）|爬取豆瓣电影与书籍详细信息

最近在做关于知识图谱方面的实验，需要一些数据，于是爬取了豆瓣上关于电影和书籍的信息。两天时间内共爬取20W+条数据，包括电影信息、电影演员信息、书籍信息、书籍作者信息，GitHub链接为https://github.com/weizhixiaoyi/DouBan-Spider。1. 数据说明电影信息包括电影id、图片链接、名称、导演名称、编剧名称、主演名称、类型、制片国家、语言、上映日期、片长、季...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。