排序:
默认
按更新时间
按访问量

利用Python爬取妙笔阁小说网的《我是至尊》小说

由于妙笔阁小说网中大多数小说章节数过大,基本上为几千章。所以挑选后选取了章节数为100多章的小说《我是至尊》。 下面详细描述爬取过程: 1.构建请求头:user_agent = 'Mozilla/5.0 (Windows NT 6.3; Win64; x64) AppleWebKit...

2017-11-30 15:51:54

阅读数:279

评论数:0

利用Python爬取妙笔阁小说网站的小说信息并保存为txt和csv格式

本次爬取的是妙笔阁小说网仙侠系列中所有小说的信息,打开网页会看到如下图所示的小说列表。 根据列表,选择爬取小说的书名、作者、最新更新、简介这四项信息。 在爬取之前,为了防止网站禁止爬取,需构造访问的请求头,模拟浏览器访问该网站。那么如何构建请求头,需要找到访问网站时的代理: ...

2017-11-30 12:08:07

阅读数:372

评论数:1

浅谈对Hadoop中HDFS、MapRecuce及YARN的初步认知

1.Hadoop简要介绍1.1Hadoop是一个能够对大量数据进行分布式处理的软件框架,并且是以一种可靠、高效、可伸缩的方式进行处理的,它具有以下几个方面的特性: • 高可靠性 • 高效性 • 高可扩展性 • 高容错性 • 成本低 • ...

2017-10-27 20:08:02

阅读数:229

评论数:0

提示
确定要删除当前文章?
取消 删除
关闭
关闭