如何结合Node和Puppeteer做网络爬虫

最新推荐文章于 2024-06-22 09:31:38 发布

Alan-wu

最新推荐文章于 2024-06-22 09:31:38 发布

阅读量597

点赞数

分类专栏： node 文章标签： node puppeteer 爬虫

本文链接：https://blog.csdn.net/weixin_42724176/article/details/105922482

版权

本文介绍了如何使用Node.js和Puppeteer进行网络爬虫的实践。首先解释了爬虫的基本概念和合法使用注意事项，接着详细阐述了Puppeteer的安装过程，包括解决国内网络问题的方法。然后通过爬取网站图片的例子展示了如何使用Puppeteer进行网页内容抓取。文章最后鼓励读者进一步探索Puppeteer的更多功能。

摘要由CSDN通过智能技术生成

相信大家都听说过爬虫，我们也听说过Python是可以很方便地爬取网络上的图片，但是奈何本人不会Python，就只有通过Node来实践一下了。

01 前言

何谓爬虫

其实爬虫用很官方的语言来描述就是“自动化浏览网络程序”，我们不用手动去点击、去下载一些文章或者图片。大家或许用过抢票软件，其实就是不断地通过软件访问铁路官方的接口，达到抢票的效果。但是，这类抢票软件是违法的。

那么怎么判断爬虫是不是违法呢？关于爬虫是否非法其实没有很明确的说法，一直都是中立的态度。爬虫是一种技术，技术本身没有违法的。但是你使用这种技术去爬取不正当的信息、有版权的图片等用于商用，那么你就是违法了。其实我们只要在使用爬虫技术的时候不要去爬个人隐私信息，不要爬取有版权的图片，最重要的是信息不要用于商业化的行为，爬虫不得干扰网站的正常运行等。

说了这么多其实就是要大家谨慎使用这一项技术。

怎么爬

我查了一下资料，使用Node做爬虫的话其实有很多的途径，很多人比较喜欢的就是使用cheerio以及request来爬取。但是我也发现了一个比较好用的工具就是puppeteer，这一项技术是谷歌官方提供的一款工具。它其实就是把人来做的事情变成了调用接口来实现。看了一下官方的文档，主要可以实现以下的功能：puppeteer官方文档

生成页面的屏幕截图和PDF。
爬取SPA（单页应用程序）并生成预渲染的内容（即“ SSR”（服务器端渲染））。
自动执行表单提交，UI测试，键盘输入等。
创建最新的自动化测试环境。使用最新的JavaScript和浏览器功能，直接在最新版本的Chrome中运行测试。
捕获站点的时间线跟踪以帮助诊断性能问题。
测试Chrome扩展程序。

同时也看了一些同学的评价，觉得这个东西是非常的amazing啊！虽然我还没有深入去了解全部的API，但是也算是懂得大概的流程。大家如果官方的文档看不懂的话可以去B站看一下基本的介绍，puppeteer系列教程。

02 安装过程

puppeteer安装

关于这个安装的事情真的是非常的头疼，搞了许久才安装成功。原因就是高高的围墙使得城内的人出不去。所以我们只有换另外一种方法来安装了。

我们直接npm安装的过程默认是要下载浏览器的，我就是在这里一直卡住然后报错，试了好几次都是这样。经过网友们的介绍我们是可以不用在安装puppeteer的时候下载浏览器的，我们可以事后才去下载。

env PUPPETEER_SKIP_CHROMIUM_DOWNLOAD=true npm i puppeteer

我们这样就可以成功安装puppeteer了，接下来我们就要去手动安装浏览器了。那么我们要去哪里下载呢？我要手动下载

这里面非常多的版本号，看了网上的教程我们要选择合适的版本号（不知道随便下载一个可不可以），我们回到项目的根目录下面node_modules/puppeteer/package.json这个目录，查看一下我们的浏览器版本是多少。

我这里就是现实737027的版本号，我们就去手动下载这个浏览器就可以了。大家可以根据自己的版本进行下载。

浏览器引用

我们光安装了之后还不行，还要进行浏览器的引入。这个也是非常的头疼，看了好多的教程都不可以。可能是他们的系统不一样，在这里折腾很久都想放弃了。还好有这篇文章解决了我的问题，我知道是路径有误但我不知道怎么写。

浏览器下载之后我们就解压放到根目录下面，与package.json同级。然后我们在根目录下新建一个index.js文件。

const puppeteer = require("puppeteer");
const fs = require("fs");
const request = require("request");
const path = require

最低0.47元/天解锁文章

Alan-wu

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录