const puppeteer = require(“puppeteer”);
const fs = require(“fs”);
const request = require(“request”);
const path = require(“path”);
//配置路径,关键!
const pathToExtension = require(“path”).join(
__dirname,
“./chrome-win/chrome.exe”
);
最后我的项目目录:
我们都设置好了之后我们就开始选取一个网站进行测试了,我这里就选择了这个来爬取图片。
其实我们知道万物皆可爬,只要分析对了就好。前端最熟悉不过的F12走一波就好。看了一下大概结构是长这样的,准备好了之后开始撸码。
反手一写(CV)就出来这样的代码。
const puppeteer = require(“puppeteer”);
const fs = require(“fs”);
const request = require(“request”);
const path = require(“path”);
let i = 2;//页数
async function netbian(i) {
const pathToExtension = require(“path”).join(
__dirname,
“./chrome-win/chrome.exe”
);
const browser = await puppeteer.launch({
headless: false,
executablePath: pathToExtension,
});
const page = await browser.newPage();
await page.goto(http://pic.netbian.com/4kfengjing/index_${i}.html
);//为了方便从第二页开始
let images = await page.$$eval(“ul>li>a>img”, (el) =>//图片节点,API可查看官方介绍
el.map((x) => “http://pic.netbian.com” + x.getAttribute(“src”))//获取图片的src地址
);
mkdirSync(./images
); // 存放目录
for (m of images) {
await downloadImg(m, “./images/” + new Date().getTime() + “.jpg”);
}
netbian(++i);//下一页,具体结束页可以自己限制
// 关闭
await browser.close();
}
netbian(i);//这里执行
// 同步创建目录
function mkdirSync(dirname) {
if (fs.existsSync(dirname)) {
return true;
} else {
if (mkdirSync(path.dirname(dirname))) {
fs.mkdirSync(dirname);
return true;
}
}
return false;
}
// 下载文件 保存图片
async function downloadImg(src, path) {
return new Promise(async function (resolve, reject) {
let writeStream = fs.createWriteStream(path);
let readStream = await request(src);
await readStream.pipe(writeStream);
readStream.on(“end”, function () {
console.log(“文件下载成功”);
});
readStream.on(“error”, function () {
console.log(“错误信息:” + err);
});
writeStream.on(“finish”, function () {
console.log(“文件写入成功”);
writeStream.end();
resolve();
});
});
}
我们直接在根目录运行node index.js就可以了。执行之后我们发现多了一个images目录,里面就是我们的图片了。
最后
不知道你们用的什么环境,我一般都是用的Python3.6环境和pycharm解释器,没有软件,或者没有资料,没人解答问题,都可以免费领取(包括今天的代码),过几天我还会做个视频教程出来,有需要也可以领取~
给大家准备的学习资料包括但不限于:
Python 环境、pycharm编辑器/永久激活/翻译插件
python 零基础视频教程
Python 界面开发实战教程
Python 爬虫实战教程
Python 数据分析实战教程
python 游戏开发实战教程
Python 电子书100本
Python 学习路线规划
网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。
一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!