Python爬虫入门教程【15】：煎蛋网XXOO图片抓取

最新推荐文章于 2021-03-12 21:12:18 发布

追梦IT男

最新推荐文章于 2021-03-12 21:12:18 发布

阅读量4.9k

点赞数

文章标签： Python 数据挖掘爬虫编程语言

本文链接：https://blog.csdn.net/wcg541/article/details/97393683

版权

本文是一篇Python爬虫教程，针对煎蛋网的XXOO图片进行抓取。首先分析网站，发现只需模拟访问即可，接着介绍如何使用相关库模拟浏览器行为。在获取数据后，通过编写get_content函数处理网页源码，最终实现图片的下载。

摘要由CSDN通过智能技术生成

今天写一个爬虫爱好者特别喜欢的网站煎蛋网http://jandan.net/ooxx，这个网站其实还是有点意思的，网站很多人写了N多的教程了，各种方式的都有，当然网站本身在爬虫爱好者的不断进攻下，也在不断的完善，反爬措施也很多，今天我用selenium在揍他一波。

整体看上去，煎蛋网的妹子图质量还是可以的，不是很多，但是还蛮有味道的，这可能也是爬虫er，一批一批的奔赴上去的原因。

1. 网站分析

这个网站如果用 selenium 爬取，其实也没什么要分析的,模拟访问就行，导入必备的模块。

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from lxml import etree
import requests

import time

我使用的是PhantomJS 去加载浏览器，关于这个PhantomJS，去互联网搜索一下吧，资料大把，会看的很爽的，总之呢，它可以模拟一个真实的浏览器做

最低0.47元/天解锁文章

追梦IT男

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫