目录
前言
大家好,我叫善念。不说漂亮话,直接开始今天要采集的目标:某宝数据
今天要采用的方式是selenium自动化工具。
简单说下selenium的原理——利用网页元素控制浏览器。
准备
安装selenium模块:
pip install selenium
我采用的是利用selenium控制Chrome浏览器,所以咱们需要下载一个selenium与Chrome的桥梁——Chromedriver插件
下载与你当前谷歌浏览器版本最相近的Chromedriver
那么像我的话,下载 即可。
Windows系统需下载32位,其它的自己看着办。点进去下载win32即可。
那么如何让Python与selenium连接起来呢,这里咱们需要配置一个环境变量,就是把Python与selenium处于同一个目录:
到此为止,咱们的环境就搭建好了。
分析(x0)
登录篇
谈谈selenium与requests的区别:
selenium:操控网页元素,模拟人去控制浏览器,放弃与底层协议的交互,控制于客户端表面(速度慢)
requests:模拟客户端像服务器发送协议请求,处于底层协议的交互。(速度快)
既然是模拟人去控制浏览器就好说了,想要采集某个网站第一步是做什么?
实例化一款需要被控制的浏览器,然后打开该网址:
from selenium import webdriver
driver = webdriver.Chrome()
driver.get('http://www.taobao.com')