python爬虫详细步骤-Python爬虫实践入门，超详细

最新推荐文章于 2024-08-17 20:45:04 发布

weixin_37988176

最新推荐文章于 2024-08-17 20:45:04 发布

阅读量317

点赞数

1、前言

学习Python二个多月啦，周末时开始兴趣学习爬虫，虽然有点概念，但是也折腾了大半天，下面就开始简要记录一下吧。

2、需要的准备

Python：需要基本的python语法基础

requests：专业用于请求处理，requests库学习文档中文版

lxml：其实可以用pythonth自带的正则表达式库re，但是为了更加简单入门，用 lxml 中的 etree 进行网页数据定位爬取。

这里特别注意：不管你是为了Python就业还是兴趣爱好，记住：项目开发经验永远是核心，如果你没有2020最新python入门到高级实战视频教程，可以去小编的Python交流.裙：七衣衣九七七巴而五（数字的谐音）转换下可以找到了，里面很多新python教程项目，还可以跟老司机交流讨教！

通过pip安装 requests 和 lxml 库，在终端输入：

pip install requests

pip install lxml

复制代码

注：如果是安装到Python3就用pip3 install

下载过程成功的输出：

Collecting lxml

Cache entry deserialization failed, entry ignored

Downloading https://files.pythonhosted.org/packages/00/fd/5e65f293e366a63198dade275b886e5d24752367c2e67e3993023b0d58ef/lxml-4.2.3-cp36-cp36m-macosx_10_6_intel.macosx_10_9_intel.macosx_10_9_x86_64.macosx_10_10_intel.macosx_10_10_x86_64.whl (8.7MB)

100% |████████████████████████████████| 8.7MB 821kB/s

Installing collected packages: lxml

Successfully installed lxml-4.2.3

复制代码

注：如果安装过程遇到任何问题，请谷歌吧，如果网上找不到答案，也不要问我！找不到答案我直播吃翔！！！

3、实践过程

为了这过程有点兴趣，我找了一个美图的网站，爬虫了一波图片~

下载页面html内容：

page = 'https://www点aitaotu点com/guonei/36350.html'

data = requests.get(page).text

dom = etree.HTML(data)

复制代码

解析(定位)元素:

title_path = '//*[@id="photos"]/h1/text()'

totalpage_path = '//*[@id="picnum"]/span[2]/text()'

image_path = '//*[@id="big-pic"]/p/a/img'

复制代码

这里的xpath怎么获取，就是网页里面，打开开发者检查元素工具，在safari和chrome都有这个功能：

注意：不管你是为了Python就业还是兴趣爱好，记住：项目开发经验永远是核心，如果你没有2020最新python入门到高级实战视频教程，可以去小编的Python交流.裙：七衣衣九七七巴而五（数字的谐音）转换下可以找到了，里面很多新python教程项目，还可以跟老司机交流讨教！

本文的文字及图片来源于网络加上自己的想法,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。

weixin_37988176

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。