2021-04-13

最新推荐文章于 2022-08-01 14:13:03 发布

eat_good

最新推荐文章于 2022-08-01 14:13:03 发布

阅读量56

点赞数

分类专栏：笔记

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/eat_good/article/details/115664604

版权

笔记专栏收录该内容

5 篇文章 0 订阅

订阅专栏

这是第一篇根据csdb自学一些Python的爬虫技术，能够获得的一些经验。下面介绍一些～
当然这是根据一些博主的见解编写了
😊
(一) 三种网页抓取方法

1、正则表达式：

模块使用C语言编写，速度快，但是很脆弱，可能网页更新后就不能用了。

2、Beautiful Soup

模块使用Python编写，速度慢。

安装：

pip install beautifulsoup4

3、 Lxml

模块使用C语言编写，即快速又健壮，通常应该是最好的选择。

(二) Lxml安装

pip install lxml

如果使用lxml的css选择器，还要安装下面的模块

pip install cssselect

(三) 使用lxml示例

import urllib.request as re

import lxml.html

#下载网页并返回HTML

def download(url,user_agent=‘Socrates’,num=2):

print(‘下载:’+url)

#设置用户代理

headers = {‘user_agent’:user_agent}

request = re.Request(url,headers=headers)

try:

#下载网页

html = re.urlopen(request).read()

except re.URLError as e:

print(‘下载失败’+e.reason)

html=None

if num>0:

#遇到5XX错误时，递归调用自身重试下载，最多重复2次

if hasattr(e,‘code’) and 500<=e.code<600:

return download(url,num-1)

return html

html = download(‘https://tieba.baidu.com/p/5475267611’)

#将HTML解析为统一的格式

tree = lxml.html.fromstring(html)

img = tree.cssselect(‘img.BDE_Image’)
#通过lxml的xpath获取src属性的值，返回一个列表

img = tree.xpath(’//img[@class=“BDE_Image”]/@src’)

x= 0

#迭代列表img,将图片保存在当前目录下

for i in img:

re.urlretrieve(i,’%s.jpg’%x)

x += 1

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。