1024到了，作为一个Python程序员，必须整点肤白貌美的爬虫代码给你们！(1)

2401_84118608

于 2024-04-23 02:16:59 发布

阅读量727

点赞数 22

分类专栏： 2024年程序员学习文章标签： python 爬虫开发语言

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84118608/article/details/138100577

版权

2024年程序员学习专栏收录该内容

12 篇文章 0 订阅

订阅专栏

收集整理了一份《2024年最新Python全套学习资料》免费送给大家，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上Python知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来

如果你需要这些资料，可以添加V无偿获取：hxbc188 （备注666）

正文

import os

自动创建文件夹

import requests

requests 爬虫包需要下载 pip install requests

from bs4 import BeautifulSoup

网页选择器 pip install bs4

然后我们就要开始模拟浏览器

headers = {

‘user-agent’:

‘Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36’,

反盗链

‘referer’: ‘https://www.mzitu.com/’

}

既然我们要下载，当然要有文件夹去保存对吧，这里就实现自动创建文件夹，不用我们去额外创建。

def get_girls(url):

自动创建文件夹

if not os.path.exists(‘./学习资料/’):

os.mkdir(‘./学习资料/’)

当然，为了不让你的小秘密被别人看到，咱们这里就把它命名为学习资料吧~

在这里插入图片描述

我们现在来发送请求，http协议中有几种请求方法：

get 获取数据
post 数据提交 [账号密码提交]

html = requests.get(url, headers=headers).text

print(html)

对刚刚抓取到的数据进行二次筛选

需要两个参数，想要二次提取的网页 html变量临时保存了。

html解析库 lxml pip install lxml

html解析库可以将html代码转成我们的python对象

soup = BeautifulSoup(html, ‘lxml’)

通过刚刚分析得出一个结论，一张图片是由img标签保存的，li标签包含一个img标签。如果我们获取了所有的li标签，相当于获取到了所有的img标签，因为一个ul标签包含了所有的li标签，所以获取一个ul就相当于获取到了所有的li标签。

遍历所有的li标签

all_list = soup.find(‘ul’, id=‘pins’).find_all_next(‘li’)

for _ in all_list:

girl_title = _.get_text()

girl_url = _.find(‘img’)[‘data-original’]

print(girl_title, girl_url)

最后

不知道你们用的什么环境，我一般都是用的Python3.6环境和pycharm解释器，没有软件，或者没有资料，没人解答问题，都可以免费领取（包括今天的代码），过几天我还会做个视频教程出来，有需要也可以领取~

给大家准备的学习资料包括但不限于：

Python 环境、pycharm编辑器/永久激活/翻译插件

python 零基础视频教程

Python 界面开发实战教程

Python 爬虫实战教程

Python 数据分析实战教程

python 游戏开发实战教程

Python 电子书100本

Python 学习路线规划

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

如果你需要这些资料，可以添加V无偿获取：hxbc188 （备注666）

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！
*

如果你需要这些资料，可以添加V无偿获取：hxbc188 （备注666）
[外链图片转存中…(img-nQqZisR1-1713809850007)]

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

关注

22
点赞
踩
13

收藏

觉得还不错? 一键收藏
0
评论
1024到了，作为一个Python程序员，必须整点肤白貌美的爬虫代码给你们！(1)

不知道你们用的什么环境，我一般都是用的Python3.6环境和pycharm解释器，没有软件，或者没有资料，没人解答问题，都可以免费领取（包括今天的代码），过几天我还会做个视频教程出来，有需要也可以领取~给大家准备的学习资料包括但不限于：Python 环境、pycharm编辑器/永久激活/翻译插件python 零基础视频教程Python 界面开发实战教程Python 爬虫实战教程Python 数据分析实战教程python 游戏开发实战教程Python 电子书100本。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。