你们都说淘宝是最难爬的网站了？用我这个方法包你学会！

最新推荐文章于 2024-07-28 16:52:45 发布

2401_84140463

最新推荐文章于 2024-07-28 16:52:45 发布

阅读量345

点赞数 3

分类专栏： 2024年程序员学习文章标签：服务器运维

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84140463/article/details/137809410

版权

2024年程序员学习专栏收录该内容

80 篇文章

订阅专栏

先自我介绍一下，小编浙江大学毕业，去过华为、字节跳动等大厂，目前阿里P7

深知大多数程序员，想要提升技能，往往是自己摸索成长，但自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年最新Python全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上Python知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

如果你需要这些资料，可以添加V获取：vip1024c （备注Python）

正文

DecryptLogin模块；

pyecharts模块；

以及一些Python自带的模块。

既然说了是模拟登录相关的爬虫小案例，首先自然是要实现一下淘宝的模拟登录啦。这里还是利用我们开源的DecryptLogin库来实现，只需三行代码即可：

‘’‘模拟登录淘宝’‘’

@staticmethod

def login():

lg = login.Login()

infos_return, session = lg.taobao()

return session

另外，顺便提一句，经常有人想让我在DecryptLogin库里加入cookies持久化功能。其实你自己多写两行代码就能实现了：

if os.path.isfile(‘session.pkl’):

self.session = pickle.load(open(‘session.pkl’, ‘rb’))

else:

self.session = TBGoodsCrawler.login()

f = open(‘session.pkl’, ‘wb’)

pickle.dump(self.session, f)

f.close()

我真不想在这个库里添加这个功能，后面我倒是想添加一些其他爬虫相关的功能，这个之后再说吧。好的，偏题了，言归正传吧。接着，我们去网页版的淘宝抓一波包吧。比如F12打开开发者工具后，在淘宝的商品搜索栏里随便输入点东西，就像这样：

全局搜索一下诸如search这样的关键词，可以发现如下链接：

看看它返回的数据是啥：

看来应该没错了。另外，如果小伙伴们自己实战的时候没有找到这个接口api，可以尝试再点击一下右上角的下一页商品按钮：

这样就肯定能抓到这个请求接口啦。简单测试一下，可以发现尽管请求这个接口所需携带的参数看上去很多，但实际上必须要提交的参数只有两个，即：

q: 商品名称 s: 当前页码的偏移量

好啦，根据这个接口，以及我们的测试结果，现在就可以愉快地开始实现淘宝商品数据的抓取啦。具体而言，主代码实现如下：

‘’‘外部调用’‘’

def run(self):

search_url = ‘https://s.taobao.com/search?’

while True:

goods_name = input('请输入想要抓取的商品信息名称: ')

offset = 0

page_size = 44

goods_infos_dict = {}

page_interval = random.randint(1, 5)

page_pointer = 0

while True:

params = {

‘q’: goods_name,

‘ajax’: ‘true’,

‘ie’: ‘utf8’,

‘s’: str(offset)

}

response = self.session.get(search_url, params=params)

if (response.status_code != 200):

break

response_json = response.json()

all_items = response_json.get(‘mods’, {}).get(‘itemlist’, {}).get(‘data’, {}).get(‘auctions’, [])

if len(all_items) == 0:

break

for item in all_items:

if not item[‘category’]:

continue

goods_infos_dict.update({len(goods_infos_dict)+1:

{

‘shope_name’: item.get(‘nick’, ‘’),

‘title’: item.get(‘raw_title’, ‘’),

‘pic_url’: item.get(‘pic_url’, ‘’),

‘detail_url’: item.get(‘detail_url’, ‘’),

‘price’: item.get(‘view_price’, ‘’),

‘location’: item.get(‘item_loc’, ‘’),

‘fee’: item.get(‘view_fee’, ‘’),

‘num_comments’: item.get(‘comment_count’, ‘’),

‘num_sells’: item.get(‘view_sales’, ‘’)

}

})

print(goods_infos_dict)

self.__save(goods_infos_dict, goods_name+‘.pkl’)

offset += page_size

（1）Python所有方向的学习路线（新版）

这是我花了几天的时间去把Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

最近我才对这些路线做了一下新的更新，知识体系更全面了。

在这里插入图片描述

（2）Python学习视频

包含了Python入门、爬虫、数据分析和web开发的学习视频，总共100多个，虽然没有那么全面，但是对于入门来说是没问题的，学完这些之后，你可以按照我上面的学习路线去网上找其他的知识资源进行进阶。

在这里插入图片描述

（3）100多个练手项目

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了，只是里面的项目比较多，水平也是参差不齐，大家可以挑自己能做的项目去练练。

在这里插入图片描述

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化的资料的朋友，可以添加V获取：vip1024c （备注python）

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！
ic_center)

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化的资料的朋友，可以添加V获取：vip1024c （备注python）
[外链图片转存中…(img-bMe61oDg-1713230741810)]

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。