文末有福利领取哦~
👉一、Python所有方向的学习路线
Python所有方向的技术点做的整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。
👉二、Python必备开发工具
👉三、Python视频合集
观看零基础学习视频,看视频学习是最快捷也是最有效果的方式,跟着视频中老师的思路,从基础到深入,还是很容易入门的。
👉 四、实战案例
光学理论是没用的,要学会跟着一起敲,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。(文末领读者福利)
👉五、Python练习题
检查学习结果。
👉六、面试资料
我们学习Python必然是为了找到高薪的工作,下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料,并且有阿里大佬给出了权威的解答,刷完这一套面试资料相信大家都能找到满意的工作。
👉因篇幅有限,仅展示部分资料,这份完整版的Python全套学习资料已经上传
网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。
一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!
目录
前言
==
最近在出差,发现住的宾馆居然有小强。所以出差无聊之际,写了点爬虫的代码玩玩,问就是应景。本篇文章主要是爬取CSDN全站综合热榜的100个标题,然后分词提取关键词,统计一下词频。
我想了下,对于其他博主还是有用的,可以看看什么标题可以上热榜,就分享一下吧。顺便把我解决各类问题的方法,说一说。
环境
==
使用的IDE为:spyder(有看着界面不习惯的,忍一下,不关键)
页面爬取使用chromedriver,至于原因我后面会说。
分词器:jieba
爬取页面地址:https://blog.csdn.net/rank/list
爬虫代码
====
这里说一下为什么没有用requests直接获取页面源码,主要是因为该页面并不能直接请求出源码。而是通过页面滚动到最下方,才可以显示出全部的100个排名的文章。
所以我的思路是,使用chromedriver,然后执行js实现滚动页面到最下方。
这里需要说明一下chromedriver的下载,需要根据你google浏览器的版本来。我的笔记本事mac,可以点击左上角的Chrome,再点击关于Google Chrome看看自己的浏览器版本。
分享一下chromedriver的下载地址:google chrome driver下载地址
简单说明一下driver的原理,就是模拟浏览器打开url的操作,就像我们手点一样,具体原理改天可以再聊聊。
不废话了,上爬虫工具代码
#!/usr/bin/env python3
-- coding: utf-8 --
“”"
Created on Thu Nov 4 17:15:06 2021
@author: huyi
“”"
from selenium import webdriver
import time
=============================================================================
爬取动态下滑加载网页
=============================================================================
def pa(url):
driver = webdriver.Chrome(‘/usr/local/bin/chromedriver’)
driver.get(url)
js = ‘’’
let height = 0
let interval = setInterval(() => {
window.scrollTo({
top: height,
behavior: “smooth”
});
height += 500
}, 500);
setTimeout(() => {
clearInterval(interval)
}, 20000);
‘’’
driver.execute_script(js)
time.sleep(20)
source = driver.page_source
driver.close()
return source
代码说明
1、代码主要是一个工具方法,使用diver打开浏览器。然后通过js代码,模拟向下滚动的操作。
2、根据你的网络条件,里面的超时时间你可以调整。避免还没有滚动到最下面就结束了,因为我宾馆的网比较卡,所以设置的比较大。
3、返回页面源码,为了后面的xpath解析。
验证一下
OK,已经拿到了页面源码了。
关键词提取代码
=======
我们把关键词提取的方法也准备一下。不废话,上代码。
#!/usr/bin/env python3
-- coding: utf-8 --
“”"
Created on Thu Nov 4 21:53:22 2021
@author: huyi
“”"
import jieba.analyse
网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。
一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!