http://www.risfond.com/case/fmcg/26700 ,http://www.risfond.com/case/fmcg/26701,
点击网址下一条就可以发现网址的规律,网址后面的数字是发生了改变的,
所以可以采用字符串格式化跟range函数,for in来进行使用,基础知识附带使用讲解下。
range函数
可以生成一个整数序列,里面只有一个参数默认从0开始,2个参数是含头不含尾,示例如下:
字符串格式化,%s代表字符串,%d代表数字,当不知道用什么的情况下可以用%s代替,format是用{}.format()的方式做到字符串格式化的。
发送请求
for i in range(26700,26716):
url = ‘http://www.risfond.com/case/fmcg/{}’.format(i)
html = urllib.request.urlopen(url).read().decode(‘utf-8’)#urlopen打开网址 read 读取源代码
print(html)
第二步:从源码解析所需要的数据
这里用的是re正则表达式,可以根据一定的规则从源码中匹配出相对应的内容,打个比方说,我去水果店买西瓜,西瓜的特征是果绿色的外壳,红色的果肉,椭圆形状,都是根据这个特征去寻找的,在网站中间也是如此,获取的内容有着共同的标签比如div,而且都是在一样的html布局中,就可以写一个正则,用findall去从源码html中匹配出来。
page_list = re.findall(r’
第三步:数据存储到excel
根据内容,我觉得存储到excel表格里面会比较好,所以对每行也写了一定的注释,大家可以参考下!
newTable = ‘test2019.xls’#表格名称
wb = xlwt.Workbook(encoding=‘utf-8’) #创建excel文件 设置编码
ws = wb.add_sheet(‘rsfd’)#表名称
headData = [‘职位名称’,‘职位地点’,‘时间’,‘行业’,‘招聘时间’,‘人数’,‘顾问’]
for colnum in range(0,7):
ws.write(0,colnum,heData[colnum],xlwt.easyxf(‘font:bold on’))
index = 1
自我介绍一下,小编13年上海交大毕业,曾经在小公司待过,也去过华为、OPPO等大厂,18年进入阿里一直到现在。
深知大多数Python工程师,想要提升技能,往往是自己摸索成长或者是报班学习,但对于培训机构动则几千的学费,着实压力不小。自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!
因此收集整理了一份《2024年Python开发全套学习资料》,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友,同时减轻大家的负担。
既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,基本涵盖了95%以上Python开发知识点,真正体系化!
由于文件比较大,这里只是将部分目录大纲截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频,并且后续会持续更新
如果你觉得这些内容对你有帮助,可以添加V获取:vip1024c (备注Python)
最后
不知道你们用的什么环境,我一般都是用的Python3.6环境和pycharm解释器,没有软件,或者没有资料,没人解答问题,都可以免费领取(包括今天的代码),过几天我还会做个视频教程出来,有需要也可以领取~
给大家准备的学习资料包括但不限于:
Python 环境、pycharm编辑器/永久激活/翻译插件
python 零基础视频教程
Python 界面开发实战教程
Python 爬虫实战教程
Python 数据分析实战教程
python 游戏开发实战教程
Python 电子书100本
Python 学习路线规划
一个人可以走的很快,但一群人才能走的更远。不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎扫码加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!
走的很快,但一群人才能走的更远。不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎扫码加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!**
[外链图片转存中…(img-npwtJnDp-1712706338347)]