python爬虫requests源码链家_python 爬取链家网二手房信息(重庆部分区县)

本文介绍了使用Python爬虫requests库获取链家网重庆地区二手房信息的过程,涉及HTML解析、XPath、正则表达式以及数据处理。通过抓取网页,解析HTML,提取关键数据并用pandas进行数据分析,最终用pyecharts绘制房价分布热图。
摘要由CSDN通过智能技术生成

前段时间在实验楼上面看到有爬取链家网租房信息,并利用高德API在地图上标注上班周边区域房源的介绍,就想着做做看。当然,我没有那么高的姿势水平,就爬一下二手房信息得了。

准备:python,requests(url访问),lxml(html解析), tdqm(好看的动态进度条), re(正则),pandas(数据分析), pyecharts(画地图)

第一次发爬虫文章, 就详细点吧。。。。。

一、向网站发送请求,对于一般的网站来说,这个其实是很固定的格式d49cf695fd8339d1a97ba4b876183009449f8a84.png向网站发送请求,得到页面信息

当时是按照北理工的公开课学的爬虫,就延续下来用的requests,当然还有其它的。

一些反扒网站比较严格,所以得另加一点东西,比如cookies,user-agent等等, 在这里我就换了一个请求头,让网站认为是一个浏览器而不是python在访问。

二、第一步得到的就是html页面了,然后就可以开始解析。这里我用的是xpath,当然也有其它的解析方式,比如我最初学的时候就用的beautifulsoup,但是现在全部忘完了, 最暴力的解析方式是正则,但是必须要有很高的技术才行,因为说不定就多爬或

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值