Python 爬取网页数据的两种方法

本文介绍了使用Python进行网络抓取的方法,包括用pandas库读取和解析网页数据,以及利用urllib库抓取数据并写入Excel文件。首先,通过PyCharm下载并安装pandas库,然后使用`pd.read_html()`函数从指定URL获取HTML内容。接着,展示了如何使用urllib请求网页内容并将其写入到Excel表格中。
摘要由CSDN通过智能技术生成

网络抓取是从任何网站或任何其他信息源中提取数据的过程,以你想要查看的格式保存在你的系统中;

包含格式很多,例如CSV、Excel等;文件、XML、JSON等等。Python是最常见的网页抓取语言之一;对于任何网络抓取活动,Python被认为是确保此过程无任何错误进行的最佳方法;

2. 使用pandas 爬取网页数据

2.1 打开网页

打开一个网页,将网址复制下来;

2.2 打开 PyCharm 编译器

先下载pandas库,【文件】=>【设置】=>【项目:xxx】=>【项目解释器】(【File】=>【Settings…】=>【project:xxx】=>【Python Interpreter】),点击+号,在搜索框中输入“pandas”,在下方列表中选中“pandas”,点击安装,等待提示安装完成即可;

2.回到Pycharm输入以下代码

import pandas as pd     #导入pandas库

html = "https://mobile.anjuke.com/xf/fj-nn/2020/"  #将要爬取数据的网站网址复制到此
date = pd.read_html(html)       #运用pd.read_html读取网站数据
print(date)     #输出爬取到的数据

3.运行结果如下所示:

3.使用urllib爬取网页数据并写入Excel表

3.1 下载 urllib 库

与上述方法一致,这里就不赘述了

3.2 代码如下

import urllib.request       #导入urllib库

url = urllib.request.urlopen("https://fangjia.gotohui.com/show-39181")        #需要抓取数据的网站
data = url.read()
dt1 = open("D:/Code/data/2.xls","wb")       #xls表的位置,会自动生成xls表
dt1.write(data)   #将数据写入D:/Code/data/2.xls表中
dt1.close()
print(data)

3.3 运行结果如下

打开目录下的2.xls表,即可看到爬取的数据;

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值