python 爬虫餐饮行业 数据分析_Python爬虫实例——爬取美团美食数据!

本文详细介绍了如何使用Python爬虫抓取美团美食数据。通过分析美团美食网页URL参数,理解了搜索关键词和城市ID的构造方式。接着,利用F12开发者工具发现数据以JSON格式通过AJAX加载。最后,构造请求,循环抓取每一页的数据,包括店铺名称、地址、平均消费价格、店铺评分和评价人数,并将结果写入本地文件。此方法适用于根据不同搜索词和城市抓取相关数据。
摘要由CSDN通过智能技术生成

.分析美团美食网页的url参数构成

1)搜索要点

图中有资源哦

美团美食,地址:北京,搜索关键词:火锅

2)爬取的url

3)说明

url会有自动编码中文功能。所以火锅二字指的就是这一串我们不认识的代码%E7%81%AB%E9%94%85。

通过关键词城市的url构造,解析当前url中的bj=北京,/s/后面跟搜索关键词。

这样我们就可以了解到当前url的构造。

2.分析页面数据来源(F12开发者工具)

开启F12开发者工具,并且刷新当前页面:可以看到切换到第二页时候,我们的url没有变化,网站也没有自动进行刷新跳转操作。(web中ajax技术就是在保证页面不刷新,url不变化情况下进行数据加载的技术)

此时我们需要在开发者工具中,找到xhr里面对应当前数据的响应文件。

分析到这里可以得知:我们的数据是以json格式交互。分析第二页的json文件请求地址与第三页json文件的请求地址。

对比发现:offse参数每次翻页增加32,并且limit参数是一次请求的数据量,offse是数据请求的开始元素,q是搜索关键词poi/pcsearch/1?其中的1是北京城市的id编号。

3.构造请求抓取美团美食数据

接下来直接构造请求,循环访问每一页的数据,最终代码如下。

import requests

import re

def start():

for w in range(0, 1600, 32):

#页码根据实际情况x32即可,我这里是设置50页为上限,为

  • 1
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值