2024年Python最全Python 爬取大众点评 50 页数据，最好吃的成都火锅竟是它！

本文链接：https://blog.csdn.net/2301_82241675/article/details/138354113

文章分析了大众点评上的火锅店星级评价与评论数量、人均消费的关系，发现四星以上商户评论数与星级无明显关联，而价格和口味等服务质量对消费者选择有较大影响。通过K-means聚类，作者提出了基于特定条件的推荐策略。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

大众点评已经给出了星级评价，可以看看大致趋势。

在这里插入图片描述

准五星商户最多，可能因为大部分食客都习惯给好评，只有实在不满时才会打出低评有关，造成了评级一般不低，但近满分还是蛮少的。

在本文，我们假设评论数目为饭店的热度，也就是它越火，评论数目越多。

在这里插入图片描述

评论数目大多在1000以内，但是高于2000，甚至高于4000也还存在一些，这些饭店应该是一些网红店。以5000为约束，筛选出饭店均为小龙坎、蜀大侠都非常知名的火锅店。那么评论数量和星级有关系吗？看下图：

在这里插入图片描述

这里取其评论数平均值，发现对于四星以上商户来说，评论数和星级并不关系，但均比低于四星的饭店销量更好。这说明在四星以上之后，人们选择差别不大，但一般不愿意接受评论太差的饭店。

对于笔者这样的学生党来说，影响较大还有人均消费情况。

在这里插入图片描述

成都的火锅店人均消费大部分都在50-100的区间内，高于150的也有一些。对于笔者来讲，吃一顿火锅，人均在50-100是可以接受的，高于100，就要低头看看钱包了（）。那扩展看，人均消费和星级、评论数量有关系吗？

在这里插入图片描述

上图是人均消费和星级的关系，看起来并无任何关系，那说明一些口碑好的火锅店，其实人均也不贵。下面看看人均和评论数目的关系吧。

在这里插入图片描述

通过比较，发现评论数目低于500，人均在50-100区间是最多的。当然这肯定和评论数量、人均消费本身集中于这一阶段有关。

吃火锅，一家店的生意好坏，肯定还和它的特色菜有关，笔者通过jieba分词，将爬取到的推荐菜做了一个词云图，如下。

在这里插入图片描述

笔者最爱的牛肉是特色菜之最啊，尤其是麻辣牛肉，只要去吃火锅，都要来上一份，其次是毛肚、虾滑、鹅肠等等。

接下来是大家都关心的，口味、环境和服务的情况。

在这里插入图片描述

三者得分大多都是集中在8.0-9.2这一阶段，笔者认为，低于7.5分的饭店还是不要去尝试了。同时，星级评价应该也是由这三者得分产生的。

在这里插入图片描述

果然如预想的一向，星级评价越好，它在口味、环境和服务的得分越高。那么口味，环境，服务得分与评论数量，平均价格有关系吗？

在这里插入图片描述

如图所看，并无什么直接关系，但是我们发现口味、环境和服务三者之间存在着非常好的线性关系，于是单独拿出来画了一个较大的图。

在这里插入图片描述

我们并且拟合了线性关系，由于三星商户只有一家，它的情况较为特殊之外，其他星级在口味、环境和服务的关系拟合中保持的相当一致，这也证明我们的猜想，这些变量之间存在线性关系。鉴于笔者本文最大的目的是做推荐，于是，我们进行了K-means聚类，这里取K为3，并且把星级转换为数字，五星对应5分，准五星对应4.5分，以此类推。最终得到了三类，通过作图，看看聚类情况如何吧。

在这里插入图片描述