python爬取虎扑评论_python爬去虎扑数据信息,完成可视化

首先分析虎扑页面数据

如图我们所有需要的数据都在其中

![image.png](1)

所以我们获取需要的内容直接利用beaitifulsoupui4

``` soup.find_all('a',class_="truetit")

for p in soup.find_all('a',class_="truetit"):

# 获取a标签的内容

print("帖子的内容如下: ")

print(p.get_text())

```

就可以获取到帖子的内容

接下来获取帖子的热门回帖数已经用户信息,首先获取热门回帖数,我的第一想法是用p.next_sibling.next_sibling 来获取(这里要用两次sibing具体原因看官网),结果这样的话发现有很多报错![image.png](2)如图所示!!是因为很多帖子没有热门回帖,所以导致这里没有数据! 这里需要判断下, 但是后续需要获取其他的数据的时候就会出问题,不能再次使用next_sibling了,欣慰兄弟标签就不一定了 !!所以还是使用找到父标签,然后再来处理比较合适。

接下来获取用户的主页信息

方法是获取帖子内容标签的祖父标签也就是如图所示的li标签,然后

grandPaInfo.find("div",class_="author box").a['href']这样就可以获取用户的主页信息

接下来需要获取用户性别

上一步获取到了用户主页信息,接下来我们需要进入这个主页进行分析

如果所示,我们可以使用如下代码获取 用户的性别信息

if soup.find('span', itemprop="gender"):

userSex = soup.find('span', itemprop="gender").get_text()

else:

userSex = "NULL"

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值