步入数据分析第一天（看代码）

最新推荐文章于 2023-12-14 22:51:08 发布

Walker_xjh

最新推荐文章于 2023-12-14 22:51:08 发布

阅读量100

点赞数

本文链接：https://blog.csdn.net/walker_xjh/article/details/119283156

版权

该博客主要讲述了如何利用Python和MongoDB从知乎平台抓取关注者数量超过1w的用户数据。通过设置代理和使用特定的请求头，脚本遍历并存储了这些用户的相关信息，如用户名、头衔、粉丝数等。同时，它还检查已抓取的用户，避免重复，并将新发现的符合条件的用户加入到爬取列表中。整个过程旨在构建一个包含大量高影响力知乎用户的数据库。

摘要由CSDN通过智能技术生成

# coding:utf8

# 抓取粉丝数过 1w 用户

import requests

import pymongo

import time

import pickle

def get_ready(ch='user_pd',dbname='test'):

'''数据库调用'''

global mycol, myclient,myhp

myclient = pymongo.MongoClient("mongodb://localhost:27017/")

mydb = myclient[dbname]

mycol = mydb[ch]

get_ready()

ss = mycol.find({})

se = {1,} # 去重集合

se2 = ['GOUKI9999','zhang-jia-wei'] # 爬取的列表

# with open(r'C:\Users\yc\Desktop\used.txt', 'rb') as f: # 读取

# used = pickle.load(f)

used={1,}

sed = {}

for s in ss:

if s['follower_count']>=10000: # 粉丝数大于10000

sed[s['user_id']] = sed.get(s['user_id'],0) + 1

if sed[s['user_id']] == 1:

se.add(s['user_id'])

se2.append(s['user_id'])

leng = len(se2)

print(leng)

proxies = {

"http": "http://spiderbeg:pythonbe@106.52.85.210:8000",

"https": "http://spiderbeg:pythonbe@106.52.85.210:8000",

}

headers = {

'user-agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',

'cookie':'your_cookie（用户主页面）'

}

for i,url_id in enumerate(se2): # 爬取

if i>=0:

print(i,' ', end='') # url个数

if url_id not in used: # 是否使用过

used.add(url_id)

nums = 500

off = 0

while True:

url2 = 'https://www.zhihu.com/api/v4/members/' + url_id + '/followees?include=data%5B*%5D.answer_count%2Carticles_count%2Cgender%2Cfollower_count%2Cis_followed%2Cis_following%2Cbadge%5B%3F(type%3Dbest_answerer)%5D.topics&offset=' + str(off) + '&limit=' + str(nums)

r2 = requests.get(url2, headers=headers,proxies=proxies)

time.sleep(0.5)

c = 0

if 'error' in r2.json():

if r2.json()['error']['code'] in {310000, 310001}:

break

else:

raise NameError('页面错误')

used.add(url_id) # 判断是否使用

for d in r2.json()['data']:

z = {}

c+=1