第一步:注册一个你的账号
第二步:登录账号
第三步:发现我们要找的数据在https://db.yaozh.com/zhongyaocai/1.html这个网页里,一共10225条数据其实就只用修改这个网页的最后那个数字就行。
第四步:按F12再按F5检查元素,找到一个带请求头部的元素,复制你的cookie
第五步:抓取一个网页的中药材标题及内容
from bs4 import BeautifulSoup
import urllib
import requests
header = {'User-Agent':'Mozilla/5.0 (Windows NT 6.2) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.12 Safari/535.11'}
cookie={'cookie':'你的cookie'}
value=[]
th=[]
afterURL = "https://db.yaozh.com/zhongyaocai/600.html" # 想要爬取的登录后的页面
html = requests.get(afterURL,cookies=cookie, headers = header).text # 获得登陆后的响应信息,使用之前的cookie
bsobj=BeautifulSoup