cookie模拟登陆爬取药智网中药材数据库数据

最新推荐文章于 2024-04-18 20:53:32 发布

Lida1997

最新推荐文章于 2024-04-18 20:53:32 发布

阅读量2.4k

点赞数

分类专栏： python爬虫文章标签： python爬虫 cookie 模拟登录 python3 药智网

本文链接：https://blog.csdn.net/Lida1997/article/details/80718801

版权

本文介绍了如何使用Python模拟登录药智网并利用cookie抓取中药材数据库的标题和内容。首先注册账号并登录，然后通过观察页面URL规律发现数据分布，接着在开发者工具中获取请求头部的cookie，最后编写爬虫代码抓取特定网页信息。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

第一步：注册一个你的账号

第二步：登录账号

第三步：发现我们要找的数据在https://db.yaozh.com/zhongyaocai/1.html这个网页里，一共10225条数据其实就只用修改这个网页的最后那个数字就行。

第四步：按F12再按F5检查元素，找到一个带请求头部的元素，复制你的cookie

第五步：抓取一个网页的中药材标题及内容

from bs4 import BeautifulSoup
import urllib
import requests 
header = {'User-Agent':'Mozilla/5.0 (Windows NT 6.2) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.12 Safari/535.11'} 
cookie={'cookie':'你的cookie'}
value=[]
th=[]
afterURL = "https://db.yaozh.com/zhongyaocai/600.html"        # 想要爬取的登录后的页面  
html = requests.get(afterURL,cookies=cookie, headers = header).text # 获得登陆后的响应信息，使用之前的cookie  
bsobj=BeautifulSoup(html)
f=bsobj.findAll("span",{"class":"toFindImg"})   #抓取的属性内容