Python爬虫实现验证码登录

最新推荐文章于 2024-06-09 17:42:29 发布

{石磊}

最新推荐文章于 2024-06-09 17:42:29 发布

阅读量1.1k

点赞数 1

分类专栏： python3 爬虫文章标签： python3 爬虫

本文链接：https://blog.csdn.net/shilei123456789666/article/details/78926279

版权

python3 爬虫专栏收录该内容

12 篇文章 1 订阅

订阅专栏

原创 2016年11月13日 15:17:13

标签：
cookie /
python /
爬虫

很多网站为了避免被恶意访问，需要设置验证码登录，避免非人类的访问，Python爬虫实现验证码登录的原理则是先到登录页面将生成的验证码保存下来，然后人为输入后，包装后再POST给服务器，实现验证，这里还涉及到了Cookie，其实Cookie保存在本地主机上，避免用户重复输入用户名和密码，在连接服务器的时候将访问连接和Cookie组装起来POST给服务器。这里涉及到了两次向服务器POST，一次是Cookie,这里还自行设计想要Cookie的内容，由于是要登录，Cookie中存放的则是用户名和密码。第二次POST则是向服务器提交验证。

这里用到Python3,主要用到的包是re urllib.request http.cookiejar

上代码，借鉴了别人的代码~~~

[python]view plain copy 
    
 import re  
 import urllib.request  
 import http.cookiejar  
 #from http.comkie import CookieJar  上面那句和这句等同  
   
 loginurl='https://www.douban.com/accounts/login'  
 cookie = http.cookiejar.CookieJar()  
 opener = urllib.request.build_opener(urllib.request.HTTPCookieProcessor)#在已存的Cookie下建立连接  
   
 params={}  
 params['form_email']='用户名'  
 params['form_password']='密码'#这里写上已有的用户名和密码  
 params['source']='http://www.douban.com/accounts/login'  
   
 #从首页提交登陆  
 response = opener.open(loginurl,urllib.parse.urlencode(params).encode('utf-8'))#urllib.parse.urlencode(params).encode('utf-8')这个是向服务  
 #器POST的内容，可以打印一下response.geturl()请求的连接看一下  
 #print(response.geturl()[0:33])  
 #验证成功跳转至登陆页  
 if response.geturl()[0:33]=='https://accounts.douban.com/login':  
        html = response.read().decode('utf-8')  
        #print(html)，可以先打印一下文件内容，为了看到网页元素更方便的写正则，可以复制下来，在需要获取的地方用(.+?)表示，然后用group()元组来取得，  
        #验证图片地址  
        imgurl=re.search('<img id="captcha_image" src="(.+?)" alt="captcha" class="captcha_image"/>',html)  
        if imgurl:  
               url=imgurl.group(1)  
               #print(url)  
               #将验证码以v.jpg保存在本地，在输入验证码的时候可以手工输入  
               res=urllib.request.urlretrieve(url,'v.jpg')  
               captcha = re.search('<input type="hidden" name="captcha-id" value="(.+?)"/>',html)  
               #print(captcha.group(1))  
               if captcha:  
                      vcode=input('请输入图片上的验证码：')  
                      params["captcha-solution"] = vcode  
                      params["captcha-id"] = captcha.group(1)#这个是动态生成的，需要从网页中获得  
                      params["user_login"] = "登录"  
                      #提交验证码验证  
                      response = opener.open(loginurl,urllib.parse.urlencode(params).encode('utf-8'))  
                      if response.geturl()=="https://www.douban.com/":  
                             print("login sucess")