在使用Python对一些网站的数据进行采集时,经常会遇到需要登录的情况。这些情况下,使用FireFox等浏览器登录时,自带的调试器(快捷键F12)就可以看到登录的时候网页向服务器提交的信息,把这部分信息提取出来就可以利用Python 的 urllib2 库结合Cookie进行模拟登录然后采集数据,如以下代码:

#coding=utf-8
import urllib
import urllib2
import httplib
import cookielib
url = 'http://www.xxx.net/'
cookie = cookielib.CookieJar()
cj=urllib2.HTTPCookieProcessor(cookie)
#设置登录参数,使用浏览器的调试器等抓包工具得到
postdata=urllib.urlencode({'JSESSIONID':'1F616774D9548C1E8AF12A65B470B663', 'username':'admin','password':'admin'})
#生成请求
request=urllib2.Request(url, postdata)
#设置代理
request.set_proxy('xx.xx.xx.xx:xx','http')

#登录
opener=urllib2.build_op