spider-抓取页面内容

最新推荐文章于 2021-01-31 16:58:24 发布

weixin_34029680

最新推荐文章于 2021-01-31 16:58:24 发布

阅读量143

点赞数

文章标签： json

# -*- coding: UTF-8 -*-
from HTMLParser import HTMLParser
import sys,urllib2,string,re,json

reload(sys)
sys.setdefaultencoding('utf-8')

class hp(HTMLParser):

    def __init__(self):
        self.readingdata_a = False
        self.title = []
        self.usite = []
        HTMLParser.__init__(self)
    
    def handle_starttag(self,tag,attrs):
        #print tag
        if tag == 'a':for h,v in attrs:
                if v == 'entrylistItemTitle':
                    self.readingdata_a = True
                    self.usite.append(attrs[2][1])

    def handle_data(self,data):
        if self.readingdata_a:
            self.title.append(data)

    def handle_endtag(self,tag):
        if tag == 'a':
            self.readingdata_a = False

    def getdata(self):
        #return zip(self.title,self.usite) 通过zip函数将其一对一合并为tuple

        i=0
        listr = []
        while i<len(self.title):
            listr.append(self.title[i] +' : '+self.usite[i])
            i=i+1
        return listr


url='http://www.cnblogs.com/dreamer-fish/archive/2016/03.html'
request = urllib2.Request(url)
response = urllib2.urlopen(request).read()

yk=hp()
yk.feed(response)
dd = yk.getdata()


for i in dd:
    print i

yk.close

结果：

关注博主即可阅读全文

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

weixin_34029680

关注关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
spider-抓取页面内容

# -*- coding: UTF-8 -*-from HTMLParser import HTMLParserimport sys,urllib2,string,re,jsonreload(sys)sys.setdefaultencoding('utf-8')class hp(HTMLParser): def __init__(self):...
复制链接

扫一扫