python简单爬虫

最新推荐文章于 2024-08-23 16:53:34 发布

dianquanhe2322

最新推荐文章于 2024-08-23 16:53:34 发布

阅读量61

点赞数

文章标签： python 爬虫

原文链接：http://www.cnblogs.com/CoolClare/p/10952328.html

版权

import re
from urllib.request import urlopen

def getPage(url):
    response = urlopen(url)
    return response.read().decode('utf-8')

def parsePage(s):
    ret = re.findall(
        '<div class="item">.*?<div class="pic">.*?<em .*?>(?P<id>\d+).*?<span class="title">(?P<title>.*?)</span>'
       '.*?<span class="rating_num" .*?>(?P<rating_num>.*?)</span>.*?<span>(?P<comment_num>.*?)评价</span>',s,re.S)
    return ret

def main(num):
    url = 'https://movie.douban.com/top250?start=%s&filter=' % num
    response_html = getPage(url)
    ret = parsePage(response_html)
    print(ret)

count = 0
for i in range(10):   # 10页
    main(count)
    count += 25

# url从网页上把代码搞下来
# bytes decode ——> utf-8 网页内容就是我的待匹配字符串
# ret = re.findall(正则，带匹配的字符串)  #ret是所有匹配到的内容组成的列表

转载于:https://www.cnblogs.com/CoolClare/p/10952328.html

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

dianquanhe2322

关注关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python简单爬虫

import refrom urllib.request import urlopendef getPage(url): response = urlopen(url) return response.read().decode('utf-8')def parsePage(s): ret = re.findall( '<div class="item...
复制链接

扫一扫