Python_Demo_maoyanBoard4

最新推荐文章于 2024-05-17 09:54:53 发布

XBMY

最新推荐文章于 2024-05-17 09:54:53 发布

阅读量300

点赞数

可以分享

本文链接：https://blog.csdn.net/cxb2011/article/details/101282787

版权

Python 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

练习对象 :猫眼榜单Top100

import requests 
import re
import json
import time

# from requests.exceptions import RequestException 

def get_one_page(url):
    headers={
        'User-agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.25 Safari/537.36 Core/1.70.3722.400 QQBrowser/10.'
    }
    response = requests.get(url, headers=headers) 
    if response.status_code == 200:
         return response.text
    return None 

def parse_one_page(html):
    p=[]
    p.append('<dd>')
    p.append('.*?board-index.*?>(.*?)</i>')    # 排名信息
    p.append('.*?data-src="(.*?)"')            # 图片地址
    p.append('.*?name.*?a.*?>(.*?)</a>')       #电影名称
    p.append('.*?star.*?>\s*(.*?)\s*</p>')     # 主演
    p.append('.*?releasetime.*?>(.*?)</p>')     #发行时间
    p.append('.*?integer.*?>(.*?)</i>.*?fraction.*?>(.*?)</i>')  #打分
    p.append('.*?</dd>')
    pattern=re.compile(''.join(p),re.S) #re.S使得匹配包括换行符在内的所有字符
   
    items = re.findall(pattern, html)
    for item in items:
        yield {
            'index': item[0],
            'image':re.search('.*/(.*?.jpg)',item[1]).group(1) if len(item[1])>1 else '',
            'title': item[2],
            'actor': item[3].strip()[3:],# strip 默认删除空白符（包括'\n', '\r', '\t', ' ')
            'time': item[4].strip()[5:],
            'score': item[5] + item[6]
        }#yield执行后并没有退出，每次遇到关键字后返回相应结果

def write_to_file(content):
    #通过 JSON 库的 dumps() 方法实现字典的序列化，并指定 ensure ascii 参数为 False，
    # 这样可以保证输出结果是中文形式而不 是 Unicode 编码
    with open('result.txt', 'a', encoding='utf-8') as f:
        f.write(json.dumps(content, ensure_ascii=False) + '\n')#inorder to output the chinese
 

def main(offset):
    url = 'http://maoyan.com/board/4?offset=' + str(offset)
    html=get_one_page(url)

    for item in parse_one_page(html):
        print(item)
        write_to_file(item)

if __name__ == "__main__":
   for i in range(10):
        main(offset=i * 10)
        time.sleep(1)

XBMY

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Python_Demo_maoyanBoard4

练习对象 :猫眼榜单Top100import requests import reimport jsonimport time# from requests.exceptions import RequestException def get_one_page(url): headers={ 'User-agent':'Mozilla/5.0 (Window...
复制链接

扫一扫

专栏目录