豆瓣高分电影爬取学习心得

自己写的豆瓣高分电影爬取程序
使用request和re正则库

#豆瓣电影评分榜单

import requests
import re

def getHTMLText(url):
	try:
		hd = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.130 Safari/537.36"}
		r = requests.get(url,timeout=30,headers=hd)
		r.raise_for_status()
		r.encoding=r.apparent_encoding
		return r.text
	except:
		return""

cid = 20
for i in range(10):
	print("第"+str(i)+"页的电影\n")
	print("电影名称		评分")
	url="https://movie.douban.com/j/search_subjects?type=movie&tag=豆瓣高分&sort=rank&page_limit=20&page_start="+str(cid)
	data = getHTMLText(url)
	pat1 = '"title":"(.*?)"'
	pat2 = '"rate":"(.*?)"'
	Movie_title=re.compile(pat1,re.S).findall(data)
	Movie_rate=re.compile(pat2,re.S).findall(data)
	for j in range(len(Movie_title)):
		print(Movie_title[j],Movie_rate[j])
	#print(Movie_title[1],"\t",Movie_rate[1])

	cid+=20

学习心得:

Fiddler抓取HTTPS:
抓包器:需要设置代理服务器,并导入Fiddler的证书
目的:可以直接使用或观察抓包数据,可以跳过网站的保护

手法:通过查看增加的包来判断是什么,(比如有\u的一般都是中文编码,可以在Python中解码读出来)
可以观察出不同网址中url的区别,腾讯视频的评论全都放在同一个url里面的。可以通过规律直接抓包!

Request库的爬取:
手段不同,但是核心原理和步骤相同。

Scrapy:
准备lmxl,pywin32,wheel
使用指令去完成爬虫

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值