fileName = keyWord + ‘.html’
with open(‘./dataFiles/’+fileName,‘w’,encoding=‘utf-8’) as fp:
fp.write(pageText)
生成以关键字命名的html文件
检查网页可知,百度翻译的请求方式为post,需要用到requests.post()。关键字为data里面的kw。
requests.post(url= ,data= ,headers= )
-
url:请求页面
-
data:关键字,字典类型
-
headers:头信息,字典类型,用于UA伪装
百度翻译
- post请求
- 响应数据是JSON格式
import requests
import json
postURL = ‘https://fanyi.baidu.com/sug’
UA伪装
postHeader = {
‘User-Agent’: ‘来自网页检查’
}
参数处理
data = {
‘kw’: ‘baby’
post请求的参数数据与get一致,与get方法不同的是不显示在地址栏,可以通过检查查看
kw为网址指定的参数名,若修改则发生未知错误
}
发送请求
response = requests.post(url=postURL, data=data, headers=postHeader)
获取响应数据,json格式
dataObj = response.json()
print(dataObj)
存储
jsonFilePath = open(‘./dataFiles/dog.json’, ‘w’, encoding=‘utf-8’)
json.dump(dataObj, fp=jsonFilePath, ensure_ascii=False)
print(‘Over!’)
方法与上面两个案例类似,直接看代码
获取豆瓣电影排行榜信息
import requests
import json
doubanURL = ‘https://movie.douban.com/j/chart/top_list?’
url地址
doubanParam = {
#参数
‘type_name’:‘喜剧’,
‘type’: 24,
‘interval_id’: ‘100:90’,
‘start’:‘1’, # 从第几部电影开始取
‘limit’:‘10’ # 取出的个数
}
doubanHeader = {
头信息,用于UA伪装
‘User-Agent’:‘来自网页检查’
}
response = requests.get(url=doubanURL ,params=doubanParam ,headers=doubanHeader)
print(response.json())
fp = open(‘./dataFiles/doubanTop10.json’,‘w’,encoding=‘utf-8’)
最后
不知道你们用的什么环境,我一般都是用的Python3.6环境和pycharm解释器,没有软件,或者没有资料,没人解答问题,都可以免费领取(包括今天的代码),过几天我还会做个视频教程出来,有需要也可以领取~
给大家准备的学习资料包括但不限于:
Python 环境、pycharm编辑器/永久激活/翻译插件
python 零基础视频教程
Python 界面开发实战教程
Python 爬虫实战教程
Python 数据分析实战教程
python 游戏开发实战教程
Python 电子书100本
Python 学习路线规划
小编13年上海交大毕业,曾经在小公司待过,也去过华为、OPPO等大厂,18年进入阿里一直到现在。
深知大多数初中级Python工程师,想要提升技能,往往是自己摸索成长或者是报班学习,但自己不成体系的自学效果低效又漫长,而且极易碰到天花板技术停滞不前!
因此收集整理了一份《2024年Python爬虫全套学习资料》送给大家,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友,同时减轻大家的负担。
由于文件比较大,这里只是将部分目录截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频
如果你觉得这些内容对你有帮助,可以添加下面V无偿领取!(备注:python)
4年Python爬虫全套学习资料》送给大家,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友,同时减轻大家的负担。**
由于文件比较大,这里只是将部分目录截图出来,每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频
如果你觉得这些内容对你有帮助,可以添加下面V无偿领取!(备注:python)
[外链图片转存中…(img-gSwH3HNI-1710878491574)]