day1-爬虫

最新推荐文章于 2024-08-08 15:09:16 发布

初级码农12138

最新推荐文章于 2024-08-08 15:09:16 发布

阅读量266

点赞数

文章标签：爬虫

本文链接：https://blog.csdn.net/qq_51171222/article/details/129802041

版权

该文介绍了如何使用Python的requests库进行网络请求，包括设置GET请求、处理编码、获取文本和二进制数据，以及解析JSON响应。同时，文章也展示了如何封装请求头以伪装浏览器、设置Cookie和代理，以及如何下载并保存图片到本地。

摘要由CSDN通过智能技术生成

爬虫

requests请求

import requests

# 1.请求网络数据: requests.get(请求地址)
response = requests.get('https://cd.zu.ke.com/zufang')

# 2.设置解码方式（乱码的是需要设置 - 一定要在获取请求结果之前设置）
response.encoding = 'utf-8'

# 3. 获取请求结果
# 1）获取请求结果对应的文本数据  -  爬网页
print(response.text)

# 2）获取二进制格式的请求结果  -  下载图片、视频、音频
print(response.content)

# 3）获取请求结果json转换的结果  - json接口
print(response.json())

封装请求头

import requests

# 1. 发送请求
# 添加header: a. 浏览器伪装(user-agent)、b.免密登录(cookie)、 c. 设置代理(proxies)
headers = {
    'cookie': 'bid=58Gyjz_NAcA; ll="118318"; douban-fav-remind=1; viewed="36164018_36221918"; ap_v=0,6.0',
    'user-agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/108.0.0.0 Safari/537.36'
}
response = requests.get('https://movie.douban.com/top250', headers=headers)


# 2. 获取结果
result = response.text
print(result)

下载图片

import requests

# 1.获取网络图片数据
response = requests.get('https://img0.baidu.com/it/u=793843167,4251357724&fm=253&fmt=auto&app=138&f=JPEG?w=691&h=500')
result = response.content
print(type(result))     # <class 'bytes'>

# 2.保存图片数据到本地文件
with open('files/a.jpg', 'wb') as f:
    f.write(result)