UA检测/UA伪装（实战巩固:爬取搜狗指定词条对应的搜索结果页面）

最新推荐文章于 2024-08-08 15:46:08 发布

F=k·Δx

最新推荐文章于 2024-08-08 15:46:08 发布

阅读量1k

点赞数 2

分类专栏： Python

本文链接：https://blog.csdn.net/Outsider_ahhdd/article/details/111991754

版权

本文介绍了UA(User-Agent)的概念及其在爬虫中的应用。 UA检测用于判断请求是否来自正常浏览器，而UA伪装则是为了避免被服务器识别为爬虫。文章以爬取搜狗特定词条搜索结果页面为例，展示了如何实现UA伪装进行简易网页采集。

摘要由CSDN通过智能技术生成

UA：User-Agent（请求载体的身份标识）
UA检测：门户网站的服务器会检测对应请求的载体身份标识，如果检测到请求的载体身份标识为某一款浏览器，
说明该请求是一个正常的请求。但是，如果检测到请求的载体身份标识不是基于某一款浏览器的，则表示该请求
为不正常的请求（爬虫），则服务器端就很有可能拒绝该次请求。
UA伪装：让爬虫对应的请求载体身份标识伪装成某一款浏览器

需求：爬取搜狗指定词条对应的搜索结果页面（简易网页采集器）

import requests
if __name__ == "__main__":
    #UA伪装：将对应的User-Agent封装到一个字典中
    headers = {
   
        'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) A