宝塔 根据访问协议头屏蔽爬虫

nginx在站点的设置,配置文件中 server{ } 中添加

 #禁止爬虫工具的抓取
    if ($http_user_agent ~* "Bytespider|FISPIDER|YisouSpider") {
      return 403;
    }

Appache:
在伪静态里设置 这里以thinkphp为例!

<IfModule mod_rewrite.c>
RewriteEngine on
RewriteCond %{REQUEST_FILENAME} !-d
RewriteCond %{REQUEST_FILENAME} !-f
RewriteRule ^(.*)$ index.php [L,E=PATH_INFO:$1]
 #禁止爬虫工具的抓取
RewriteCond %{HTTP_USER_AGENT} "^.*FISPIDER.*|.*YisouSpider.*$" [NC]
RewriteRule ^(.*)$ - [R=404,L]

</IfModule>

配置完不用重启,就能生效!

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
对于使用Python爬虫登录宝塔的问题,我可以给出以下回答: 首先,爬虫是一种自动化程序,可以模拟人类的行为来获取网页上的数据。登录宝塔需要发送POST请求,并携带正确的用户名和密码参数。在编写Python爬虫时,可以使用requests库来发送POST请求,并传递登录表单数据。 以下是一个示例代码,展示了如何使用Python爬虫登录宝塔: ```python import requests # 登录宝塔的URL login_url = 'https://example.com/login' # 登录表单数据 data = { 'username': 'your_username', 'password': 'your_password' } # 发送POST请求进行登录 response = requests.post(login_url, data=data) # 检查登录是否成功 if response.status_code == 200: print("登录成功!") else: print("登录失败!") ``` 请注意,上述代码中的`login_url`需要替换为实际的宝塔登录页面的URL,`data`中的`username`和`password`需要替换为您的宝塔登录用户名和密码。 此外,为了遵守网站的爬虫规则,您应该在爬取之前查看宝塔的robots.txt文件,以了解哪些数据可以被爬取,哪些数据是禁止爬取的。您可以在宝塔的域名后加上"/robots.txt"来查看该文件。 希望以上信息对您有所帮助!\[1\]\[2\]\[3\] #### 引用[.reference_title] - *1* *2* *3* [python爬虫基础-requests库](https://blog.csdn.net/qimo__/article/details/129404322)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v91^insert_down1,239^v3^insert_chatgpt"}} ] [.reference_item] [ .reference_list ]
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值