爬虫系列，（3），达盖尔图片抓取

最新推荐文章于 2024-08-18 10:37:54 发布

enodhs

最新推荐文章于 2024-08-18 10:37:54 发布

阅读量10w+

点赞数

本文链接：https://blog.csdn.net/weixin_43977865/article/details/89635911

版权

本文详细介绍了如何使用爬虫技术进行达盖尔网站的图片抓取，包括识别和解析网页结构、设置请求头、处理反爬策略以及保存图片的步骤。通过实例展示了爬虫在图片获取中的应用。

摘要由CSDN通过智能技术生成

import re
import requests
from bs4 import BeautifulSoup


# 第一步得到代理
def proxy():
    with open(r'ip_proxies\有效ip.txt', 'r', encoding='utf-8') as f:
        r = f.readlines()
        for ip in r:
            try:
                proxies = eval(ip)
                if requests.get('http://t66y.com/index.php', proxies=proxies, timeout=2).status_code == 200:
                    return proxies
            except:
                pass


proxies = proxy()
print(proxies)

# 第二步得到网页链接池
url = 'http://t66y.com/index.php'
url2 = 'http://t66y.com/thread0806.php?fid=16'
headers = {'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,\
image/webp,image/apng,*/*;q=0.8,application/signed-exchange;v=b3',
           'Accept-Encoding': 'gzip, deflate',
           'Accept-Language': 'zh-CN,zh;q=0.9,en;q=0.8,zh-TW;q=0.7&