爬取西刺ip的插入数据库相关问题

最新推荐文章于 2024-06-15 13:48:40 发布

Fitz1318

最新推荐文章于 2024-06-15 13:48:40 发布

阅读量305

点赞数

分类专栏： Python3学习

本文链接：https://blog.csdn.net/Fitz1318/article/details/79531700

版权

Python3学习专栏收录该内容

58 篇文章 0 订阅

订阅专栏

今晚解决了前几天爬取西刺ip网不能插入数据库的问题，成功爬取并插入数据库的代码如下

# encoding: utf-8
import re
import requests
from scrapy.selector import Selector
import MySQLdb

conn = MySQLdb.connect(
    host="localhost",
    #port=3306,
    user="root",
    passwd="1234",
    db="jobbole",
    charset="utf8")
cursor = conn.cursor()


def crawl_ips():
    # 爬取西刺的免费ip代理
    headers = {
        "User-Agent": "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:52.0) Gecko/20100101 Firefox/52.0"}
    for i in range(1568):
        res = requests.get(
            "http://www.xicidaili.com/nn/{0}".format(i),
            headers=headers)

        selector = Selector(text=res.text)
        all_trs = selector.css("#ip_list tr")

        ip_list = []
        for tr in all_trs[1:]:
            speed_str = tr.css(".bar::attr(title)").extract()[0]
            if speed_str:
                speed = float(speed_str.split("秒")[0])
            all_texts = tr.css("td::text").extract()
            match_obj1 = re.match(".*'HTTPS'.*", str(all_texts))
            match_obj2 = re.match(".*'HTTP'.*", str(all_texts))
            proxy_type = ""
            if match_obj1:
                proxy_type = "HTTPS"
            elif match_obj2:
                proxy_type = "HTTP"
            ip = all_texts[0]
            port = all_texts[1]

            ip_list.append((ip, port, proxy_type, speed))

        for ip_info in ip_list:
            cursor.execute(
                "insert xici(ip, port, speed, proxy_type) VALUES('{0}', '{1}', {2}, '{3}')".format(
                    ip_info[0], ip_info[1], ip_info[3], ip_info[2]))
            conn.commit()
print(crawl_ips())

但是又出现了新的问题。就是一个ip地址可以对应多个端口。但是之前我设置的是ip为主键，这当出现两个相同的ip时，爬虫就会停止，如下图所示。