使用阻塞队列爬取代理ip实现爬虫

7 篇文章 0 订阅
4 篇文章 0 订阅
package com.yanshu.service;
/*import org.apache.commons.io.IOUtils;*/
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;


import javax.net.ssl.HttpsURLConnection;
import java.io.BufferedReader;
import java.io.IOException;
import java.io.InputStream;
import java.io.InputStreamReader;
import java.net.*;
import java.util.HashMap;
import java.util.Map;
import java.util.PriorityQueue;
import java.util.Queue;
import java.util.concurrent.BlockingQueue;
import java.util.concurrent.LinkedBlockingDeque;
public class Test {
public static void getIpAddress(BlockingQueue<Ip> queue) {
       Map<String, String> maps = new HashMap<String, String>();
     //  for(int i = 1 ; i < 20; ++i) {
           try {
               Document doc = Jsoup.connect("http://www.xicidaili.com/nn/" )
                       .data("query", "Java")
                       .userAgent("Netscape/5")
                       .cookie("auth", "token")
                     //  .timeout(3000)
                       .get();
               String regex =
                       "((?:(?:25[0-5]|2[0-4]\\d|((1\\d{2})|([1-9]?\\d)))\\.){3}(?:25[0-5]|2[0-4]\\d|((1\\d{2})|([1-9]?\\d))))";
               Elements elements =
                       doc.select("td:matches(" + regex + ")");
               System.out.println(doc.text());
               for(int j = 0; j < elements.size(); ++j) {
                   Element e = (Element) elements.get(j);
                   Element e1 = e.nextElementSibling();
                   String ip = e.text();
                   String prot = e1.text();
                   if(isPing(ip)) {
                       System.out.println(ip + " " + prot);
                       try {
                           queue.put(new Ip(ip, prot));
                       } catch (InterruptedException e2) {
                           e2.printStackTrace();
                       }
                   }
               }
           } catch (IOException e) {
               e.printStackTrace();
           }
       //}
   }
   public static boolean isPing(String ip) {
       boolean status = false;
       if(ip != null) {
           try {
               status = InetAddress.getByName(ip).isReachable(500);
           } catch(UnknownHostException e) {
           }
           catch(IOException e) {
           }
       }
       return status;
   }


   public static void main(String[] args) {
       final BlockingQueue<Ip> queue = new LinkedBlockingDeque<>();
       Thread thread = new Thread(new Runnable() {
           @Override
           public void run() {
               getIpAddress(queue);
           }
       });
       Thread thread1 = new Thread(new Runnable() {
           @Override
           public void run() {
               parse(queue);
           }
       });


       thread.start();
       thread1.start();
   }


   public static void parse(BlockingQueue<Ip> queue) {


       while (true) {
           Ip ip = null;
           try {
               ip = queue.take();
           } catch (InterruptedException e) {
               e.printStackTrace();
           }
           while (true) {
                   System.out.println(ip.ip + " " + ip.port);
                   SocketAddress addr = new InetSocketAddress(ip.ip, Integer.parseInt(ip.port));
                   Proxy proxy = new Proxy(Proxy.Type.HTTP, addr);
                   try{
                       URL url = new URL("https://api.douban.com/v2/book/isbn/7505715666");
                       HttpsURLConnection conn = (HttpsURLConnection)url.openConnection(proxy);
                       conn.setConnectTimeout(5000);
                       conn.setRequestProperty("User-Agent","Mozilla/4.0 (compatible; MSIE 7.0; NT 5.1; GTB5; .NET CLR 2.0.50727; CIBA)");
                       conn.connect();
                       String result = "";
                       BufferedReader in = null;
                       in = new BufferedReader(new InputStreamReader(
                                   conn.getInputStream(),"UTF-8"));
                           String line;
                           while ((line = in.readLine()) != null) {
                               result += line;
                           }
                       System.out.println(result);
                   }catch (Exception e) {
                      // e.printStackTrace();
                       break;
                   }
           }
       }
   }
}
class Ip{
   String ip;
   String port;


   public Ip(String ip, String port) {
       this.ip = ip;
       this.port = port;
   }


}
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
智慧校园的建设目标是通过数据整合、全面共享,实现校园内教学、科研、管理、服务流程的数字化、信息化、智能化和多媒体化,以提高资源利用率和管理效率,确保校园安全。 智慧校园的建设思路包括构建统一支撑平台、建立完善管理体系、大数据辅助决策和建设校园智慧环境。通过云架构的数据中心与智慧的学习、办公环境,实现日常教学活动、资源建设情况、学业水平情况的全面统计和分析,为决策提供辅助。此外,智慧校园还涵盖了多媒体教学、智慧录播、电子图书馆、VR教室等多种教学模式,以及校园网络、智慧班牌、校园广播等教务管理功能,旨在提升教学品质和管理水平。 智慧校园的详细方案设计进一步细化了教学、教务、安防和运维等多个方面的应用。例如,在智慧教学领域,通过多媒体教学、智慧录播、电子图书馆等技术,实现教学资源的共享和教学模式的创新。在智慧教务方面,校园网络、考场监控、智慧班牌等系统为校园管理提供了便捷和高效。智慧安防系统包括视频监控、一键报警、阳光厨房等,确保校园安全。智慧运维则通过综合管理平台、设备管理、能效管理和资产管理,实现校园设施的智能化管理。 智慧校园的优势和价值体现在个性化互动的智慧教学、协同高效的校园管理、无处不在的校园学习、全面感知的校园环境和轻松便捷的校园生活等方面。通过智慧校园的建设,可以促进教育资源的均衡化,提高教育质量和管理效率,同时保障校园安全和提升师生的学习体验。 总之,智慧校园解决方案通过整合现代信息技术,如云计算、大数据、物联网和人工智能,为教育行业带来了革命性的变革。它不仅提高了教育的质量和效率,还为师生创造了一个更加安全、便捷和富有智慧的学习与生活环境。
Java中的Map是一种键值对的数据结构,它提供了快速的访问和查找功能。但是,Map并不是一个阻塞队列,它不能直接用来实现阻塞队列功能。但是,我们可以使用Map来实现一个阻塞队列,具体实现方法如下: 1. 创建一个Map对象,用来存储队列元素。 2. 创建一个互斥锁对象,用来保证队列操作的线程安全。 3. 创建两个条件变量,一个用来表示队列已满,另一个用来表示队列为空。 4. 实现队列的put方法,当队列已满时,阻塞当前线程,等待队列有空闲位置。 5. 实现队列的take方法,当队列为空时,阻塞当前线程,等待队列有元素可取。 6. 实现队列的size方法,返回队列中元素的数量。 下面是一个使用Map实现阻塞队列的示例代码: ``` import java.util.Map; import java.util.HashMap; import java.util.concurrent.locks.Condition; import java.util.concurrent.locks.Lock; import java.util.concurrent.locks.ReentrantLock; public class BlockingQueue<T> { private final Map<Integer, T> map; private final Lock lock; private final Condition notFull; private final Condition notEmpty; private int capacity; private int head; private int tail; public BlockingQueue(int capacity) { this.capacity = capacity; map = new HashMap<>(capacity); lock = new ReentrantLock(); notFull = lock.newCondition(); notEmpty = lock.newCondition(); head = 0; tail = 0; } public void put(T element) throws InterruptedException { lock.lock(); try { while (tail - head == capacity) { notFull.await(); } map.put(tail % capacity, element); tail++; notEmpty.signal(); } finally { lock.unlock(); } } public T take() throws InterruptedException { lock.lock(); try { while (tail == head) { notEmpty.await(); } T element = map.remove(head % capacity); head++; notFull.signal(); return element; } finally { lock.unlock(); } } public int size() { lock.lock(); try { return tail - head; } finally { lock.unlock(); } } } ``` 在这个示例代码中,我们使用了一个Map来存储队列元素,并使用了一个互斥锁和两个条件变量来实现阻塞队列的功能。put方法和take方法分别实现了向队列中添加元素和从队列中取出元素的功能。size方法返回队列中元素的数量。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值