爬虫使用隧道IP注意的问题

最新推荐文章于 2023-08-14 10:04:20 发布

Laicaling

最新推荐文章于 2023-08-14 10:04:20 发布

阅读量254

点赞数

分类专栏：网络爬虫爬虫代理数据采集

本文链接：https://blog.csdn.net/Laicaling/article/details/113124025

版权

网络爬虫同时被 3 个专栏收录

206 篇文章 3 订阅

订阅专栏

数据采集

198 篇文章 0 订阅

订阅专栏

爬虫代理

107 篇文章 2 订阅

订阅专栏

隧道转发的爬虫代理加强版代理IP解决爬虫效率问题，现在大数据时代，爬虫工作者已经成为互联网数据公司的关键性职位，他们不但要精通数据抓取和分析，其次还要熟悉搜索引擎和相关检索算法、分布式算法都要有一定的了解。并做爬虫工作的相关内容。如果网络爬虫没有代理IP，就完全无法正常运行工作业务。那么在进行爬虫采集的时候，我们需要注意什么才能发挥出更大的作用呢?
高效性：
高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。
全面性：
数据量足够具有分析价值、数据面足够支撑分析需求。
比如对于查询详细信息这一行为，需要采集用户触发时的环境信息、用户id，最后需要统计这一行为在某一时段触发的人数、次数、人均次数、活跃比等。
通过数据的采集分析，可以挖掘到有价值的信息，在进行爬虫之前我们需要准备高质量的代理ip，使用网络爬虫进行采集，都是需要使用隧道转发的爬虫代理加强版代理IP才能更有效的采集到更多的数据信息。

    import okhttp3.*;

    import java.io.IOException;
    import java.net.InetSocketAddress;
    import java.net.Proxy;
    import java.util.concurrent.TimeUnit;

    public class OkHttp {

        // 代理服务器(产品官网 www.16yun.cn)
        final static String proxyHost = "t.16yun.cn";
        final static Integer proxyPort = 31111;

        // 代理验证信息
        final static String proxyUser = "USERNAME";
        final static String proxyPass = "PASSWORD";

        static OkHttpClient client = null;

        static {
            Proxy proxy = new Proxy(Proxy.Type.HTTP, new InetSocketAddress(proxyHost, proxyPort));

            Authenticator proxyAuthenticator = new Authenticator() {
                public Request authenticate(Route route, Response response) {
                    String credential = Credentials.basic(proxyUser, proxyPass);
                    return response.request().newBuilder()
                            .header("Proxy-Authorization", credential)
                            .build();
                }
            };

            client = new OkHttpClient().newBuilder()
                    .connectTimeout(5, TimeUnit.SECONDS)
                    .readTimeout(5, TimeUnit.SECONDS)
                    .proxy(proxy)
                    .proxyAuthenticator(proxyAuthenticator)
                    .connectionPool(new ConnectionPool(5, 1, TimeUnit.SECONDS))
                    .build();
        }

        public static Response doGet() throws IOException {
            // 要访问的目标页面
            String targetUrl = "http://httpbin.org/ip";

            Request request = new Request.Builder()
                    .url(targetUrl)
                    .build();
            Response response = client.newCall(request).execute();
            return response;
        }

        public static void main(String[] args) throws IOException {
            Response response1 = doGet();
            System.out.println("GET请求返回结果：");
            System.out.println(response1.body().string());
        }

    }

Laicaling

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
爬虫使用隧道IP注意的问题

隧道转发的爬虫代理加强版代理IP解决爬虫效率问题，现在大数据时代，爬虫工作者已经成为互联网数据公司的关键性职位，他们不但要精通数据抓取和分析，其次还要熟悉搜索引擎和相关检索算法、分布式算法都要有一定的了解。并做爬虫工作的相关内容。如果网络爬虫没有代理IP，就完全无法正常运行工作业务。那么在进行爬虫采集的时候，我们需要注意什么才能发挥出更大的作用呢?高效性：高效性包含技术执行的高效性、团队内部成员协同的高效性以及数据分析需求和目标实现的高效性。全面性：数据量足够具有分析价值、数据面足够支撑分析需求。
复制链接

扫一扫

专栏目录