Java 爬虫简单实现多线程爬取视频

最新推荐文章于 2024-07-25 17:11:44 发布

cdAndroid

最新推荐文章于 2024-07-25 17:11:44 发布

阅读量2.5k

点赞数

文章标签： Java 爬虫多线程数据挖掘

本文链接：https://blog.csdn.net/weixin_44352679/article/details/102476067

版权

一引言

什么是网络爬虫？

个人简单理解：根据特定规则从指定web开放内容中抓取希望获取的数据，如视频，图片，小说等

官方权威解释(wiki)：

网络爬虫（英语：），也叫网络蜘蛛（），是一种用来自动浏览的。其目的一般为编纂。

网络搜索引擎等站点通过爬虫软件更新自身的网站内容或其对其他网站的索引。网络爬虫可以将自己所访问的页面保存下来，以便搜索引擎事后生成索引供用户搜索。

爬虫访问网站的过程会消耗目标系统资源。不少网络系统并不默许爬虫工作。因此在访问大量页面时，爬虫需要考虑到规划、负载，还需要讲“礼貌”。不愿意被爬虫访问、被爬虫主人知晓的公开站点可以使用robots.txt文件之类的方法避免访问。这个文件可以要求机器人只对网站的一部分进行索引，或完全不作处理。

互联网上的页面极多，即使是最大的爬虫系统也无法做出完整的索引。因此在公元2000年之前的万维网出现初期，搜索引擎经常找不到多少相关结果。现在的搜索引擎在这方面已经进步很多，能够即刻给出高质量结果。

爬虫还可以验证超链接和HTML代码，用于网络抓取（参见数据驱动编程）。

阅读前请知晓：

本教程使用Maven依赖管理

点击查看Maven教程

本教程使用Fiddler4进行网页抓包分析

点击查看fiddler使用教程

工具：IDEA+Fiddler4+Google浏览器

二准备工作

在IDEA新建Maven工程并添加以下依赖

<dependencies>
    <dependency>
        <groupId>org.apache.httpcomponents</groupId>
        <artifactId>httpcore</artifactId>
        <version>4.4.10</version>
    </dependency>
    <dependency>
        <groupId>org.apache.httpcomponents</groupId>
        <artifactId>httpclient</artifactId>
        <version>4.5.6</version>
    </dependency>
    <dependency>
        <groupId>org.jsoup</groupId>
        <artifactId>jsoup</artifactId>
        <version>1.7.3</version>
    </dependency>
    <dependency>
        <groupId>commons-io</groupId>
        <artifactId>commons-io</artifactId>
        <version>2.4</version>
    </dependency>
    <dependency>
        <groupId>org.apache.commons</groupId>
        <artifactId>commons-lang3</artifactId>
        <version>3.9</version>
    </dependency>
    <dependency>
        <groupId>org.projectlombok</groupId>
        <artifactId>lombok</artifactId>
        <version>1.18.8</version>
    </dependency>
    <dependency>
        <groupId>commons-httpclient<

最低0.47元/天解锁文章

cdAndroid

关注

0
点赞
踩
28

收藏

觉得还不错? 一键收藏
0
评论
Java 爬虫简单实现多线程爬取视频

Java 爬虫简单实现多线程爬取视频一引言什么是网络爬虫？个人简单理解：根据特定规则从指定web开放内容中抓取希望获取的数据，如视频，图片，小说等官方权威解释(wiki)：网络爬虫（英语：），也叫网络蜘蛛（），是一种用来自动浏览的。其目的一般为编纂。网络搜索引擎等站点通过爬虫软件更新自身的网站内容或其对其他网站的索引。网络爬虫可以将自己所访问的页面保存下来，以便搜索引擎事后生成索...
复制链接

扫一扫