网络爬虫的初步使用

本文介绍了Java爬虫的基础步骤,包括通过URL下载网页资源,使用正则表达式分析数据,进行数据抽取和清洗,最后将数据存储。示例中分别展示了对默认允许和不允许爬取的网站的处理方式,使用了HttpURLConnection设置User-Agent来模拟浏览器请求。
摘要由CSDN通过智能技术生成

完整步骤如下:

1.提供一个URL

2.下载资源

3.分析数据(可以利用正则表达式)

4.数据抽取

5.数据清洗

6.存储

以下示例就只操作前两步。

简单示例(该网站默认允许爬取): 提供一个URL,下载资源

public static void main(String[] args) throws IOException {
    URL url = new URL("https://www.jd.com");
    InputStream is = url.openStream();
    BufferedReader reader = new BufferedReader(new InputStreamReader(is));
    String msg = null;
    while((msg = reader.readLine())!=null){
        System.out.println(msg);
    }
}

简单示例(该网站默认不允许爬取,可以浏览器模拟请求访问进行爬取): 提供一个URL  下载资源

public static void main(String[] args) throws IOException {
    URL url = new URL("https://www.dianping.com");
    HttpURLConnection connection = (HttpURLConnection) url.openConnection();
    connection.setRequestMethod("GET");
    connection.setRequestProperty("User-Agent", "Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36");
    InputStream is = connection.getInputStream();
    BufferedReader reader = new BufferedReader(new InputStreamReader(is));
    String msg = null;
    while((msg = reader.readLine())!=null){
        System.out.println(msg);
    }
}

关注公众号,可以免费获取毕业设计项目、各种免费软件、资料,笔记哦。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

心之所向...

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值