利用jsoup 如何从网页中下载图片

22 篇文章 0 订阅
19 篇文章 0 订阅
如何从网页中下载图片
如果做为爬虫很有必要从网页中下载图片到本地,那么我们利用jsoup来进行该操作,jsoup 是一个很不错的html解析器。下面是它的简介:

jsoup 是一款 Java 的HTML 解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于JQuery的操作方法来取出和操作数据。

jsoup的主要功能如下:

  1. 从一个URL,文件或字符串中解析HTML;
  2. 使用DOM或CSS选择器来查找、取出数据;
  3. 可操作HTML元素、属性、文本;

jsoup是基于MIT协议发布的,可放心使用于商业项目。

网页中下载图片需要这么两步操作
1.获取绝对路径
很多网页中用的是相对路径,因此获取图片的绝对路径很重要
方法一:我们就利用jsoup来获取
 
1Element image = document.select("img").first();
2String url = image.absUrl("src");
3// url = http://www.example.com/images/chicken.jpg
或者
01String url = image.attr("abs:src");
02他们的前提利用connect方式获取而不是文件方式
03Document doc = Jsoup.connect("http://jsoup.org").get();
04Element link = doc.select("a").first();
05String relHref = link.attr("href");// == "/"
06String absHref = link.attr("abs:href");// "http://jsoup.org/"
07方法二:利用jdk中url
08URL url  = newURL("http://www.example.com/index.html");
09URI uri = url.toURI();
10System.out.println(uri.resolve("images/chicken.jpg").toString());
2.第二步则就是下载图片
01URL   url   =   new  URL( "图片地址"); 
02URLConnection   uc   =   url.openConnection(); 
03InputStream   is   =   uc.getInputStream(); 
04File   file   =   new  File( "本地路径 "); 
05FileOutputStream   out   =   new   FileOutputStream(file); 
06int   i=0
07while   ((i=is.read())!=-1)   { 
08out.write(i); 
09
10is.close();
本站翻译的:jsoup的官方教程
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值