【使用JSOUP实现网络爬虫】解析一个HTML字符串

最新推荐文章于 2023-04-21 10:57:01 发布

teemai

最新推荐文章于 2023-04-21 10:57:01 发布

阅读量9.3k

点赞数 9

分类专栏：网络爬虫 Java技术专题使用JSOUP实现网络爬虫

本文链接：https://blog.csdn.net/withiter/article/details/13510743

版权

Java技术专题同时被 3 个专栏收录

72 篇文章 1 订阅

订阅专栏

网络爬虫

14 篇文章 0 订阅

订阅专栏

使用JSOUP实现网络爬虫

14 篇文章 473 订阅

订阅专栏

存在问题

来自用户输入，一个文件或一个网站的HTML字符串，你可能需要对它进行解析并取其内容，或校验其格式是否完整，或想修改它。怎么办？jsonu能够帮你轻松解决这些问题

解决方法

使用静态Jsoup.parse(String html) 方法或 Jsoup.parse(String html, String baseUri)示例代码：

String html = "<html><head><title>First parse</title></head>"
  + "<body><p>Parsed HTML into a doc.</p></body></html>";
Document doc = Jsoup.parse(html);

描述

parse(String html, String baseUri) 这方法能够将输入的HTML解析为一个新的文档 (Document），参数 baseUri 是用来将相对 URL 转成绝对URL，并指定从哪个网站获取文档。如这个方法不适用，你可以使用 parse(String html) 方法来解析成HTML字符串如上面的示例。.

只要解析的不是空字符串，就能返回一个结构合理的文档，其中包含(至少) 一个head和一个body元素。

一旦拥有了一个Document，你就可以使用Document中适当的方法或它父类 Element和Node中的方法来取得相关数据。

阅读更多JSOUP相关文章，请看专栏：《使用JSOUP实现网络爬虫》

teemai

关注

9
点赞
踩
3

收藏

觉得还不错? 一键收藏
2
评论
【使用JSOUP实现网络爬虫】解析一个HTML字符串

存在问题来自用户输入，一个文件或一个网站的HTML字符串，你可能需要对它进行解析并取其内容，或校验其格式是否完整，或想修改它。怎么办？jsonu能够帮你轻松解决这些问题解决方法使用静态Jsoup.parse(String html) 方法或 Jsoup.parse(String html, String baseUri)示例代码：String html = "First parse" + "P
复制链接

扫一扫