Jsoup代码解读之五-parser(中)

最新推荐文章于 2023-08-07 16:21:30 发布

哲洛别闹

最新推荐文章于 2023-08-07 16:21:30 发布

阅读量196

点赞数

代码结构

先介绍以下parser包里的主要类：

Parser

Jsoup parser的入口facade，封装了常用的parse静态方法。可以设置maxErrors，用于收集错误记录，默认是0，即不收集。与之相关的类有ParseError,ParseErrorList。基于这个功能，我写了一个PageErrorChecker来对页面做语法检查，并输出语法错误。

Token

保存单个的词法分析结果。Token是一个抽象类，它的实现有Doctype,StartTag,EndTag,Comment,Character,EOF6种，对应6种词法类型。

Tokeniser

保存词法分析过程的状态及结果。比较重要的两个字段是state和emitPending，前者保存状态，后者保存输出。其次还有tagPending/doctypePending/commentPending，保存还没有填充完整的Token。

CharacterReader

对读取字符的逻辑的封装，用于Tokenize时候的字符输入。CharacterReader包含了类似NIO里ByteBuffer的consume()、unconsume()、mark()、rewindToMark()，还有高级的consumeTo()这样的用法。

TokeniserState

用枚举实现的词法分析状态机。

HtmlTreeBuilder

语法分析，通过token构建DOM树的类。

HtmlTreeBuilderState

语法分析状态机。

TokenQueue

虽然披了个Token的马甲，其实是在query的时候用到，留到select部分再讲。

词法分析状态机

现在我们来讲讲HTML的词法分析过程。这里借用一下http://ued.ctrip.com/blog/?p=3295里的图，图中描述了一个Tag标签的状态转移过程，

0?wx_fmt=png

这里忽略了HTML注释、实体以及属性，只保留基本的开始/结束标签，例如下面的HTML:

1	`<div>test</div>`

Jsoup里词法分析比较复杂，我从里面抽取出了对应的部分，就成了我们的miniSoupLexer(这里省略了部分代码，完整代码可以看这里MiniSoupTokeniserState)：

0?wx_fmt=png

参考这个程序，可以看到Jsoup的词法分析的大致思路。分析器本身的编写是比较繁琐的过程，涉及属性值(区分单双引号)、DocType、注释、HTML实体，以及一些错误情况。不过了解了其思路，代码实现也是按部就班的过程。

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Jsoup代码解读之五-parser(中)

代码结构先介绍以下parser包里的主要类：ParserJsoup parser的入口facade，封装了常用的parse静态方法。可以设置maxErrors，用于收集错...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。