超简洁轻量解析html库

最新推荐文章于 2024-10-13 17:05:21 发布

iteye_9142

最新推荐文章于 2024-10-13 17:05:21 发布

阅读量162

点赞数

分类专栏：编译原理文章标签： HTML 正则表达式 Python XML Google

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/iteye_9142/article/details/81862094

版权

编译原理专栏收录该内容

3 篇文章 0 订阅

订阅专栏

这事我自己写的一个解析html xml 这类文件的库。为了使用到手机上，这个库无比要快而且要小。不求完全自动但求简洁完全自控。有python版本和java版本。相信一直到其他语言也是相当容易。在googlecode上有源码https://code.google.com/p/tagparser/ ，不用太多讲解，因为相当的小只有一两百行。直接看源码即可。

说过例子吧：

很多人需要提取网页的一些内容, 可以利用正则表达式提取,也可以用beautifulsoap等工具. 正则表达式方法速度快,缺点是不好找到匹配的正则. 其他类似beautiful的工具因为要全面分析html,而html不像xml那么严格,语法比较复杂所以效率很糟糕.这个工具就是为了处里这种问题的.

这个工程只有一个文件 .tagparser.py 它可以方便分析像xml html 等这种标记语言. 只要他是'<'和'>'括起来的标记语言.

分析的方式是'抽'式的.也就是说扫描一个个字符当遇到一个tag时也就是遇到一个<>的时候,回调一个函数onGetTag() ,可以重载这个函数做自己的处理.

如遇到
回调 onGetTag(tagstr, tagstro). tagstr = p tagstro = P tagstr 是小写的tag tagstro是源文件的大小写状态

遇到内容回调 onGetTxt(txtstr) , txtstr是如:<tag>xxxxxxxxx</tag> xxxxx即内容

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。