- 博客(1)
- 收藏
- 关注
原创 基于广告链接和行块分布的网页正文抽取
一种新型的网页正文抽取算法,对于广告的屏蔽很有效果。代码移步github现在网上能搜到的正文抽取算法一般有两类: Readability:该算法先建立DOM树,然后对网页源代码中不同的HTML标签进行判断,逐渐找到正文所在标签位置。该算法的主要优点是可以最大程度的保存网页正文的缩进、空行以及链接。 行块分布算法:主要是基于论文《基于行块分布函数的通用网页正文抽取》。该算法不需要建立DOM树,直接剔除
2017-04-09 18:01:18
633
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人