WebCollector网页正文提取

最新推荐文章于 2022-03-16 20:06:17 发布

AJAXHu

最新推荐文章于 2022-03-16 20:06:17 发布

阅读量5k

点赞数

分类专栏： webcollector 文章标签： JAVA爬虫

本文链接：https://blog.csdn.net/ajaxhu/article/details/50674121

版权

WebCollector维护了ContentExtractor类，提供静态方法用于网页正文和结构化新闻的抽取。算法在CleanEval数据集上表现良好，但在不同类型的网页上效果可能各异。建议在实际应用中，基于大量数据测试Precision、Recall和F值。此外，项目作者鼓励通过捐款支持项目的维护和发展。

摘要由CSDN通过智能技术生成

网页正文提取项目ContentExtractor已并入WebCollector维护。
WebCollector的正文抽取API都被封装为ContentExtractor类的静态方法。可以抽取结构化新闻，也可以只抽取网页的正文（或正文所在Element)。
正文抽取效果指标 :

比赛数据集CleanEval P=93.79% R=86.02% F=86.72%

常见新闻网站数据集 P=97.87% R=94.26% F=95.33%

算法无视语种，适用于各种语种的网页。

标题抽取和日期抽取使用简单启发式算法，并没有像正文抽取算法一样在标准数据集上测试，算法仍在更新中。

调用方法：

News news = ContentExtractor.getNewsByHtml(html, url);
News news = ContentExtractor.getNewsByHtml(html);
News news = ContentExtractor.getNewsByUrl(url);

String content = ContentExtractor.getContentByHtml(html, url);
String content = ContentExtractor.getContentByHtml(html);
String content = ContentExtractor.getContentByUrl(url);

Element contentElement = ContentExtractor.getContentElementByHtml(html, url);
Element contentElement = ContentExtractor.getContentElementByHtml(html);
Elem