GNE(GeneralNewsExtractor)是一个通用新闻网站正文抽取模块,输入一篇新闻网页的 HTML, 输出正文内容、标题、作者、发布时间、正文中的图片地址和正文所在的标签源代码。GNE在提取今日头条、网易新闻、游民星空、 观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻等数百个中文新闻网站上效果非常出色,几乎能够达到100%的准确率。
一、如何安装:
可以直接使用 pip 安装 GNE 了:
pip install gne
# 速度慢可以使用下面方式
pip install gne -i https://mirrors.163.com/pypi/simple/
二、使用方式非常简单:
使用requests模块
from gne import GeneralNewsExtractor
import requests
extractor = GeneralNewsExtractor()
def parse_info(html):
result = extractor.extract(html)
print(result)
def run():
resp = requests.get('http://www.jjckb.cn/2022-06/22/c_1310629793.htm')
resp.encoding = 'utf8'
# print(resp.text)
parse_info(resp.text)
run()
GNE 配合 Selenium 实现的一个 Demo:
import time
from gne import GeneralNewsExtractor
from selenium.webdriver import Chrome
driver = Chrome('./chromedriver')
driver.get('https://www.toutiao.com/a6766986211736158727/')
time.sleep(3)
extractor = GeneralNewsExtractor()
result = extractor.extract(driver.page_source)
print(result)
关于GNE
GNE 官方文档:https://generalnewsextractor.readthedocs.io/
GNE 的项目源代码在:https://github.com/kingname/GeneralNewsExtractor。