python - Web kit 的安装与使用
Web kit 是 一个网页渲染工具。Web kit 可以实现浏览器所能处理的任何事情。对于静态网页,我们只需要把网页地址栏中的url传到get请求中就可以轻松地获取到网页的数据并利用一定的规则从返回的 HTML 数据中提取出有效的信息。但如果想爬取的内容是用 JavaScript 动态加载出来的,我们必须经过渲染处理才能获得想要的数据。
Web kit 是 QT 库的一部分,因此需要安装 QT 和PyQT4 库来使用Web kit
Linux 下安装:
sudo apt-get install python-qt4
Windows 下安装:
whl包下载地址:https://www.lfd.uci.edu/~gohlke/pythonlibs/#pyqt4
下载python对应的版本的包。(温馨提示:目前最新只支持到python3.7)
然后打开cmd
pip install [包路径]
调用方法:
import sys
from PyQt4.QtWebKit import *
from PyQt4.QtGui import *
from PyQt4.QtCore import *
class Render(QWebPage): # 用来渲染网页,将url中的所有信息加载下来并存到一个新的框架中
def __init__(self,url):
self.app = QApplication(sys.argv)
QWebPage.__init__(self)
self.loadFinished.connect(self._loadFinished)
self.mainFrame().load(QUrl(url))
self.app.exec_()
def _loadFinished(self, result):
self.frame = self.mainFrame()
self.app.quit()
url = 'http://www.xxxx.com'
r = Render(url)
html = r.frame.toHtml()
print(html) #打印出经过浏览器渲染的网页