Selenium总结：模拟浏览器动态加载页面

最新推荐文章于 2023-06-02 02:30:00 发布

VIP文章 mmc2015

最新推荐文章于 2023-06-02 02:30:00 发布

阅读量5.2k

点赞数 1

分类专栏： python——爬虫文章标签： Selenium 模拟浏览器动态加载页面 python爬虫

本文链接：https://blog.csdn.net/mmc2015/article/details/53366452

版权

相信爬取大公司的数据时，常常会遇到页面信息动态加载的问题，

如果仅仅使用content = urllib2.urlopen(URL).read()，估计信息是获取不全的，这时候就需要模拟浏览器加载页面的过程，

selenium提供了方便的方法，我也是菜鸟，试了很多种方式，下面提供觉得最靠谱的（已经证明对于爬取新浪微博的topic、twitter under topic完全没问题）。

至于下面的browser变量是什么，看前面的几篇文章。

首先是请求对应的URL：

right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)
print right_URL
try:
	browser.get(right_URL)
	print "loading more, sleep 3 seconds ... 0"
	time.sleep(3) # NO need

最低0.47元/天解锁文章

优惠劵

mmc2015

关注关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
2
评论
Selenium总结：模拟浏览器动态加载页面

相信爬取大公司的数据时，常常会遇到页面信息动态加载的问题，如果仅仅使用content = urllib2.urlopen(URL).read()，估计信息是获取不全的，这时候就需要模拟浏览器加载页面的过程，selenium提供了方便的方法，我也是菜鸟，试了很多种方式，下面提供觉得最靠谱的（已经证明对于爬取新浪微博的topic、twitter under topic完全没问题）。
复制链接

扫一扫