python 模拟浏览器selenium_Selenium 模拟浏览器动态加载页面的实现方法

相信爬取大公司的数据时,常常会遇到页面信息动态加载的问题,

如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,

selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。

至于下面的browser变量是什么,看前面的几篇文章。

首先是请求对应的URL:

right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)

print right_URL

try:

browser.get(right_URL)

print "loading more, sleep 3 seconds ... 0"

time.sleep(3) # NO need for this sleep, but we add ...

browser = selenuim_loading_more(browser, method_index=0)

except:

print "one exception happen ==> get_tweeter_under_topic 2 ..."

pass

然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):

def selenuim_loading_more(browser, method_index=0):

if method_index==0:

browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒

# while True:

for i in range(1, 4): # at most 3 times

print "loading more, window.scrollTo bettom for the", i,"time ..."

browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")

try:

# 定位页面底部的换页tab

browser.find_element_by_css_selector("div[class='W_pages']")

break # 如果没抛出异常就说明找到了底部标志,跳出循环

except NoSuchElementException:

pass # 抛出异常说明没找到底部标志,继续向下滑动

browser.implicitly_wait(4) # 将超时时间改回10秒

elif method_index==1:

browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more

print "loading more, sleep 4 seconds ... 1"

time.sleep(4)

browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more

print "loading more, sleep 3 seconds ... 2"

time.sleep(2)

elif method_index==2:

load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more

ActionChains(browser).click(load_more_1).perform()

print "loading more, sleep 4 seconds ... 1"

time.sleep(4)

load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more

ActionChains(browser).click(load_more_2).perform()

print "loading more, sleep 3 seconds ... 2"

time.sleep(2)

elif method_index==3:

print "loading more, sleep 4 seconds ... 1"

element = WebDriverWait(browser, 4).until(

EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))

)

element.click()

print "loading more, sleep 2 seconds ... 2"

WebDriverWait(browser, 2).until(

EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))

).click()

return browser

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持找一找教程网。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值