爬虫 day04

实战大项目:模拟登录丁香园,并抓取论坛页面所有的人员基本信息与回复帖子内容。
丁香园论坛:http://www.dxy.cn/bbs/thread/626626#626626

参考:https://blog.csdn.net/tntzs666/article/details/88319980
###############################################
from selenium import webdriver
import time
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.common.exceptions import TimeoutException, NoSuchElementException

# 声明浏览器对象
browser = webdriver.Chrome()
browser.get(“http://www.dxy.cn/bbs/thread/626626#626626”)

def login_dxy(browser):
try:
#点击登录
browser.find_element_by_xpath(’//div[@class=“nav_account”]/a[1]’).click()
#点击返回电脑登录
browser.find_element_by_xpath(’//div[@class=“login__tab_wp”]/a[2]/i’).click()
elem = browser.find_element_by_name(“username”)
elem.clear() # 清空
elem.send_keys(“") # 填入你的账号
#获取登录密码
elem = browser.find_element_by_name(“password”)
elem.clear()
elem.send_keys("
***”) #填上你的密码

    print("开始登陆...")
    browser.find_element_by_xpath("//button").click() #点击登录按钮登录

except TimeoutException:
    print("Time Out")
except NoSuchElementException:
    print("No Element")

def get_information(browser):
print(“登录成功”)
time.sleep(10)
print(“开始获取信息。。。”)
elems = browser.find_elements_by_css_selector(".auth") #发帖人姓名
conts = browser.find_elements_by_css_selector(".con") 发帖的信息
for elem in elems:
auth = elem.find_element_by_tag_name(“a”)
print(auth.text)
for con in conts:
content = con.find_element_by_tag_name(“td”)
print(content.text)

# 滚动加载
def scroll_load(browser):
#利用 execute_script() 方法将进度条下拉到最底部
browser.execute_script(“window.scrollTo(0, document.body.scrollHeight);”)
browser.implicitly_wait(2) # 隐式等待

# 主函数
def main():
login_dxy(browser) # 登录函数
#for i in range(2): #定义滚动次数
get_information(browser) # 获取标题与链接
#scroll_load(browser) # 滚动
time.sleep(1) # 休眠

# 函数入口调用
if name == ‘main’:
main()

input("按任意键退出-> ")
browser.quit()
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值