爬虫 day04

最新推荐文章于 2024-02-20 16:59:05 发布

weixin_44372247

最新推荐文章于 2024-02-20 16:59:05 发布

阅读量73

点赞数

分类专栏： Python

Python 专栏收录该内容

9 篇文章 0 订阅

订阅专栏

实战大项目：模拟登录丁香园，并抓取论坛页面所有的人员基本信息与回复帖子内容。
丁香园论坛：http://www.dxy.cn/bbs/thread/626626#626626

参考：https://blog.csdn.net/tntzs666/article/details/88319980
###############################################
from selenium import webdriver
import time
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.common.exceptions import TimeoutException, NoSuchElementException

# 声明浏览器对象
browser = webdriver.Chrome()
browser.get(“http://www.dxy.cn/bbs/thread/626626#626626”)

def login_dxy(browser):
try:
#点击登录
browser.find_element_by_xpath(’//div[@class=“nav_account”]/a[1]’).click()
#点击返回电脑登录
browser.find_element_by_xpath(’//div[@class=“login__tab_wp”]/a[2]/i’).click()
elem = browser.find_element_by_name(“username”)
elem.clear() # 清空
elem.send_keys(“") # 填入你的账号
#获取登录密码
elem = browser.find_element_by_name(“password”)
elem.clear()
elem.send_keys("***”) #填上你的密码

    print("开始登陆...")
    browser.find_element_by_xpath("//button").click() #点击登录按钮登录

except TimeoutException:
    print("Time Out")
except NoSuchElementException:
    print("No Element")

def get_information(browser):
print(“登录成功”)
time.sleep(10)
print(“开始获取信息。。。”)
elems = browser.find_elements_by_css_selector(".auth") #发帖人姓名
conts = browser.find_elements_by_css_selector(".con") 发帖的信息
for elem in elems:
auth = elem.find_element_by_tag_name(“a”)
print(auth.text)
for con in conts:
content = con.find_element_by_tag_name(“td”)
print(content.text)

# 滚动加载
def scroll_load(browser):
#利用 execute_script() 方法将进度条下拉到最底部
browser.execute_script(“window.scrollTo(0, document.body.scrollHeight);”)
browser.implicitly_wait(2) # 隐式等待

# 主函数
def main():
login_dxy(browser) # 登录函数
#for i in range(2): #定义滚动次数
get_information(browser) # 获取标题与链接
#scroll_load(browser) # 滚动
time.sleep(1) # 休眠

# 函数入口调用
if name == ‘main’:
main()

input("按任意键退出-> ")
browser.quit()

weixin_44372247

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
爬虫 day04

实战大项目：模拟登录丁香园，并抓取论坛页面所有的人员基本信息与回复帖子内容。丁香园论坛：http://www.dxy.cn/bbs/thread/626626#626626参考：https://blog.csdn.net/tntzs666/article/details/88319980###############################################from ...
复制链接

扫一扫