selenium入门——爬动态网站

最新推荐文章于 2022-10-28 20:51:49 发布

我啊困的唉

最新推荐文章于 2022-10-28 20:51:49 发布

阅读量6.2k

点赞数 2

分类专栏：爬虫 python 文章标签： selenium python 机器学习

本文链接：https://blog.csdn.net/ahc176/article/details/120311241

版权

python 同时被 2 个专栏收录

16 篇文章 0 订阅

订阅专栏

爬虫

6 篇文章 0 订阅

订阅专栏

一、安装webdriver：

下载：

http://chromedriver.storage.googleapis.com/index.html

将下载的chromedriver.exe驱动直接复制到python环境的scripts目录中

尝试用selenium打开csdn：

from selenium import webdriver
#1. 获取浏览器对象
# webdriver.Chrome(executable_path='executable_path = 'D:\pythonProject\\venv\Scripts\chromedriver.exe'')#没有导入驱动，就以相对路径的方式引入
browser = webdriver.Chrome()#将驱动导入到了scripts目录中
#2. 请求url
url = "https://www.csdn.net/"
#3. 窗口最大化
browser.maximize_window()
browser.get(url)

2.查找内容模拟操作点击：

from selenium import webdriver
#1. 获取浏览器对象
# webdriver.Chrome(executable_path='executable_path = 'D:\pythonProject\\venv\Scripts\chromedriver.exe'')#没有导入驱动，就以相对路径的方式引入
browser = webdriver.Chrome()#将驱动导入到了scripts目录中
#2. 请求url
url = "https://www.csdn.net/"
#3. 窗口最大化
browser.maximize_window()
browser.get(url)
#  send_keys:输入框内容
browser.find_element_by_css_selector("#toolbar-search-input").send_keys("爬虫真好玩")
#  click：点击事件
browser.find_element_by_css_selector("#toolbar-search-button").click()
 #  clear:清空输入框内容
browser.find_element_by_css_selector("#toolbar-search-input").clear()

3.爬取文章题目：

import time
from selenium import webdriver
import scrapy
#1. 获取浏览器对象
# webdriver.Chrome(executable_path='executable_path = 'D:\pythonProject\\venv\Scripts\chromedriver.exe'')#没有导入驱动，就以相对路径的方式引入
browser = webdriver.Chrome()#将驱动导入到了scripts目录中
#2. 请求url
url = "https://www.csdn.net/"
#3. 窗口最大化
browser.maximize_window()
browser.get(url)
#  send_keys:输入框内容
browser.find_element_by_css_selector("#toolbar-search-input").send_keys("爬虫真好玩")
#  click：点击事件
browser.find_element_by_css_selector("#toolbar-search-button").click()
 #  clear:清空输入框内容
browser.find_element_by_css_selector("#toolbar-search-input").clear()
browser.switch_to_window(browser.window_handles[1])
time.sleep(5)
li_list=[]
li_list = browser.find_elements_by_xpath('//div[@class="so-items-normal"]/div[1]')
#print(li_list[0].text)
for i in li_list:
    print(i.text)