备注：爬取百度搜索结果数据

criket

已于 2023-02-28 23:00:53 修改

阅读量360

点赞数

分类专栏： sdu 文章标签： python 开发语言

于 2023-02-28 22:59:33 首次发布

本文链接：https://blog.csdn.net/criket/article/details/129272068

版权

sdu 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

使用chrome的driver爬取数据：

from selenium import webdriver 
from selenium.webdriver.common.by import By 
from selenium.webdriver.common. keys import Keys 
from selenium. webdriver.support import expected_conditions as EC
from selenium. webdriver.support.wait import WebDriverWait 
from selenium.webdriver.common.action_chains import ActionChains
from urllib import request
import requests
from lxml import etree
import pandas as pd

browser = webdriver.Chrome() 

filepath = 'C:/data.csv'

data = pd.read_csv(filepath)
nrows = len(data)

path_data = []
find_data = data['keyword'].values.tolist()

for i in range(0,nrows):
    browser.get('https://www.baidu.com') 
    query =find_data[i]
    input = browser.find_element_by_id ('kw') 
    input.send_keys(query) 
    ActionChains(browser).send_keys(Keys.ENTER).perform()
    #input.send_keys(Keys.ENTER) 
    wait = WebDriverWait(browser, 10) 
    wait.until(EC.presence_of_element_located((By.ID,'content_left'))) 
    #print(browser.current_url) 
    #print(browser.get_cookies()) 
    #print(browser.page_source)   
    source_html = browser.page_source
    html_object=etree.HTML(source_html)
    path_data = html_object.xpath('//div[@id="tsn_inner"]/div[2]/span[1]/text()')
    data['hot_num'][i] = str(path_data)

data.to_excel('C:/百度20230228.xlsx',sheet_name='Sheet1',index=False)

备注：文章就是之前爬取方式的一个变种，增加了chromedriver的下载，使用selenium貌似需要成功安装后才能使用这个方式。