Python爬虫Xpath定位数据的方法

最新推荐文章于 2024-09-10 21:56:43 发布

Python量化投资、代码解析与论文精读

最新推荐文章于 2024-09-10 21:56:43 发布

阅读量821

点赞数

文章标签： python 爬虫 chrome

本文链接：https://blog.csdn.net/weixin_39559994/article/details/125647638

版权

方法一：直接右键，将文章路径复制下来点击Copy full Xpath

使用selenium+lxml中的etree进行配合使用，使用etree解析html网页

import requests
from lxml import etree
import time
import socket
import csv
from selenium import webdriver
from configparser import ConfigParser
from selenium.webdriver import Chrome
from selenium.webdriver import ChromeOptions


#禁止图片和css加载
chrome_options = webdriver.ChromeOptions()
prefs = {"profile.managed_default_content_settings.images": 2}
chrome_options.add_experimental_option("prefs", prefs)

option = ChromeOptions()
option.add_experimental_option('excludeSwitches', ['enable-automation'])
# 如果想加载图片，就把下面第二句话改第一句话，删掉上面的“禁止图片和css加载”部分
# wb = Chrome(options=option)
wb=webdriver.Chrome(options=chrome_options)

#最大化窗口、输入网址、等待至网页加载完成（防止元素还没加载出来就开始爬了这样自然爬不到数据。如果一直加载不出就等10秒，加载好了就立刻结束等待）
wb.maximize_window()
wb.get("https://www.tianyancha.com/")
wb.implicitly_wait(5)

然后获取网页数据，这里表明哪怕后面出错了，仍然可以延续wb的位置继续控制浏览器

data = wb.page_source
time.sleep(3)

data = wb.page_source
time.sleep(3)
page_all.append(data)
html = etree.HTML(data)
company = html.xpath('/html/body/div/div/div[2]/div/div[1]/div[1]/div[3]/div[1]/div[1]/div[1]/h1/text()')
print(company )