案例:数据提取/数据获取/爬虫—工具篇—影刀

介绍

影刀
批量数据抓取
在这里插入图片描述

在这里插入图片描述

案例

官方案例1

3条命令实现批量数据抓取
在这里插入图片描述
命令含义
在这里插入图片描述
第一步:
提前用谷歌浏览器打开数据抓取的网址
在这里插入图片描述
在这里插入图片描述

第二步:数据提取
在这里插入图片描述
在这里插入图片描述
加分功能1:抓取多页,需获取元素
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
加分功能2:网页加载时间过长,可以调整“翻页间隔的时长”;网页有弹框类信息遮挡翻页按钮,可以取消模拟人工点击翻页按钮选项,通过底层代码去点击。
在这里插入图片描述

第三步:数据存到excel保留到本地

1、输出数据结果
在这里插入图片描述
在这里插入图片描述
2、保存的excel
在这里插入图片描述
第四步:自定义编辑数据
首先,点击“不是我想要”
在这里插入图片描述

然后,再捕获相似元素
在这里插入图片描述

数据就会自动获取,接着,可“新增一列”,重复上述操作即可
在这里插入图片描述

注意,若出现如下报错,只需要重选相似元素捕获即可。
在这里插入图片描述

其次,可以通过鼠标自由调整列,点击三点,可以进行列表插入等操作。
在这里插入图片描述
其中,有“编辑列”,类似捕获元素时的元素编辑,是该列的元素属性。通过“校验元素”,可以验证捕获元素是否正常,有问题时需要进行元素编辑。
在这里插入图片描述
在这里插入图片描述
其中,还有“提取为链接列”,适用于有超链接的捕获
在这里插入图片描述
在这里插入图片描述
捕获后已经自动提取了超链接,如果没有提取
在这里插入图片描述
则,手动选择“提取为链接列”
在这里插入图片描述

其中,还有还有“处理列数据”,需要学习“正则表达式
在这里插入图片描述

案例2

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

import xbot
import xbot_visual
from . import package
from .package import variables as glv
import time

def main(args):
    try:
        web_page = xbot_visual.web.create(web_type="cef", value="https://uland.taobao.com/sem/tbsearch?refpid=mm_26632258_3504122_32538762&keyword=%E7%AC%94%E8%AE%B0%E6%9C%AC%E7%94%B5%E8%84%91&clk1=08d140917a02706d0af264930b2a9309&upsId=08d140917a02706d0af264930b2a9309&spm=a2e0b.20350158.search.1&pid=mm_26632258_3504122_32538762&union_lens=recoveryid%3A201_33.54.87.175_4881315_1660392167968%3Bprepvid%3A201_33.54.87.175_4881315_1660392167968", wait_load_completed=True, load_timeout="20", stop_load_if_load_timeout="handleExcept", chrome_file_name=None, edge_file_name=None, ie_file_name=None, bro360_file_name=None, firefox_file_name=None, arguments=None, _block=("main", 1, "打开网页"))
        for _xbot_retry_time in range(4):
            try:
                web_page2 = xbot_visual.web.get(web_type="cef", mode="url", value="https://uland.taobao.com/sem/tbsearch?refpid=mm_26632258_3504122_32538762&keyword=%E7%AC%94%E8%AE%B0%E6%9C%AC%E7%94%B5%E8%84%91&clk1=08d140917a02706d0af264930b2a9309&upsId=08d140917a02706d0af264930b2a9309&spm=a2e0b.20350158.search.1&pid=mm_26632258_3504122_32538762&union_lens=recoveryid%3A201_33.54.87.175_4881315_1660392167968%3Bprepvid%3A201_33.54.87.175_4881315_1660392167968", use_wildcard=False, wait_load_completed=True, load_timeout="20", stop_load_if_load_timeout="handleExcept", open_page=False, url=None, _block=("main", 2, "获取已打开的网页对象"))
                break
            except Exception as e:
                if _xbot_retry_time == 3:
                    raise e
                else:
                    xbot_visual.programing.log(type='info', text=f'第2条指令: {e}')
            time.sleep(3)
        file_path = xbot_visual.programing.databook.export_data(folder_source="desktop", custom_folder_path="", file_name="影刀数据表格.xlsx", export_header=True, _block=("main", 3, "数据表格导出"))
        web_data_table = xbot_visual.web.element.data_scraping(browser=web_page2, table_element=package.selector("数据列表3"), handle_pager=False, page_element=None, max_page="0", page_interval="1", simulate_click_page=True, save_to_datasheet=True, _block=("main", 4, "批量数据抓取"))
    finally:
        pass


第一步:安装库,遇到以下问题
在这里插入图片描述
进入https://pypi.org/project/x-bot/#files
在这里插入图片描述

在这里插入图片描述
将下载的包放在d盘,方便pip install下载
在这里插入图片描述
但是,没有找到xbot_visual
在这里插入图片描述
强化下载: pip install -i https://pypi.tuna.tsinghua.edu.cn/simple --trusted-host pypi.tuna.tsinghua.edu.cn xbot_visual
在这里插入图片描述

在这里插入图片描述

  • 4
    点赞
  • 20
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 2
    评论
好的,我了解您的问题了。下面是我的回答: 爬虫基础知识介绍: 爬虫是一种自动化程序,能够模拟人类浏览网页的行为,从中获取所需信息。爬虫的本质是发送 HTTP 请求,获取服务器返回的数据,并对数据进行处理和分析。 爬虫基本流程: 1. 发送 HTTP 请求获取网页数据; 2. 解析网页数据提取所需信息; 3. 保存信息。 获取数据获取数据的模块有很多,比如urllib模块、requests模块等。urllib是Python自带的HTTP请求库,可以发送HTTP请求并获取HTTP响应。requests是第三方HTTP请求库,功能更加强大,使用更加方便。 下面是使用requests模块获取网页数据的示例代码: ```python import requests url = 'https://www.baidu.com' response = requests.get(url) html = response.text ``` 分析数据: 分析数据工具有很多,比如BeautifulSoup、正则表达式和Xpath等。BeautifulSoup最为常用,它是一个HTML/XML的解析器,可以将HTML/XML文档转换成一个复杂的树形结构,便于我们对其进行分析。 下面是使用BeautifulSoup解析网页数据的示例代码: ```python from bs4 import BeautifulSoup soup = BeautifulSoup(html, 'html.parser') title = soup.title.string ``` 保存数据保存数据的方法有很多,可以将数据保存到文件、数据库等。在Python中,我们可以使用内置的文件操作函数打开文件并写入数据。 下面是将数据保存到文件的示例代码: ```python with open('data.txt', 'w', encoding='utf-8') as f: f.write(title) ``` 以上就是爬虫基础知识介绍、爬虫基本流程以及获取数据、分析数据保存数据的相关模块和工具的简单介绍。希望对您有所帮助!

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

fo安方

觉得俺的文章还行,感谢打赏,爱

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值