驱动键鼠爬取淘宝商品信息方法

最新推荐文章于 2024-07-30 21:09:58 发布

太虚鲲我们走

最新推荐文章于 2024-07-30 21:09:58 发布

阅读量356

点赞数 4

分类专栏：笔记文章标签： python

本文链接：https://blog.csdn.net/desirzhao/article/details/105441162

版权

笔记专栏收录该内容

1 篇文章 0 订阅

订阅专栏

另类爬取淘宝商品信息

一、核心操作

#阅读此文你可能觉得作者我逻辑混乱。第一次在CSDN写博客，请谅解。虽然爬取速度慢（1分钟约30页），但结果爬取成功了。如果你用这程序，需要更改各个需要点击的位置。

用pyautogui（）模拟人的一系列操作，控制鼠标、按键，打开浏览器、输入淘宝网址，搜索商品、复制当前商品页面的 html代码。
用 win32clipboard（）、 win32api（）读取复制的 html代码
用 pyquery（）从html中获取商品信息
pymongo（）存入商品信息

二、过程及结果

1.具体过程看代码。需要提醒的是经常爬取偶尔会弹出一个小窗口，让你休息。运行程序前请确保输入法是英文状态。在这里插入图片描述

2.爬取20页商品信息用时约45秒，从第10秒开始爬取第1页商品信息。
3.如何复制html代码？鼠标放到图中蓝色行，右击，复制、按 O。在这里插入图片描述
4.结果：商品信息在Robo 3t 里。

三、完整代码如下

import win32clipboard as wc
import win32api
import time
import pyautogui
import pymongo
from pyquery import PyQuery as pq

'''
#MongoDB设置
MONGO_URL = 'localhost'
MONGO_DB = 'taobao'
MONGO_TABLE = 'product'
'''

client = pymongo.MongoClient('localhost')
#指定数据库
db = client['taobao']


#保存到mongoDB
def save_to_mongo(result):
    try:
        if db['product'].insert_one(result):
            print('ok')
    except Exception:
        print('存储到MONGODB失败',result)

#打开浏览器，输入淘宝网址，搜索“美食”
def open_Firefox():
    pyautogui.doubleClick(x=643, y=1050, button="left", duration=0.2)
    pyautogui.moveTo(x=703, y=62, duration=0.2)
    time.sleep(0.15)
    pyautogui.click(x=703, y=62, button="left", duration=0.15)

    pyautogui.typewrite(message="https://taobao.com", interval=0.05)
    pyautogui.hotkey('backspace')
    time.sleep(0.2)
    pyautogui.hotkey('enter')
    time.sleep(0.2)

    # 进入淘宝，点击搜索栏
    pyautogui.moveTo(x=905, y=305, duration=0.2)
    #切换输入法
    pyautogui.hotkey('shiftleft')
    time.sleep(0.3)
    # 五笔输入“美食”
    pyautogui.typewrite(message="ugwy", interval=0.36)
    time.sleep(0.2)
    pyautogui.hotkey('1')
    time.sleep(0.1)
    pyautogui.hotkey('enter')


#已经打开淘宝，打开检查元素
def check_html():
    pyautogui.click(x=1688, y=176, button="right", duration=0.25)
    time.sleep(0.1)
    pyautogui.hotkey('q')
    time.sleep(0.1)

#复制html代码
def copy_html():
    pyautogui.click(x=740, y=633, button="right", duration=0.25)
    time.sleep(0.1)
    pyautogui.moveTo(x=795, y=949, duration=0.15)
    time.sleep(0.2)
    # 按O复制html代码
    pyautogui.hotkey('o')
    time.sleep(0.2)

#点击下一页
def next_page1():
    pyautogui.click(x=1907,y=153,button="left",duration=0.25)
    time.sleep(0.15)
    pyautogui.click(x=1417,y=319,button="left",duration=0.25)
    time.sleep(0.15)
#第1页和第2页的“下一页”位置不同
def next_page2():
    pyautogui.click(x=1422,y=429,button="left",duration=0.25)
    time.sleep(0.2)

#获取粘贴板里的内容
def getCopyTxet():
    wc.OpenClipboard()
    copytxet = wc.GetClipboardData()
    wc.CloseClipboard()
    return str(copytxet)

#从html中获取商品信息
def read_html():
    html =getCopyTxet()
    doc = pq(html)
    items = doc('#mainsrp-itemlist .items .item').items()
    for item in items:
        product = {
            'image': item.find('.pic .img').attr('src') or item.find('.pic .img').attr('data-src'),
            'price': item.find('.price').text(),
            'deal': item.find('.deal-cnt').text()[:-3],
            'title': item.find('.title').text(),
            'shop': item.find('.shop').text(),
            'location': item.find('.location').text()
        }
        #print(product)
        save_to_mongo(product)

def main():
    open_Firefox()
    check_html()

    copy_html()
    read_html()
    next_page1()
    for i in range(1,20):
        copy_html()
        read_html()
        next_page2()

if __name__ == '__main__':
    main()

太虚鲲我们走

关注

4
点赞
踩
6

收藏

觉得还不错? 一键收藏
3
评论
驱动键鼠爬取淘宝商品信息方法

另类爬取淘宝商品信息一、核心操作二、过程及结果三、完整代码如下一、核心操作#阅读此文你可能觉得作者我逻辑混乱。第一次在CSDN写博客，请谅解。虽然爬取速度慢（1分钟约30页），但结果爬取成功了。如果你用这程序，需要更改各个需要点击的位置。用pyautogui（）模拟人的一系列操作，控制鼠标、按键，打开浏览器、输入淘宝网址，搜索商品、复制当前商品页面的 html代码。用 win32clip...
复制链接

扫一扫