2024年Python最新Python爬虫学习教程：天猫商品数据爬虫

最新推荐文章于 2024-05-28 06:00:11 发布

2401_84584628

最新推荐文章于 2024-05-28 06:00:11 发布

阅读量1k

点赞数 9

分类专栏：程序员文章标签： python 爬虫学习

本文链接：https://blog.csdn.net/2401_84584628/article/details/138366525

版权

程序员专栏收录该内容

121 篇文章 0 订阅

订阅专栏

from pyquery import PyQuery as pq

from time import sleep

#定义一个taobao类

class taobao_infos:

#对象初始化

def init(self):

url = ‘https://login.taobao.com/member/login.jhtml’

self.url = url

options = webdriver.ChromeOptions()

options.add_experimental_option(“prefs”, {“profile.managed_default_content_settings.images”: 2}) # 不加载图片,加快访问速度

options.add_experimental_option(‘excludeSwitches’, [‘enable-automation’]) # 此步骤很重要，设置为开发者模式，防止被各大网站识别出来使用了Selenium

self.browser = webdriver.Chrome(executable_path=chromedriver_path, options=options)

self.wait = WebDriverWait(self.browser, 10) #超时时长为10s

#延时操作,并可选择是否弹出窗口提示

def sleep_and_alert(self,sec,message,is_alert):

for second in range(sec):

if(is_alert):

alert = “alert(”" + message + “:” + str(sec - second) + “秒”)"

self.browser.execute_script(alert)

al = self.browser.switch_to.alert

sleep(1)

al.accept()

else:

sleep(1)

#登录淘宝

def login(self):

打开网页

self.browser.get(self.url)

自适应等待，点击密码登录选项

self.browser.implicitly_wait(30) #智能等待，直到网页加载完毕，最长等待时间为30s

self.browser.find_element_by_xpath(‘//*[@class=“forget-pwd J_Quick2Static”]’).click()

自适应等待，点击微博登录宣传

self.browser.implicitly_wait(30)

self.browser.find_element_by_xpath(‘//*[@class=“weibo-login”]’).click()

自适应等待，输入微博账号

self.browser.implicitly_wait(30)

self.browser.find_element_by_name(‘username’).send_keys(weibo_username)

自适应等待，输入微博密码

self.browser.implicitly_wait(30)

self.browser.find_element_by_name(‘password’).send_keys(weibo_password)

自适应等待，点击确认登录按钮

self.browser.implicitly_wait(30)

self.browser.find_element_by_xpath(‘//*[@class=“btn_tip”]/a/span’).click()

直到获取到淘宝会员昵称才能确定是登录成功

taobao_name = self.wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, '.site-nav-bd > ul.site-nav-bd-l > li#J_SiteNavLogin > div.site-nav-menu-hd > div.site-nav-user > a.site-nav-login-info-nick ')))

输出淘宝昵称

print(taobao_name.text)

获取天猫商品总共的页数

def search_toal_page(self):

等待本页面全部天猫商品数据加载完毕

good_total = self.wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, ‘#J_ItemList > div.product > div.product-iWrap’)))

#获取天猫商品总共页数

number_total = self.wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, ‘.ui-page > div.ui-page-wrap > b.ui-page-skip > form’)))

page_total = number_total.text.replace(“共”,“”).replace(“页，到第页确定”,“”).replace(“，”,“”)

return page_total

翻页操作

def next_page(self, page_number):

等待该页面input输入框加载完毕

input = self.wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, ‘.ui-page > div.ui-page-wrap > b.ui-page-skip > form > input.ui-page-skipTo’)))

等待该页面的确定按钮加载完毕

submit = self.wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, ‘.ui-page > div.ui-page-wrap > b.ui-page-skip > form > button.ui-btn-s’)))

清除里面的数字

input.clear()

重新输入数字

input.send_keys(page_number)

强制延迟1秒，防止被识别成机器人

sleep(1)

点击确定按钮

submit.click()

模拟向下滑动浏览

def swipe_down(self,second):

for i in range(int(second/0.1)):

js = “var q=document.documentElement.scrollTop=” + str(300+200*i)

self.browser.execute_script(js)

sleep(0.1)

js = “var q=document.documentElement.scrollTop=100000”

self.browser.execute_script(js)

sleep(0.2)

爬取天猫商品数据

def crawl_good_data(self):

对天猫商品数据进行爬虫

self.browser.get(“https://list.tmall.com/search_product.htm?q=羽毛球”)

err1 = self.browser.find_element_by_xpath(“//*[@id=‘content’]/div/div[2]”).text

err1 = err1[:5]

if(err1 == “喵~没找到”):

print(“找不到您要的”)

return

try:

self.browser.find_element_by_xpath(“//*[@id=‘J_ComboRec’]/div[1]”)

err2 = self.browser.find_element_by_xpath(“//*[@id=‘J_ComboRec’]/div[1]”).text

#print(err2)

err2 = err2[:5]

if(err2 == “我们还为您”):

print(“您要查询的商品书目太少了”)

return

except:

print(“可以爬取这些信息”)

获取天猫商品总共的页数

page_total = self.search_toal_page()

print(“总共页数” + page_total)

遍历所有页数

for page in range(2,int(page_total)):

等待该页面全部商品数据加载完毕

good_total = self.wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, ‘#J_ItemList > div.product > div.product-iWrap’)))

等待该页面input输入框加载完毕

如果你也是看准了Python，想自学Python，在这里为大家准备了丰厚的免费学习大礼包，带大家一起学习，给大家剖析Python兼职、就业行情前景的这些事儿。

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

二、学习软件

工欲善其必先利其器。学习Python常用的开发软件都在这里了，给大家节省了很多时间。

三、全套PDF电子书

书籍的好处就在于权威和体系健全，刚开始学习的时候你可以只看视频或者听某个人讲课，但等你学完之后，你觉得你掌握了，这时候建议还是得去看一下书籍，看权威技术书籍也是每个程序员必经之路。

四、入门学习视频

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了。

四、实战案例

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。

五、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

成为一个Python程序员专家或许需要花费数年时间，但是打下坚实的基础只要几周就可以，如果你按照我提供的学习路线以及资料有意识地去实践，你就有很大可能成功！
最后祝你好运！！！

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

2401_84584628

关注

9
点赞
踩
16

收藏

觉得还不错? 一键收藏
0
评论
2024年Python最新Python爬虫学习教程：天猫商品数据爬虫

定义一个taobao类#对象初始化def(self):options.add_experimental_option(“prefs”, {“profile.managed_default_content_settings.images”: 2}) # 不加载图片,加快访问速度。
复制链接

扫一扫