Python爬虫使用Selenium爬取京东第一页商品的差评

最新推荐文章于 2024-07-30 17:23:09 发布

不当工具人

最新推荐文章于 2024-07-30 17:23:09 发布

阅读量909

点赞数

分类专栏：实验分享文章标签： python 爬虫 selenium

本文链接：https://blog.csdn.net/m0_47373772/article/details/117754009

版权

实验分享专栏收录该内容

2 篇文章 0 订阅

订阅专栏

使用Python中的Selenium库爬取京东口罩第一页的差评

实验目的
Selenium库
谷歌浏览器驱动
参考代码
实验结果
写在最后

实验目的

使用Python中的Selenium库爬取京东口罩第一页的差评，以商品名称保存为txt文件

Selenium库

需要使用Selenium库，如无这个库的话请使用pip命令自行安装

pip install selenium

谷歌浏览器驱动

还需要用到谷歌浏览器驱动，请自行下载对应版本驱动后填入下方代码需要处

http://npm.taobao.org/mirrors/chromedriver/

参考代码

from selenium import  webdriver
import  time
import csv
import re
from selenium.webdriver.support.wait import WebDriverWait
goodslinks=[]
def get_goodslink():
	#填入自己的浏览器驱动位置
    wd=webdriver.Chrome("")
    #打开京东口罩搜索页面
    wd.get("https://search.jd.com/Search?keyword=口罩") 
    time.sleep(4)
    #商品链接获取
    links=wd.find_elements_by_css_selector(".gl-item .gl-i-wrap .p-img a")
    for link in links:
        href=link.get_attribute('href')
        goodslinks.append(href)
    wd.close()
    

def get_goodscomments(urls):
	#填入你的浏览器驱动位置
    wd=webdriver.Chrome("")
    for url in urls:
        wd.get(url)
        time.sleep(3)
        #获取商品名称
        goodsName=wd.find_element_by_css_selector(".itemInfo-wrap .sku-name").text 
        #去除商品名的非法字符
        rightName=re.sub(r"[\/\\\:\*\?\"\<\>\|]", "_", goodsName)  
        # 控制鼠标从上往下滑动到底部
        wd.execute_script("window.scrollTo(0,document.body.scrollHeight);") 
        time.sleep(3)
        #设置显式等待，点击差评按钮
        WebDriverWait(wd,3,0.2).until(lambda x:x.find_element_by_css_selector("#comment ul li:nth-child(7) a")).click()
        time.sleep(3)
        #获取差评
        goodsComment=wd.find_elements_by_xpath('//div[@class = "tab-con"]/div[@id = "comment-6"]//p')
        #写入文件名
        with open("E:\\python文件\\badcomments\\"+ rightName +'.txt','a+', encoding='utf-8-sig') as f: 
                                #badcomments为文件夹名字
            for comment in goodsComment:
                f.writelines(comment.text +'\n')
    wd.close()
        

            
if __name__=="__main__":
    get_goodslink()
    get_goodscomments(goodslinks)

最开始让程序自行爬取商品名称创建txt文件时报错，搜索之后发现创建文件不能有非法字符，此时需要用re.sub()处理非法字符

rightName=re.sub(r"[\/\\\:\*\?\"\<\>\|]", "_", goodsName)

实验结果

在这里插入图片描述

ShiYu Liu

写在最后

博主仅为python新手，本篇博文仅供交流分享，如有不足之处欢迎各位大佬指点！

不当工具人

关注

0
点赞
踩
9

收藏

觉得还不错? 一键收藏
2
评论
Python爬虫使用Selenium爬取京东第一页商品的差评

这里写自定义目录标题欢迎使用Markdown编辑器新的改变功能快捷键合理的创建标题，有助于目录的生成如何改变文本的样式插入链接与图片如何插入一段漂亮的代码片生成一个适合你的列表创建一个表格设定内容居中、居左、居右SmartyPants创建一个自定义列表如何创建一个注脚注释也是必不可少的KaTeX数学公式新的甘特图功能，丰富你的文章UML 图表FLowchart流程图导出与导入导出导入欢迎使用Markdown编辑器你好！这是你第一次使用 Markdown编辑器所展示的欢迎页。如果你想学习如何使用Mar
复制链接

扫一扫