python简易爬虫制作

最新推荐文章于 2024-04-30 19:24:04 发布

ConverseSuger

最新推荐文章于 2024-04-30 19:24:04 发布

阅读量457

点赞数

分类专栏： python爬虫文章标签： python 爬虫

本文链接：https://blog.csdn.net/dic_converse/article/details/52893311

版权

python爬虫专栏收录该内容

6 篇文章 0 订阅

订阅专栏

编译环境：pycharm 4.5.3

python版本：3.5.1

首先从pycharm库中下载并安装BeautifulSoup4，lxml，requests，time插件

以KnewOne为例：

from bs4 import BeautifulSoup
import requests
import time

url='https://knewone.com/things'  
web_data=requests.get(url)  #利用requests访问网页
soup=BeautifulSoup(web_data.text,'lxml') #解析网页
titles=soup.select(' section.content > h4 > a ') #网页元素定位
imgs=soup.select('a.cover-inner > img')
for title,img in zip(titles,imgs):    #少部分数据可以先用字典封装，大数据再考虑用数据库
    data={
        'title':title.get_text(),
        'img':img.get('src'),
    }
    print(data)

此外，发现KnewOne的“产品”页面为一个异步加载网页，那么，如何爬取一页所有的信息呢？

def get_info(url,data=None):
    web_data=requests.get(url)
    soup=BeautifulSoup(web_data.text,'lxml')
    titles=soup.select(' section.content > h4 > a ')
    imgs=soup.select('a.cover-inner > img')

    if(data==None):
        for title,img in zip(titles,imgs):
            data={
                'title':title.get_text(),
                'img':img.get('src'),
            }
            print(data)

def get_mor_pages(start,end):
    for one in range(start,end):
        get_info(url+str(one))

ConverseSuger

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
python简易爬虫制作

编译环境：pycharm 4.5.3python版本：3.5.1首先从pycharm库中下载并安装BeautifulSoup4，lxml，requests，time插件以KnewOne为例：from bs4 import BeautifulSoupimport requestsimport timeurl='https://knewone.com/things'
复制链接

扫一扫