机器学习全过程实战(一)——数据采集与爬取

数据采集概述

爬虫:批量化自动化从特定网页获取数据的脚本程序

Python爬虫技术

Python爬虫技能

  • 静态网页数据抓取(urllib/requests/BeautifulSoup/lxml)

  • 动态网页数据抓取(ajax/phantomjs/selenium)

  • 爬虫框架(scrapy)

  • 补充知识:前端知识、数据库知识、文本处理技术
    Python爬虫环境配置

  • 平台:windows7/10

  • Python开发套件:anaconda 3.5以上(Python3.6)

  • MySQL数据库

  • mongoDB数据库

  • Navicat数据库客户端

  • PyCharm集成开发环境

  • chrome浏览器
    Python爬虫四步基本框架

  • 请求 urllib/requests

  • 解析 BeautifulSoup/lxml

  • 提取 css选择器/xpath表达式/正则表达式

  • 存储 csv/MySQL/mongoDB等

urllib: python的标准库,提供了一系列操作URL的功能

直接使用ur

  • 3
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白话机器学习

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值