网络爬虫的基本概念

网络爬虫是一种自动抓取互联网信息的程序,常用于收集大量数据。Python因其简洁高效的特点成为爬虫开发的常用语言。本文介绍了爬虫的工作原理,包括网页的URL结构、HTTP/HTTPS协议,以及DNS系统。同时,讨论了通用爬虫和聚焦爬虫的区别,并简述了HTTP的三次握手和四次挥手过程。
摘要由CSDN通过智能技术生成

1 . 数据来源:

  1. 企业产生的用户数据
  2. 政府/机构提供的公开数据
  3. 第三方数据平台购买数据
  4. 爬虫爬取数据

2 . 爬虫的定义 : 爬虫又称网页蜘蛛,网络机器人,是一种按照一定规则,自动抓取互联网上相应的信息。

3 . 爬虫的工作原理 :

       1 . 网页三大特征:

1 . 有自己唯一的URL(统一资源定位器)一个URL是由四部分组成:“协议,域名,路径,参数”。

              2 . 都是使用HTML来描述页面

              3 . 都使用HTTP/https(超文本传输协议)来传输HTML数据

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值