1 . 数据来源:
- 企业产生的用户数据
- 政府/机构提供的公开数据
- 第三方数据平台购买数据
- 爬虫爬取数据
2 . 爬虫的定义 : 爬虫又称网页蜘蛛,网络机器人,是一种按照一定规则,自动抓取互联网上相应的信息。
3 . 爬虫的工作原理 :
1 . 网页三大特征:
1 . 有自己唯一的URL(统一资源定位器)一个URL是由四部分组成:“协议,域名,路径,参数”。
2 . 都是使用HTML来描述页面
3 . 都使用HTTP/https(超文本传输协议)来传输HTML数据
1 . 数据来源:
2 . 爬虫的定义 : 爬虫又称网页蜘蛛,网络机器人,是一种按照一定规则,自动抓取互联网上相应的信息。
3 . 爬虫的工作原理 :
1 . 网页三大特征:
1 . 有自己唯一的URL(统一资源定位器)一个URL是由四部分组成:“协议,域名,路径,参数”。
2 . 都是使用HTML来描述页面
3 . 都使用HTTP/https(超文本传输协议)来传输HTML数据