Python爬虫基础之HTTP基本原理

91 篇文章 0 订阅
91 篇文章 0 订阅

HTTP基本原理

在写爬虫之前,我们还需要了解一些基础知识,如HTTP原理、网页的基础知识、爬虫的基本原理、Cookies的基本原理等。我们还会详细了解HTTP的基本原理,了解在浏览器中敲入URL到获取网页内容之间发生了什么。了解了这些内容,有助于我们进一步了解爬虫的基本原理。

URI和URL

这里我们先了解一下URI和URL,URI的全称为Uniform Resource Identifier,即统一标志符,URL的全称为Universal Resource Locator,即统一资源定位符。举例来说,我们可以找到GitHub的网站图标链接:

image

它是一个URL,也是一个URI。即有这样一个图标资源,我们用URL/URI来指定了它的访问方式,这其中包括了访问协议https、访问路径(/即根目录)和资源名称favicon.ico。通过这样一个链接,我们便可以从互联网上找到这个资源,这就是URL/URI。

URL是URI的子集,也就是说每个URL都是URI,但不是每个URI都是URL。那么,怎样的URI不是URL呢?URI还包括一个子类叫做URN,它的全称为Universal Resource Name,即统一资源名称。URN只命名资源而不指定如何定位资源,比如urn:isbn:0451450523指定了一本书的ISBN,可以唯一标识这本书,但是没有指定到哪里定位这本书,这就是URN。URL、URN以及URI的关系可以表示为URI内部有两个部分,一部分为URL;一部分为URN。但是在目前的互联网中,URN用的非常少,所以几乎所有的URI都是URL,一般的网页链接我们既可以称为URL,也可以称为URI。我喜欢称呼它为URL。

超文本

接下来,我们再了解一个概念——超文本,其英文名称叫做hypertext,我们在浏览器里看到的网页就是超文本解析而成的,其网页源码是一系列HTML代码,里面包含了一系列标签,比如img显示图片,p指定显示段落等。浏览器解析这些标签之后,便形成了我们平常看到的网页,而网页的源代码HTML就可以称作超文本。

例如,我们在Chrome浏览器里面打开任意一个页面,如淘宝首页,右击任意地方并选择检查项,即可打开浏览器开发者工具,这时在Elements选项卡即可看到当前网页的源代码,这些源代码都是超文本:

image

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值