python爬虫基础内容_爬虫中什么内容是可以正常爬取到页面html内容的

最新推荐文章于 2024-05-13 02:52:29 发布

饱和面试题

最新推荐文章于 2024-05-13 02:52:29 发布

阅读量282

点赞数 5

分类专栏：程序员文章标签： python 爬虫 html

本文链接：https://blog.csdn.net/m0_60635035/article/details/138345318

版权

程序员专栏收录该内容

185 篇文章 0 订阅

订阅专栏

这会涉及到数据库、网络服务器、HTTP协议、HTML、数据科学、网络安全、图像处理等非常多的内容。但对于初学者而言，并不需要掌握这么多。

二、python要学习到什么程度

如果你不懂python，那么需要先学习python这门非常easy的语言（相对其它语言而言）。

编程语言基础语法无非是数据类型、数据结构、运算符、逻辑结构、函数、文件IO、错误处理这些，学起来会显枯燥但并不难。

刚开始入门爬虫，你甚至不需要去学习python的类、多线程、模块之类的略难内容。找一个面向初学者的教材或者网络教程，花个十几天功夫，就能对python基础有个三四分的认识了，这时候你可以玩玩爬虫喽！

当然，前提是你必须在这十几天里认真敲代码，反复咀嚼语法逻辑，比如列表、字典、字符串、if语句、for循环等最核心的东西都得捻熟于心、于手。

教材方面比较多选择，我个人是比较推荐python官方文档以及python简明教程，前者比较系统丰富、后者会更简练。

三、为什么要懂HTML

前面说到过爬虫要爬取的数据藏在网页里面的HTML里面的数据，有点绕哈！

维基百科是这样解释HTML的

超文本标记语言（英语：
Hyper
Text
Markup
Language，简称：
HTML）是一种用于创建
网页的标准
标记语言。HTML是一种基础技术，常与
CSS、
JavaScript一起被众多网站用于设计网页、网页应用程序以及移动应用程序的用户界面
[3]。
网页浏览器可以读取HTML文件，并将其渲染成可视化网页。HTML描述了一个网站的结构语义随着线索的呈现，使之成为一种标记语言而非
编程语言。

总结一下，HTML是一种用于创建网页的标记语言，里面嵌入了文本、图像等数据，可以被浏览器读取，并渲染成我们看到的网页样子。

所以我们才会从先爬取HTML，再解析数据，因为数据藏在HTML里。

学习HTML并不难，它并不是编程语言，你只需要熟悉它的标记规则，这里大致讲一下。

HTML标记包含标签（及其属性）、基于字符的数据类型、字符引用和实体引用等几个关键部分。

HTML标签是最常见的，通常成对出现，比如<**h1**>与</**h1**>。

这些成对出现的标签中，第一个标签是开始标签，第二个标签是结束标签。两个标签之间为元素的内容（文本、图像等），有些标签没有内容，为空元素，如<**img**>。

以下是一个经典的Hello World程序的例子：

<!DOCTYPE html>
<html>
  <head>
    <title>This is a title</title>
  </head>
  <body>
    <p>Hello world!</p>
  </body>
</html>

HTML文档由嵌套的HTML元素构成。它们用HTML标签表示，包含于尖括号中，如<**p**>[56]

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

饱和面试题

关注

5
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
python爬虫基础内容_爬虫中什么内容是可以正常爬取到页面html内容的

这会涉及到数据库、网络服务器、HTTP协议、HTML、数据科学、网络安全、图像处理等非常多的内容。但对于初学者而言，并不需要掌握这么多。
复制链接

扫一扫

专栏目录

python爬虫基础内容_爬虫中什么内容是可以正常爬取到页面html内容的

二、python要学习到什么程度

三、为什么要懂HTML

“相关推荐”对你有帮助么？