资深程序员：新人学习pyhton需要快速掌握的知识点

本文链接：https://blog.csdn.net/sdafhkjas/article/details/102455763

想要利用python爬取数据资料，本人目前也正在学习Python网络爬虫，我就从爬虫谈谈python的学习。个人认为可以分为两步走：1.学会python语言编程基础；2.学习python网络爬虫。
一学习python语言编程基础
1.建立python环境，python版本的选择，个人强烈推荐pyhton3。因为python2会在2020年停止支持，以及官方在python3上的推动和python社区支持这两个方面来看，未来的python圈，应该持续接纳python3。另外官网提供的python3，需要自己设置path环境变量，还有许多科学计算库，都需要自己手动安装，对于题主零基础，推荐使用python的发行版本anaconda。
2 学习python的基本数据类型和运算符。掌握数值、字符串、列表、字典、元组的使用方法以及运算符的使用，自己可以使用多多python练习。
3.学会使用流程语句和函数：要重点掌握if判断语句、for与while循环语句的使用、函数的定义。学到这里就可以利用python编写小程序解决一些应用题了。接下来可以学习常用模块的使用。比如常见的os、time、os.path模块等。如果遇到使用上的问题，可以查看python帮助文件。比如说你想要查看字符串str的spilt属性，可以在命令行中输入help(str.spilt)，个人认为最好的方法还是去找度娘啦。
二.学习python网络爬虫
有了前面的python语言基础，现在就可以学习python网络爬虫了。
python网络爬虫主要分为两种方式：1.手写网络爬虫 2.利用scrapy框架
三初级阶段1、学习Urllib库与URL异常处理。要掌握Urllib库的用法，如果遇到反爬虫要学会浏览器的模拟，网络长时间未响应时进行超时设置，掌握HTTP请求协议（主要是get请求和post请求）是爬虫写法，另外爬虫如果遇到异常，应该怎么进行异常处理。2、学会正则表达式与cookie的使用。自己可以将常见的正则表达式整理下来，比如说用正则表达式匹配电子邮件地址。
四进阶阶段
学会使用爬虫的浏览器的伪装技术。通过设置Headers信息的User-Agent字段来进行反爬虫，通过代理服务器使用IP池进行反爬虫，利用一些工具软件也可以进行反爬虫。
五高阶阶段
了解多线程爬虫。这个反正我是不会啦，对于题主只想爬取点数据资料什么的，前面两阶段就已经足够了，20%的技能往往能够解决80%问题。
如果是使用scrapy框架来编写python爬虫的话，要懂得items、pipelines、settings这些文件怎么设置，另外学会使用XPath表达式的用法以及怎么使用Python操作数据库。
到最后给大家推荐一篇文章可以去学习下：https://blog.csdn.net/sdafhkjas/article/details/102373247,会有不一样的收获