现在爬虫1中的得到的数据粘贴到txt文件中,改为html文件后缀,得到的结果却不是我们看到的百度首页那样,难道我写错了,请不要怀疑,你得到的数据就是你请求的数据,数据是无辜的。只是你的url不能那样写。url = "http://www.renren.com/",这样你就能得到你想要的首页了,原因嘛,就是你的url地址找错喽,后面我们会说这件事的。人家辛辛苦苦的数据,凭啥你一个爬虫就给获取了,要想得到那也要凭本事,所以就开始反爬了(只要人人都献出一点爱,那么这个时间将变得多么美好),不过,作为一名爬虫工程师,我们不能怕反爬。有难度挑战才有意思嘛。如果是你,你怎么反爬,首先我会想,我怎么判断你的请求是浏览器发过来的还是程序在访问,如果是程序,哼哼,禁止访问。作为一名爬虫工程师,我就要像,我怎么伪装成和浏览器一样能,这时,我们打开浏览器,来到百度首页,右键选择检查,选择network按钮(我用的是谷歌)
人家浏览器发送请求的时候不仅有url,还有request headers,所以,我要是把headers都带上,是不是就是和浏览器一样了呢,答案是肯定的,这些都粘贴嘛,不要懒,都粘贴,都是程序员是最懒的,捂脸!后面我会说怎么选择性的粘。这样我们的程序就是一个浏览器了。洗个澡,回来聊