爬虫2

现在爬虫1中的得到的数据粘贴到txt文件中,改为html文件后缀,得到的结果却不是我们看到的百度首页那样,难道我写错了,请不要怀疑,你得到的数据就是你请求的数据,数据是无辜的。只是你的url不能那样写。url = "http://www.renren.com/",这样你就能得到你想要的首页了,原因嘛,就是你的url地址找错喽,后面我们会说这件事的。人家辛辛苦苦的数据,凭啥你一个爬虫就给获取了,要想得到那也要凭本事,所以就开始反爬了(只要人人都献出一点爱,那么这个时间将变得多么美好),不过,作为一名爬虫工程师,我们不能怕反爬。有难度挑战才有意思嘛。如果是你,你怎么反爬,首先我会想,我怎么判断你的请求是浏览器发过来的还是程序在访问,如果是程序,哼哼,禁止访问。作为一名爬虫工程师,我就要像,我怎么伪装成和浏览器一样能,这时,我们打开浏览器,来到百度首页,右键选择检查,选择network按钮(我用的是谷歌)

 

人家浏览器发送请求的时候不仅有url,还有request headers,所以,我要是把headers都带上,是不是就是和浏览器一样了呢,答案是肯定的,这些都粘贴嘛,不要懒,都粘贴,都是程序员是最懒的,捂脸!后面我会说怎么选择性的粘。这样我们的程序就是一个浏览器了。洗个澡,回来聊

 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

v(z_xiansheng88)

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值