python爬虫实训心得_记录一次用Python写爬虫的心得

最新推荐文章于 2022-10-24 20:38:32 发布

weixin_39938165

最新推荐文章于 2022-10-24 20:38:32 发布

阅读量1.5k

点赞数

文章标签： python爬虫实训心得

现在网络爬虫有很多方式可以写，比如Node.js或者Go, 甚至PHP都行，我之所以选择Python的原因是因为教程多，可以系统学习，因为光懂得使用Html选择器来爬去页面是不够的，我还要想学习一些爬虫过程中常见的坑，以及一些注意事项，比如修改浏览器的Header之类的小技巧。

前前后后弄了一个星期，看书+写代码，我写出了一个基本能用的python爬虫小代码，github地址：https://github.com/qiujumper/...

代码注释都很详细了，其实只要直接阅读源码即可。

这个爬虫的目的很简单，爬去某个房产网站的楼盘名字+价格+1张图片的下载（单纯测试文件下载功能），以备之后分析房价走势而用，为了不给对方服务器增加太多压力，我只选择了爬取3个页面。

我这里说说几个需要注意的知识点吧：

#记得修改发送的Headers

听说默认发送过去的都是带有python信息的头，很容易被对方网站检查出是一个爬虫机器人，导致IP被封，所以最好让自己的爬虫程序像人类一点，但是这个代码只能起到一般的隐瞒，真的有网站想防止爬虫，你也是骗不过的，上代码：

headers = {"User-Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_9_5) AppleWebKit 537.36 (KHTML, like Gecko) Chrome",

"Accept":"text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8"

最低0.47元/天解锁文章

weixin_39938165

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
python爬虫实训心得_记录一次用Python写爬虫的心得

现在网络爬虫有很多方式可以写，比如Node.js或者Go, 甚至PHP都行，我之所以选择Python的原因是因为教程多，可以系统学习，因为光懂得使用Html选择器来爬去页面是不够的，我还要想学习一些爬虫过程中常见的坑，以及一些注意事项，比如修改浏览器的Header之类的小技巧。前前后后弄了一个星期，看书+写代码，我写出了一个基本能用的python爬虫小代码，github地址：https://git...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。