一直关注了他们公司的爬虫技术,用起来也非常不错大家可以去试一试
刚开始学习Python,不愿意看基础,记忆不好,那些语法记不住,直接上个项目,这样比较深刻
刚好公司有个情况要查企业的信息,就想做个爬虫吧,有验证码的不愿意搞,那是个老大难问题,就选择了天眼查
过程都略了,直接写个结果吧,总结出来的步骤如下:
一、天眼查最大的障碍在于字体问题,这个网上都有介绍,大概意思就是说,在网页显示出来的某些字符,是天眼查自己的字体文件处理的。
比如汉字 坐 的utf-8的编码是 b'\\u5750' ,但在天眼查的字体文件里,这个编码对应的汉字是 万 。
这样在页面上某些地方肉眼看到的比如 2500万元,但实际通过标准编码得到的是 2500坐元。其实还有数字,也全部是打乱的。
这样爬到的结果就是后面那个了,这不是我想要的。
二、该字体文件,每天都变,没有固定的,这样想通过做个编码对应表的方法也被否决了。