爬虫进阶
文章平均质量分 85
爬虫技能和app爬虫
周小董
专注于数据采集,数据治理及数据架构的研究,热爱分享一些经验,欢迎朋友来探讨交流。 附言:文章仅用于个人学习,如有侵权,请联系我删除,谢谢!
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
[1352]js补环境报错navigator is not defined
选择哪种方案取决于你的具体需求。如果是做爬虫或逆向工程,建议使用 JSDOM 或 puppeteer 方案。错误,通常是因为在 Node.js 环境中运行了浏览器端的代码。在 JavaScript 中,有多种方式可以全局化函数。原创 2026-01-01 09:00:00 · 1302 阅读 · 0 评论 -
[1351]WASM + JS 混合逆向流程
本文介绍了WASM与JS混合逆向分析的全流程。WASM作为高效隐蔽的二进制模块,常被用于加密、验证等核心逻辑,而JS负责数据调度。文章详细解析了五步逆向流程:识别WASM文件、定位JS调用代码、Hook调试、反编译WAT/Ghidra分析、动态还原算法。重点展示了如何通过内存指针交互数据,并提供了实用技巧如函数名识别、内存操作等。最后从开发者角度揭示了WASM+JS加密参数的典型实现方式,包括数据编码、内存分配和跨语言调用的完整过程,为逆向工程提供了系统方法论。原创 2025-12-27 21:33:19 · 2001 阅读 · 0 评论 -
[428]微博宫格验证码的识别
本节我们介绍了一种常用的模板匹配识别图片的方式来识别验证码,并模拟了鼠标拖拽动作来实现验证码的识别。如果遇到类似的验证码,可以采用同样的思路进行识别。来源:http://cuiqingcai.com/7041.html。转载 2018-11-13 18:46:49 · 1445 阅读 · 0 评论 -
[465]深度学习识别滑动验证码缺口
本节主要介绍了训练深度学习模型来识别滑动验证码缺口的整体流程,最终我们成功实现了模型训练过程,并得到了一个深度学习模型文件。利用这个模型,我们可以输入一张滑动验证码,模型便会预测出其中的缺口的位置,包括偏移量、宽度等,最后可以通过缺口的信息绘制出对应的位置。转载 2018-12-27 18:29:22 · 2332 阅读 · 1 评论 -
[485]基于Python语言的tensorflow的‘端到端’的字符型验证码识别
验证码(CAPTCHA)的诞生本身是为了自动区分自然人和机器人的一套公开方法, 但是近几年的人工智能技术的发展,传统的字符验证已经形同虚设。所以,大家一方面研究和学习此代码时,另外一方面也要警惕自己的互联网系统的web安全问题。Keywords: 人工智能,Python,字符验证码,CAPTCHA,识别,tensorflow,CNN,深度学习。转载 2019-01-03 18:25:44 · 861 阅读 · 1 评论 -
[467]利用Python的图像处理模块pillow和OCR模块pytesseract识别图形验证码
本文将具体介绍如何利用Python的图像处理模块pillow和OCR模块pytesseract来识别上述验证码(数字加字母)。参考:https://blog.csdn.net/jclian91/article/details/80640088。原创 2018-12-28 18:40:18 · 718 阅读 · 2 评论 -
[91]OpenCV 图像匹配识别滑动验证码缺口
本节我们介绍了利用 OpenCV 来识别滑动验证码缺口的方法,其中涉及到了一些关键的图像处理和识别技术,如高斯模糊、边缘检测、轮廓提取等算法。了解了基本的图像识别技术后,我们可以举一反三,将其应用到其他类型的工作上,也会很有帮助。,注意这里是cv 分支。来源:https://cuiqingcai.com/202292.html。转载 2018-06-19 12:43:05 · 6808 阅读 · 1 评论 -
[90]OCR识别验证码模拟登录知乎(pytesseract)
验证码图片会下载至项目所在的文件夹,打开图片,输入验证码即可。原创 2018-06-19 12:41:46 · 561 阅读 · 1 评论 -
[56]Python OCR识别图形验证码(pytesser、tesserocr)
本节我们了解了利用 Tesserocr 识别验证码的过程并将其应用于实战案例中实现了模拟登录。为了提高 Tesserocr 的识别准确率,我们可以对验证码图像进行预处理去除一些干扰,识别准确率会大大提高。但总归来说 Tesserocr 识别验证码的准确率并不是很高。原创 2018-06-12 08:58:14 · 4410 阅读 · 4 评论 -
[89]Tesserocr的安装
是指通过扫描字符,然后通过其形状将其翻译成电子文本的过程。我们调用了 tesseract 命令,第一个参数为图片名称,第二个参数 result 为结果保存的目标文件名称,-l 指定使用的语言包,在此使用 eng 英文,然后再用 cat 命令将结果输出。对于 Linux 来说,不同系统已经有了不同的发行包了,它可能叫做 tesseract-ocr 或者 tesseract,直接用对应的命令安装即可。,所以在安装 Tesserocr 之前我们需要先安装 Tesseract,本节我们来了解下它们的安装方式。原创 2018-06-19 12:40:48 · 664 阅读 · 1 评论 -
[1108]小米5S TWRP刷面具、EdXposed
文章目录一、目的二、操作(简)三、操作(繁)3.1 解锁OEM3.2 解锁BL3.3 刷入开发版ROM3.3.1 线刷官方ROM3.3.2 卡刷官方ROM3.4 线刷TWRP和Magisk3.4.1 TWRP介绍3.4.2 为何刷入TWRP3.4.3 准备环境包3.4.3 TWRP安装&刷入Magisk框架3.5 附录下载一、目的Android版本迭代日新月异,Xposed环境过于久远,在Android高版本不支持,在某些金融APP上兼容性略显吃力,EdXposed成为后起之秀,为了解决某些刚需转载 2022-03-13 14:53:23 · 4262 阅读 · 1 评论 -
[1098]frida主动调用方法
Frida日常使用总结:http://www.juziss.cn/2020/11/14/Frida%E6%97%A5%E5%B8%B8%E4%BD%BF%E7%94%A8%E6%80%BB%E7%BB%93/frida主动调用方法视频:https://www.zhihu.com/zvideo/1372564394660966400。可以看到这个函数是有static关键字的 所以是个类方法(静态方法)这里有native 关键字 所以是个静态的c方法。所以主动调用要灵活的多。原创 2022-01-16 15:11:52 · 566 阅读 · 0 评论 -
[966]无需ROOT就能让你用上Xposed框架
如果你曾经了解过搞机的相关内容,想来应该知道 Xposed 框架是怎样的一种存在吧,不清楚的话也无妨,我们一起看一下。Xposed 框架是 Android 系统上的一款神器,它对于任何一个喜欢鼓捣手机的抖 M 来说都是不可或缺的,通过在这个框架上安装特定的某些模块,普通用户都可以很自由很 easy 的 DIY 自己的手机系统,实现许多看起来很复杂很高级的功能。明明这么好用的东西,却由于在之前的使用门槛较高(需要解锁、ROOT 等),导致很多人都难以体验,但是在研究过 Xposed 的工作原理之后,.转载 2021-05-07 23:06:35 · 12061 阅读 · 0 评论 -
[963]Android app代理软件
文章目录VNET——最好用的Android抓包神器proxydroid软件特色proxydroid简单的设置方法VNET——最好用的Android抓包神器VNET是Android平台下功能最强大的网络抓包工具,支持HTTP&HTTPS,TCP&UDP,IPv6&IPv4,多终端显示,功能十分的强大。截图快速上手1、安装VNET,可以从VNET官网或者Google Play 下载最新版本VNET官网:https://www.vnet-tech.com/GoogleP原创 2021-04-27 22:06:28 · 17557 阅读 · 2 评论 -
[954]gerapy配合scrapyd监控爬虫
文章目录简介与安装安装:使用初始化项目初始化数据库运行gerapy服务访问gerapy界面gerapy管理界面的使用部署主机Gerapy 与 scrapyd 有什么关联吗?部署项目github:https://github.com/Gerapy/Gerapy简介与安装Gerapy 是一款分布式爬虫管理框架,支持 Python 3,基于 Scrapy、Scrapyd、Scrapyd-Client、Scrapy-Redis、Scrapyd-API、Scrapy-Splash、Jinjia2、Django、原创 2021-03-14 22:57:34 · 678 阅读 · 1 评论 -
[681]小米手机安装charles证书,提示“没有可安装的证书”
相信很多开发和测试人员在工作过程中都会用到抓包工具,我平时习惯用charles抓包。所以这里主要讲charles证书问题。在给手机设置完代理后,需要安装证书才能抓包。大部分手机都可以直接在浏览器中输入chls.pro/ssl 下载证书后直接安装证书,但是,小米确实个例外。不能直接安装。问题:通过浏览器下载的crt文件,提示证书无效,安装失败。解决问题:1、不要用小米手机自带的浏览器下载c...原创 2019-10-22 18:59:20 · 7896 阅读 · 0 评论 -
[665]微信之wechat-sender(基于wxpy库)
注意:wechat-sender基于wxpy,wxpy基于itchat,目前腾讯以大批量关闭微信网页版接口,所以wechat-sender当前已不能使用,以下仅做学习记录wechat-sender 是基于 wxpy 和 tornado 实现的一个可以将你的网站、爬虫、脚本等其他应用中各种消息 (日志、报警、运行结果等) 发送到微信的工具。安装pip install wechat_sender...原创 2019-09-28 18:10:29 · 1812 阅读 · 0 评论 -
[606]python运行Appium驱动手机相关用法
文章目录Appium Desktop应用基于python的appium例子appium相关用法Python sample(Python示例)下载首先确保appium环境及依赖安装好Appium Desktop应用由于Appium Desktop出来了,所以使用appium要比以前简单许多1、启动Appium Desktop2、启动成功后如图,点击inspector选择上边第一个菜单,点击这里,输入手机配置好了我们在Desired Capabilities添加以下字段,注意:左侧写ke原创 2019-04-28 18:29:00 · 1660 阅读 · 2 评论 -
[585]爬虫|字体反爬
目前已知的几个字体反爬的网站是猫眼,汽车之家,天眼查,起点中文网等等。本文用到的第三方库fontTools安装pip install fontTools或者到这个地址下载:https://files.pythonhosted.org/packages/81/d5/d6b345845163f6563c86748e82b9c6077e7ee21ab0289ad8a27a23985f6f...转载 2019-03-25 18:42:05 · 2999 阅读 · 6 评论 -
[531]微信之wxpy库(基于itchat库)
微信机器人 / 可能是最优雅的微信个人号 APIwxpy 在 itchat 的基础上,通过大量接口优化提升了模块的易用性,并进行丰富的功能扩展注意强烈建议仅使用小号运行机器人!从近期 (17年6月下旬) 反馈来看,使用机器人存在一定概率被限制登录的可能性。主要表现为无法登陆 Web 微信 (但不影响手机等其他平台)。项目主页https://github.com/youfou/wx...转载 2019-02-20 18:23:54 · 4221 阅读 · 1 评论 -
[503]模拟器设置代理、开启root权限、配置证书
点击上图中的“修改网络”,会出现下图中的弹窗,勾选"显示高级选项",接着一切都明了了,代理选择“手动”,代理服务器主机名填写你电脑的ip就行了(windows系统可用ipconfig查看),接着再填写端口。调试中通常要干的一件事就是抓取,那么想要抓包,我们必须要设置代理。(4)然后打开cmd窗口,执行adb shell,如下即进入普通用户视图。(6)然后mumu模拟器会出现如下确认界面,比如这里确认允许。(1)打开mumu模拟器,然后点击如下图标。(5)然后执行su命令,如下。验证安装(查看系统证书)原创 2019-01-23 18:18:32 · 16560 阅读 · 0 评论 -
[486]Anyproxy的安装和使用
引言:阿里开源功能强大的代理服务器,可用于移动端测试抓包等操作。官网:https://github.com/alibaba/anyproxy简介AnyProxy是阿里巴巴基于 Node.js 开发的一款开源代理服务器。代理服务器站在客户端和服务端的中间,它可以收集双方通信的每个比特。一个完整的代理请求过程为:客户端首先与代理服务器创建连接,接着根据代理服务所使用的代理协议,请...原创 2019-01-08 18:32:08 · 12872 阅读 · 2 评论 -
[458]抓取微信公众号(一)
微信文章抓取(1):微信公众号文章抓取常识之临时链接、永久链接曾经尝试过抓取微信文章的小伙伴,一定很熟悉搜狗微信。搜狗微信是腾讯官方提供的搜索引擎,专门用来搜索微信公众号发表的文章(不包含服务号)。对于想要获取微信文章进行研究学习的小伙伴,首先探索的途径通常是搜狗微信。那么关于搜狗微信以及微信相关的抓取,需要知晓以下关于微信文章链接的常识。搜狗微信搜索出来的文章链接均为微信的临时链接,通过客...转载 2018-12-20 18:44:01 · 10941 阅读 · 4 评论 -
[457]Python实现有道翻译接口加密解密
到这里js加密的破解就结束了,可以看到在流程当中比较重要的地方就是:1.找数据,知道该网站会对哪些数据和请求头进行验证2.找规律,寻找这些数据的加密规则3.调试js,学会浏览器中对js代码进行调试4.模拟数据,将这些数据通过代码模拟生成,然后加入到数据当中来源:https://www.jianshu.com/p/ff3cd93f79b0。转载 2018-12-17 18:31:33 · 1580 阅读 · 0 评论 -
[317]python3爬虫之爬取网易新闻APP端
(一)使用工具这里使用了火狐浏览器的user-agent插件,不懂的可以点这里火狐插件使用(二)爬虫操作步骤:百度 网易新闻并选择步骤一:步骤二:步骤三:步骤四:最后一步:注意点: (1)网易新闻类型,一共是下面的几种:{"BBM54PGAwangning","BCR1UC1Qwangning","BD29LPUBw...转载 2018-07-12 09:04:18 · 1511 阅读 · 0 评论 -
[21]有道翻译的那些事~
2017 年最新有道翻译API 解析教程 从上面接口:大概可以推测一下, i: 需要翻译的内容 from: to: 这两个key 都为AUTO 大概猜测一下应该为自动翻译,自动检测语言并翻译 smartresult:、client、doctype、version、keyfrom、typoResult...原创 2018-06-08 09:00:52 · 465 阅读 · 0 评论 -
[12]app抓包之fiddler安装和使用
在使用fiddler抓包的时候出现 creation of the root certificate was not successful 这个错误 出现这个错误会导致https包抓不到解决方法: 1、打开cmd 2、进入fillder的目录然后再执行下面命令makecert.exe -r -ss my -n "CN=DO_NOT_TRUST_FiddlerRoot, O...原创 2018-06-06 08:58:30 · 2456 阅读 · 0 评论 -
[09]微信之itchat库
代码:import itchatimport mathimport PIL.Image as Imageimport ositchat.auto_login()friends = itchat.get_friends(update=True)[0:]user = friends[0]["UserName"]num = 0for i in friends: i...原创 2018-06-03 15:35:56 · 1749 阅读 · 2 评论
分享