<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[retime123的博客]]></title><description><![CDATA[岁月静好....]]></description><link>https://blog.csdn.net/qq_24760381</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; qq_24760381]]></copyright><item><title><![CDATA[正则提取 英文日期]]></title><link>https://blog.csdn.net/qq_24760381/article/details/131553693</link><guid>https://blog.csdn.net/qq_24760381/article/details/131553693</guid><author>qq_24760381</author><pubDate>Wed, 05 Jul 2023 13:38:44 +0800</pubDate><description><![CDATA[匹配--> 16th June 2020。]]></description><category></category></item><item><title><![CDATA[爬虫之遇到woff字体反爬]]></title><link>https://blog.csdn.net/qq_24760381/article/details/128297597</link><guid>https://blog.csdn.net/qq_24760381/article/details/128297597</guid><author>qq_24760381</author><pubDate>Tue, 13 Dec 2022 10:13:59 +0800</pubDate><description><![CDATA[本篇博文的主题就是处理字体反爬，其实这种网上已经很多了，只是这次有点不一样，处理方式变化了点，记录一下。]]></description><category></category></item><item><title><![CDATA[DolphinScheduler 2.0.x 二开之增加“丢弃旧的实例”功能]]></title><link>https://blog.csdn.net/qq_24760381/article/details/124864100</link><guid>https://blog.csdn.net/qq_24760381/article/details/124864100</guid><author>qq_24760381</author><pubDate>Fri, 20 May 2022 14:49:34 +0800</pubDate><description><![CDATA[保留最大实例数量，对旧的日志删除





]]></description><category></category></item><item><title><![CDATA[DolphinScheduler 2.0.x 二开之监控中心增加“磁盘可用”的监控]]></title><link>https://blog.csdn.net/qq_24760381/article/details/124711747</link><guid>https://blog.csdn.net/qq_24760381/article/details/124711747</guid><author>qq_24760381</author><pubDate>Wed, 11 May 2022 15:46:49 +0800</pubDate><description><![CDATA[DolphinScheduler 二次开发


]]></description><category></category></item><item><title><![CDATA[DolphinScheduler 2.0.x版本在win10开发调试的环境配置]]></title><link>https://blog.csdn.net/qq_24760381/article/details/124489630</link><guid>https://blog.csdn.net/qq_24760381/article/details/124489630</guid><author>qq_24760381</author><pubDate>Fri, 29 Apr 2022 14:04:11 +0800</pubDate><description><![CDATA[最近用DolphinScheduler搭建平台，有些不好的地方需要二开，记录一下本地环境配置

DolphinScheduler官网地址：https://dolphinscheduler.apache.org/zh-cn/

（平台部署也有坑，后续更新。。。）

1.下载DolphinScheduler源码

打开 DolphinScheduler 的 GitHub（https://github.com/apache/dolphinscheduler）选择下载的版本，可以clone或者直接下载zip包


]]></description><category></category></item><item><title><![CDATA[python3调用jenkins报401未授权问题]]></title><link>https://blog.csdn.net/qq_24760381/article/details/118028360</link><guid>https://blog.csdn.net/qq_24760381/article/details/118028360</guid><author>qq_24760381</author><pubDate>Fri, 18 Jun 2021 16:07:30 +0800</pubDate><description><![CDATA[ubuntu 16.04系统

安装的包python-jenkins，用的是目前最新的1.7.0（1.5~1.6页试过）：

import jenkins

server = jenkins.Jenkins(JENKINS_MIMETUS_SERVER_URL, username=JENKINS_MIMETUS_USERNAME, password=JENKINS_MIMETUS_PASSWORD)

# 调用方法

server.get_running_builds()

# 报错：

Traceback]]></description><category></category></item><item><title><![CDATA[爬虫之遇到521，破解cookie之window对象]]></title><link>https://blog.csdn.net/qq_24760381/article/details/88937185</link><guid>https://blog.csdn.net/qq_24760381/article/details/88937185</guid><author>qq_24760381</author><pubDate>Sun, 31 Mar 2019 22:49:51 +0800</pubDate><description><![CDATA[使用python、scrapy


import execjs# 安装pip install PyExecJS  用这种方式只是为了调试，实际使用中还是要用js引擎v8

看了不少博客是要用到模拟浏览器phantomjs、chrome什么的，其实有很多网站的js会发现这种操作（无头模式下navigatoe.webdriver为true，绕过检测要设置该属性）。

下面一个网站为例（具体网站不公开！...]]></description><category></category></item><item><title><![CDATA[pip install出错：Cannot connect to proxy]]></title><link>https://blog.csdn.net/qq_24760381/article/details/88936668</link><guid>https://blog.csdn.net/qq_24760381/article/details/88936668</guid><author>qq_24760381</author><pubDate>Sun, 31 Mar 2019 22:02:59 +0800</pubDate><description><![CDATA[pip install出错：Cannot connect to proxy

Cannot connect to proxy.', NewConnectionError('&lt;pip._vendor.u
rllib3.connection.VerifiedHTTPSConnection object at 0x03111CF0&gt;: Failed to establish a new co...]]></description><category></category></item><item><title><![CDATA[caffe整图训练---验证码]]></title><link>https://blog.csdn.net/qq_24760381/article/details/88808456</link><guid>https://blog.csdn.net/qq_24760381/article/details/88808456</guid><author>qq_24760381</author><pubDate>Mon, 25 Mar 2019 22:46:33 +0800</pubDate><description><![CDATA[caffe自行安装，win版

算法：Res_LSTM_CTC 不定长

准备样本
]]></description><category></category></item><item><title><![CDATA[Scrapy如何获取返回的headers里面的多个Set-Cookie]]></title><link>https://blog.csdn.net/qq_24760381/article/details/84584993</link><guid>https://blog.csdn.net/qq_24760381/article/details/84584993</guid><author>qq_24760381</author><pubDate>Wed, 28 Nov 2018 15:26:41 +0800</pubDate><description><![CDATA[https://blog.csdn.net/legendary_Dragon/article/details/81287593

 

cookie = response.headers.getlist('Set-Cookie')]]></description><category></category></item><item><title><![CDATA[scrapy怎么post 请求payload形式的参数的实现；还有requests实现方式]]></title><link>https://blog.csdn.net/qq_24760381/article/details/80363125</link><guid>https://blog.csdn.net/qq_24760381/article/details/80363125</guid><author>qq_24760381</author><pubDate>Fri, 18 May 2018 13:33:00 +0800</pubDate><description><![CDATA[payload是什么就不说了！


https://mp.csdn.net/postedit/80363125

一、payload在浏览器上的数据


	浏览器上请求方式：
	


2.payload参数：



可以看出来参数形式是json

3.headers：



4.response：



可以看出来是json的数据！



二、在scrapy中访问payload形式的url


...]]></description><category></category></item><item><title><![CDATA[向scrapy中的spider传参，实现增量]]></title><link>https://blog.csdn.net/qq_24760381/article/details/80361400</link><guid>https://blog.csdn.net/qq_24760381/article/details/80361400</guid><author>qq_24760381</author><pubDate>Fri, 18 May 2018 10:56:26 +0800</pubDate><description><![CDATA[有时候需要根据项目的实际需求向spider传递参数来控制spider的运行方式。

比如说，1.根据用户提交的url来控制spider爬取的网站。2.根据需求增量爬取数据。

今天就写一个增量（augmenter）的方式：



Spider参数通过crawl命令的 -a 选项来传递，比如：


scrapycrawlxxx-aaugmenter=xxxxxx

注：augmente...]]></description><category></category></item><item><title><![CDATA[scrapy多个爬虫公用一些中间件、pipelines]]></title><link>https://blog.csdn.net/qq_24760381/article/details/80022323</link><guid>https://blog.csdn.net/qq_24760381/article/details/80022323</guid><author>qq_24760381</author><pubDate>Fri, 20 Apr 2018 18:32:27 +0800</pubDate><description><![CDATA[使用python3

请求头headers：user-agent、代理ip，这些放在一个工程项目里，有的爬虫是需要中间件的或者根据反爬添加相应的条件，那这样的情况下怎么办？

1.中间件处理默认带上请求头，不带启用ip代理功能

spiders文件夹下的爬虫类添加属性



中间件处理

这样不管爬虫那边有没有添加属性，middlewares里就是会默认

2.有些情况下请求头会带上cookie...]]></description><category></category></item><item><title><![CDATA[虚拟机Ubuntu16.04 Server设置NAT方式修改ip]]></title><link>https://blog.csdn.net/qq_24760381/article/details/80021618</link><guid>https://blog.csdn.net/qq_24760381/article/details/80021618</guid><author>qq_24760381</author><pubDate>Fri, 20 Apr 2018 17:18:04 +0800</pubDate><description><![CDATA[每次都要查看ip，每次都不一样，往往我们会选择“NAT模式”，但是选择的时候，ip地址会产生冲突，这样我们就要修改我们的IP地址来解决！！一、简单方式：1.工具栏‘编辑’  2.虚拟网络编辑器，选择NAT模式==》子网ip没法修改 3.‘更改设置’“子网IP”修改自己喜欢的网段，192.168.xxx.xxx最好是改这两个！4.‘DHCP设置’修改起始IP地址==》可以说这样就是自己的虚拟机的IP...]]></description><category></category></item></channel></rss>