自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(710)
  • 收藏
  • 关注

原创 从 TTFB 到 Failover:高并发场景下隧道代理的工程化选型指南

代理 IP 不是标品,其本质是「可稳定持续采集的工程能力」。本文先建立代理分类学与选型评估模型,再以统一测试环境对。

2026-08-24 16:56:27 971 2

原创 Python实现办公自动化的数据可视化与报表生成

幸运的是,Python提供了强大的工具和库,可以帮助我们实现办公自动化,从而提高工作效率和准确性。通过使用Python进行数据可视化和报表生成,我们可以实现办公自动化,提高工作效率和准确性。Matplotlib和Seaborn可以帮助我们深入展示数据特征和趋势,Pandas和Openpyxl可以帮助我们处理和生成表格的报表。在Python中实现办公自动化的数据可视化与报表生成时,我们可以使用一些常见的库和工具通过代理IP进行网页访问获取数据,可以使用requests库结合代理信息进行配置。

2026-04-23 16:45:33 40557 4

原创 别再裸 SQL 连金仓了:用 Python + FastAPI 给 KingbaseES 搭一套可上线的 API

金仓数据库(KingbaseES,下文简称 KES)是电科金仓推出的企业级关系型数据库,在政务、金融、能源、交通等关键行业落地极广,也是当前"信创"(信息技术应用创新)国产化替代浪潮中的主流选型之一。它最讨开发者喜欢的一点是对 PostgreSQL 通信协议的高度兼容——这意味着 PostgreSQL 生态里那套成熟的 Python 工具链(驱动、ORM、连接池)几乎可以"免适配"地平移过来,迁移成本极低。本文的目标很明确:用一套工程化、可上线。

2026-09-04 16:58:11 525

原创 超简单:用 Python 让 Excel 飞起来:用 openpyxl 把重复报表整理交给脚本

读表三参数中的data_onlyread_onlymin_row,决定了读取的正确性与性能;职责拆分:收集、统计、输出各自成函数,脚本才具备可维护、可交接的工程属性;产出必验:小样本、总量、行数三重对照缺一不可,宁可慢一步,不可错一分。但比结论更重要的,是模板意识。第一次编写合并报表脚本或许需要一小时;可一旦将其沉淀为带完整注释与类型标注的模板文件,下个月、下季度乃至换一批数据源时,往往只需改动数行配置即可复用。自动化的价值不在于第一次运行,而在于此后每一次运行所累积的时间复利。

2026-09-03 16:48:52 559

原创 华为小米荣耀集体调价,我用 Python 写了套可长期运行的手机比价监控

很多人先写请求再想存什么,抓回来一堆字段再筛。我反过来,先用 dataclass 把一条价格记录的形状定死,后续落库、写文件、画图都顺着这个结构,不用来回改。@dataclassmodel: strsku: strcaptured_at: datetime # 带时区的感知时间currency 和 sku 是我后来补上的。不同平台价格单位不统一,加上 sku 才能精确定位到具体商品,而不是只靠型号名去猜。captured_at 用 zoneinfo 带时区,机器时区一变数据就乱,这个坑我踩过。

2026-09-02 16:49:35 327

原创 API 调用错误处理实战:分层定位、有纪律地重试与可观测性设计

先分类——区分瞬态错误与持久性错误,这是所有处置决策的前提;再分层——将错误归因到 DNS、传输、HTTP、业务四个故障域之一,避免混合排查;重试有纪律——仅对瞬态错误执行全抖动指数退避,遵循,写操作须先确认幂等性;持续失败换故障域——IP 维度的风控应通过代理池分流解决,而非加重试硬扛;留证完备——结构化日志与 correlation_id 是一切复盘与协作的基础。API 报错本身并不可怕,可怕的是每次都从零开始归因。

2026-09-01 16:48:05 263

原创 从会说到会干:豆包工作 Agent 正式发布,这次是真的夯

自己维护 IP 池听起来很极客,实际上是个无底洞:找货源、写探活、做故障转移、处理 IP 污染、应对目标站策略变化……这些活儿跟你的核心业务毫无关系,且需要持续投入。隧道代理的思路是把复杂度收进云端采集端 → 固定入口地址(tun.16yun.cn:8000)→ 云端智能调度 → 动态出口 IP 池 → 目标站↑ ↑客户端只配一个地址 毫秒级切换,客户端无感代码侧接入就是一个代理 URL,业务逻辑一行不用改。豆包工作这次发布,真正的信号不是"又多了个 AI 产品",而是。

2026-08-31 16:45:43 305

原创 为什么 Agent 公司最后拼的是 Harness?

Agent 赛道走到现在,共识逐渐清晰:模型的智力会随基础模型迭代水涨船高,这个红利所有人都能吃到。Harness 的工程质量是另一回事,它需要踩坑、需要在半夜起来救火、需要一行一行地补防御性代码,而且换不来发布会的掌声。用户不关心你接的什么模型,用户关心的是任务有没有完成、失败了能不能自动恢复、数据准不准确、下个月账单上的推理成本是不是可控。这几件事,全部由 Harness 决定。所以回到标题的问题。为什么 Agent 公司最后拼的是 Harness?因为模型是买来的,大家的智力起点一样;

2026-08-28 16:49:03 340

原创 把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践

模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套带代理、能稳定采集、有接口有测试的数据后端——才会发现「一切皆插件」这套架构的延展性有多强。

2026-08-27 17:08:13 252

原创 把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践

模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套带代理、能稳定采集、有接口有测试的数据后端——才会发现「一切皆插件」这套架构的延展性有多强。

2026-08-27 16:52:11 705

原创 AI Agent 技术全景:从核心原理到工程落地,开发者必须掌握的关键要点

目标:摄入批量 PDF / 网页,生成结构化摘要并支持溯源追问。工具链:文档解析 + 向量检索(RAG)+ LLM 生成 + citation。价值:分钟级读完上百页资料,适用于研报、合同、论文场景。

2026-08-26 16:48:31 226

原创 OpenClaw 入门指南:核心原理、工程化接入与避坑实践

OpenClaw 是能力出色的对话框架,但请始终记住它是统计模型:善用、校验、不盲信。新手可沿"原理理解 → 快速上手 → 风险规避 → 工程实战"的路径推进,并将代理层作为可靠性设计的一部分纳入架构,而非事后补救。

2026-08-25 16:46:35 327

原创 《牛来》爆红背后:我用 Python 爬虫扒出了它的数据真相

回看整件事:《牛来》从首日 342 元到热搜 7352 元、排片 168 场,是一次典型的"互联网情绪发酵"。作为爬虫工程师,我们不必卷入情绪,而是可以用数据把这场发酵拆成可观察、可量化的信号。

2026-08-21 16:46:30 894

原创 子进程不退出?Python 多进程僵尸进程与资源泄漏的工程化排查

一、从一次线上事故说起:先厘清两个被混用的概念那天要跑一批网页抓取,几万条,单线程要两三个小时,我顺手用开了 8 个进程并行。本地抽样 200 条没问题,上线后主进程很快打印"完成",可top里仍有进程滞留:部分是Z(zombie),部分是D(不可中断睡眠),内存从 1.2G 悄悄爬到 3.5G,文件句柄数逼近ulimit -n。很多人把"僵尸进程"和"资源泄漏"当成一回事,其实它们是exit()waitpid()DS排查第一步,先用pspstree。

2026-08-20 16:47:40 550

原创 CuPy vs Numba vs PyTorch:GPU 加速方案怎么选

引言:数据进得来,才算得动大规模数据采集常被目标站点限流、封 IP、验证码拦截。企业级代理 IP 服务如可让采集在分布式节点间平滑切换出口,保障数据稳定入库。数据进来后,瓶颈转向算力——下面用代码直接对比 CuPy、Numba、PyTorch 三种上 GPU 的方式。

2026-08-19 16:50:15 368

原创 DuckDB 横空出世,Pandas 的「本地分析王座」要交出去了?

关键词:Pandas、DuckDB、列式存储、OLAP、PyArrow、Parquet、代理采集环境:Python 3.10+,文中代码均可直接复制运行(路径按本地环境替换即可)。

2026-08-18 16:44:01 458

原创 用Python抓美团景区评论数据,长隆水上乐园那次踩了不少坑

做景区运营分析的人,手头最缺的往往是真实的游客反馈。官方介绍写得再漂亮,也抵不过一条"周末排队两小时玩五分钟"的评论。我前阵子接了个活,要整理广州长隆水上乐园的游客评价,看看大家到底在吐槽什么、又在夸什么。数据源选了美团,理由是它的评论量大、带评分、还有游玩时间和同行人数这类结构化字段,比纯文本好处理。这篇文章把整个抓取过程拆开讲,包含接口分析、代理配置、代码实现和踩过的坑,代码都能直接跑。

2026-08-17 16:49:37 322

原创 长周期爬虫的数据一致性:断点续爬 + 事务回滚保障采集质量

一、重新定义问题:爬虫是一类有状态的流处理任务长周期爬虫(任务跨度数天、采集千万级页面)在工程上不应被当成"脚本",而应被建模为一条:待爬 URL 是输入流,落库记录是副作用(side effect),采集进度是消费位点(offset)。一旦这样抽象,文章标题背后的真问题就浮现了——在「消费输入」与「产生副作用」两个动作之间,如何让进度推进与数据写入保持原子?这正是 Kafka 消费者 exactly-once 语义的经典难题:若先提交 offset 再写库,崩溃会漏采;

2026-08-14 16:48:33 296

原创 把热榜存下来:用 SQLAlchemy + PostgreSQL 设计 A股_美股_基金榜单数据模型

维度选择理由ORM类型注解友好(Mapped),生态成熟,迁移工具 Alembic 开箱即用数据库原生 JSONB 兜底半结构化字段、丰富索引(BRIN 适合时序)、CTE 写分析查询很顺手驱动psycopg(psycopg3)SQLAlchemy 2.0 官方推荐,异步支持好重试tenacity为代理请求叠加指数退避重试,提升采集健壮性为什么不用 MySQL?榜单附带大量行情快照字段(价格、涨跌幅、成交额),后续还会追加不固定的扩展字段,PostgreSQL 的JSONB。

2026-08-13 16:48:59 539

原创 用 Python 批量生成销售日报,告别每天复制粘贴

销售日报需要汇总各渠道的订单数、销售额和客单价。渠道超过十个以后,手工把数据从各平台抄进同一张 Excel 就成了明显负担:耗时、易错、且无法追溯数据来源。以 11 个渠道、日均 42 分钟手工汇总估算,每月仅此一项就占用约 15 个小时。本文用一个可落地的 Python 脚本,把这份日报改成每天定时自动生成。流程拆成取数、归一化、算指标、写 Excel、调度五步,代码可直接复用,数据源与代理配置集中管理,渠道字段变动时只改对应函数。

2026-08-12 16:49:31 350

原创 我把 12 个 Scrapy 爬虫项目迁到 Crawlo,踩了这些坑

团队技术栈已全面转向 asyncio需要 Playwright 做动态页面渲染(Crawlo 原生支持,Scrapy 要装 scrapy-playwright 插件)对分布式调度有自定义需求新项目为主,历史包袱小Scrapy 项目运行稳定、性能满足需求 → 没必要折腾大量依赖 Scrapy 生态插件(scrapy-splash、scrapy-crawl-once 等)→ Crawlo 生态还不够丰富团队对 asyncio 不熟悉 → 学习成本不低。

2026-08-11 16:53:55 902

原创 B 站 UP 主动态爬取全流程:从首页到翻页的完整链路

一、问题的本质如果你动手写过 B 站爬虫,大概率撞上过这一幕:第一页的动态数据顺利到手,翻到第二页接口马上甩回或干脆。换 User-Agent、加time.sleep、甚至手动从浏览器抠 Cookie——统统不管用。根源在于 B 站引入的。所有含分页参数的 Web API(动态流、视频评论、空间历史等)都强制要求附带一个动态计算出的w_rid,该签名的生成逻辑藏在前端首页index.js中一段经过混淆处理的 JavaScript 里。。

2026-08-10 16:50:00 356

原创 Selenium + 随机延时 + UA 轮换:模拟真人行为的爬虫策略

真人会移动鼠标、滚动、逐字输入。")

2026-08-07 16:51:15 1810

原创 Python 爬虫实战:抓取汽车之家二手车成交价格与里程数据

本文介绍了如何抓取汽车之家二手车平台的成交数据,用于残值率分析、定价模型和区域行情监控。重点包括: 数据价值:二手车作为非标品,成交价格和行驶里程是关键指标,结合车型、城市、上牌时间可构建价格-里程曲线,为买卖决策提供参考。 技术方法: 通过监听JSON接口而非解析HTML提高稳定性 使用云代理IP(如亿牛云)应对反爬机制 数据清洗将原始JSON转为规整DataFrame 应用场景: 建立动态行情表追踪价格变化 进行价格-里程相关性分析 为二手车交易提供定价基准 该方法相比传统估值工具更贴近市场实际,通过持

2026-08-06 16:45:45 441

原创 基于Python的抖音网页版视频点赞数增长趋势追踪系统设计与实现

一、问题背景短视频运营中存在一个普遍盲区:创作者只能通过抖音后台查看当前时刻的累计指标,无法获取指标的时序演化过程。然而,抖音推荐系统采用多级流量池递进机制——视频发布后先进入初始流量池(约200-500次曝光),系统根据该阶段的完播率、互动率决定是否推入下一级流量池。

2026-08-05 16:50:56 229

原创 新Tab 精准加载 + 接口实时监听:Python 智联招聘爬虫的两种武器

现代招聘平台普遍采用前后端分离架构,职位数据经由 XHR 异步下发,且核心字段分散于列表接口与详情接口。以requests直采静态 HTML 仅能获取渲染骨架,难以保证薪资区间、HR 活跃状态等字段的。本文基于 Playwright 构建采集流水线,以「接口实时监听」完成字段初采,以「新 Tab 精准加载」完成详情补全,并引入亿牛云(16yun)代理 IP 分散出口,形成一套可复用、抗风控的职位采集方案。

2026-07-30 16:47:56 673

原创 散户情绪不是玄学:Python 爬东方财富股吧并量化的方法

很多人一听到「散户情绪」就觉得是玄学,仿佛只有盘面高手靠直觉才能感知。其实东方财富股吧里每天几百万条发帖,就是最原始的散户情绪池子。帖子里有人喊「满仓干」,有人骂「这票废了」,有人发长长的复盘贴。把这些内容按条数抓下来,再用一套简单的规则给每条打分,散户情绪就能从感觉变成数字。举个真实的例子。某只票当天跌停,股吧前排热帖大概率是一堆「割肉了」「被套牢」的抱怨,这时候平均情绪分掉到负 0.6 以下很正常;过两天出个利好公告,热帖画风一转,满屏「加仓」「看好反转」,分数又能弹回正区间。

2026-07-29 16:50:36 392

原创 我是怎么用 Python 爬新浪新闻搜索结果的

前段时间有个需求,要批量采集某个关键词相关的新闻数据做舆情分析。选了一圈数据源,最后落在新浪新闻搜索上。原因有几个:收录量大,搜索结果带时间戳和来源媒体字段,数据结构相对规整,适合做时间序列分析。另外返回的是服务端渲染的 HTML,不需要处理 JavaScript 动态加载,采集成本低。这篇文章记录整个爬取过程的技术细节,包括请求构造、响应解析、反爬策略和代理池设计。

2026-07-28 16:46:22 835

原创 图片懒加载怎么破:爬去哪儿图集实战

在构建离线旅行攻略时,需要把去哪儿网游记中的图集批量抓取并整理为本地 Markdown 电子书。技术上的主要障碍并非反爬,而是图片懒加载:页面中数十张图片在初始 HTML 里仅以占位图形式存在,真实地址延迟到滚动进入视口时才加载。懒加载本身是标准的 Web 性能优化手段,但对只获取静态 HTML 的爬虫而言,拿到的永远是未赋值的占位标记。本文记录从原理分析到工程落地的完整方案,目标读者已具备 Python 与 requests 基础。

2026-07-27 16:50:43 293

原创 抓不到数据先别急,看看 Scrapy 代理有没有真起作用

抓不到数据时,先花两分钟确认代理是不是真在干活,通常比埋头改解析省事。把出口 IP 打出来、把和日志对上,问题在代理还是在本机代码,一眼分开。需要的话,我可以把这套验证加容错直接做成一个可挂的中间件,配个探测 spider,跑起来就能实时看到出口 IP 和异常切换。

2026-07-24 16:41:22 613

原创 异步爬虫里 aiohttp 超时设多少不会误杀正常请求

超时设 3 秒,跑半小时成功率从 98% 掉到 85%。目标站点 RTT 正常,代理 IP 存活,但大量请求抛。问题出在超时阈值与实际网络时序不匹配,把正常的处理延迟当成了网络故障。

2026-07-23 16:47:47 542

原创 SERP抓取做排名追踪:requests加BeautifulSoup够不够用

如果你要抓Google,关键词规模上千,需要追踪不同地区的排名,或者需要抓取Rich Snippet等JS渲染内容。如果你的客户在成都,你想追踪成都地区的排名表现,就得用成都的代理IP去请求。如果你的需求是:追踪几十到两三百个关键词在百度的排名,每周或每天更新一次,不需要抓JS渲染的内容,预算有限不想买商业API。如果你只关心前10条自然结果的排名,这个问题不大,因为自然结果的链接在初始HTML里就有。用代理之后,每个请求可以走不同的出口IP,搜索引擎看到的是分散的访问来源,不容易触发频率限制。

2026-07-22 16:48:18 828

原创 将 Lazada 爬取结果落地 MySQL:PHP 数据持久化实战

从页面解析到 MySQL 落库,链路的每个环节都有明确的工程约束:字符集决定能否完整存下标题,DECIMAL 决定金额是否可信,唯一键决定能否安全 upsert,代理决定采集能否持续。把这些约束前置到表结构和代码里,后续的比价、预警和趋势分析才站得住脚。

2026-07-21 16:52:44 244

原创 把 time.sleep 换成 await asyncio.sleep 之前,先想清楚谁在帮你并发

上周 review 一个同事的爬虫脚本,两千多行,注释里写着"已改成异步,性能提升十倍"。我在本地跑了一遍,比同步版本慢了将近一倍。问题出在哪?满屏的 await,却没有一个真正把控制权交出去。这件事值得单独聊,因为它踩中了 Python 异步里最容易被误解的那个坑:以为加了 async 和 await,代码就自动并发了。

2026-07-20 16:46:34 325

原创 企业内网场景下 Python 自定义 CA 证书信任链的正确配置方法

企业内网的自定义 CA 证书来自两类场景。内部服务 (API 网关、GitLab、Harbor、监控平台等) 使用内部域名或 IP 地址,公共 CA 无法签发此类证书,企业自建 CA 签发后要求客户端信任其根证书。网络安全设备 (防火墙、IDS、DLP) 对 HTTPS 流量做 MITM 检查,设备持有自签根证书,经其转发的连接会被重新签名。浏览器通过组策略信任该根证书,Python 不会。两类场景的本质相同:程序需要信任一个不在公共 CA 信任链里的根证书。通过精细控制 TLS 配置,挂载到。

2026-07-17 16:32:14 364

原创 两周完成爬虫技术栈升级:Scrapy 迁移 Crawlo 的路径与取舍

选择隧道而非前向代理,原因在于隧道把 IP 轮换和健康度管理收敛到代理侧:业务每次请求都打到固定隧道入口,由亿牛云在后端按策略切换出口 IP 并自动剔除被封节点,代码里不需要维护 IP 池、不需要写健康检查。回调里出现 CPU 密集的同步代码,比如大文档的 XPath 批量抽取、深回溯正则、或者 JSON 反序列化后的字段规整,reactor 就会被这一个回调独占,事件循环无法推进,同进程内其他所有在途请求一起排队。是纯函数,输入只有 HTML 和显式声明的元数据,输出是规整后的 record。

2026-07-16 16:49:35 575

原创 Python 随机打乱列表怎么实现?shuffle 避坑指南,90% 的人都用错了

这是一张图片,ocr 内容为:X 12345 图片由AI生成我见过太多人在这个问题上翻车。上周 code review,一个实习生写了,然后对着一个 None 报错抓了半小时头发。这不是个例,random.shuffle 的用法看着只有一行,真踩起坑来能让你怀疑人生。先说结论:shuffle 是原地操作,它不返回任何东西。很多人脑子里想的是"给我一个新列表",实际拿到的是空。这个认知偏差是九成错误的根源。

2026-07-15 16:43:03 329

原创 全网电影信息爬取:从单机脚本到分布式采集系统的工程实践

本文摘要(150字): 2024年影视数据聚合项目实践显示,传统爬虫技术已无法应对现代网站的反爬机制。项目初期采用requests+BeautifulSoup方案失败,成功率仅42%。重构后采用五层架构(调度层、采集层、解析层、清洗层、存储层),结合Playwright浏览器池和curl_cffi双通道采集方案,成功实现日均30万条电影元数据的采集。关键技术包括TLS指纹对抗(curl_cffi模拟)、浏览器指纹伪装(Playwright+stealth补丁)和动态签名逆向,有效应对了SPA渲染、Graph

2026-07-14 16:47:29 401

原创 深入 Pillow 底层:Python 图像通道、像素运算实战开发

大多数开发者对 Pillow 的使用停留在 + 。一旦涉及水印合成、通道混合、批量处理性能优化,对通道模型和像素运算的底层理解就成了分水岭。本文从 Pillow 的内部数据结构出发,拆解通道操作、像素级运算和性能优化机制。mode 是最核心的属性,它决定了每个像素的通道数和数据类型:惰性加载: 只读文件头解析元数据,不读像素。只有在调用 或任何需要像素的操作时才触发实际 I/O。批量只读尺寸时不会产生像素读取开销。RGBA 模式多一个 Alpha 通道,可用于透明度控制:三、生产级效果实现3.1

2026-07-13 16:45:49 339

原创 JS 逆向天花板姿势:JSRPC 远程调用实战

JS 逆向走到深处,最终都会撞上一堵墙:核心加密逻辑被 VMP 虚拟机保护、控制流平坦化、反调试陷阱层层包裹,静态分析几乎无法还原,AST 解析也无从下手。三个结构性优势:零逆向成本(不分析内部实现)、零维护成本(站点更新自动生效)、100% 环境还原(原生浏览器执行)。加密函数在浏览器原环境中正常执行,Python 爬虫通过 WebSocket 远程调用。容器化部署时,浏览器和 Python 服务端打包在同一镜像中。在 VMP 保护日益普及的当下,JSRPC 正从非常规手段变成 JS 逆向的标配技能。

2026-07-09 16:43:00 934

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除