- 博客(710)
- 收藏
- 关注
原创 从 TTFB 到 Failover:高并发场景下隧道代理的工程化选型指南
代理 IP 不是标品,其本质是「可稳定持续采集的工程能力」。本文先建立代理分类学与选型评估模型,再以统一测试环境对。
2026-08-24 16:56:27
971
2
原创 Python实现办公自动化的数据可视化与报表生成
幸运的是,Python提供了强大的工具和库,可以帮助我们实现办公自动化,从而提高工作效率和准确性。通过使用Python进行数据可视化和报表生成,我们可以实现办公自动化,提高工作效率和准确性。Matplotlib和Seaborn可以帮助我们深入展示数据特征和趋势,Pandas和Openpyxl可以帮助我们处理和生成表格的报表。在Python中实现办公自动化的数据可视化与报表生成时,我们可以使用一些常见的库和工具通过代理IP进行网页访问获取数据,可以使用requests库结合代理信息进行配置。
2026-04-23 16:45:33
40557
4
原创 别再裸 SQL 连金仓了:用 Python + FastAPI 给 KingbaseES 搭一套可上线的 API
金仓数据库(KingbaseES,下文简称 KES)是电科金仓推出的企业级关系型数据库,在政务、金融、能源、交通等关键行业落地极广,也是当前"信创"(信息技术应用创新)国产化替代浪潮中的主流选型之一。它最讨开发者喜欢的一点是对 PostgreSQL 通信协议的高度兼容——这意味着 PostgreSQL 生态里那套成熟的 Python 工具链(驱动、ORM、连接池)几乎可以"免适配"地平移过来,迁移成本极低。本文的目标很明确:用一套工程化、可上线。
2026-09-04 16:58:11
525
原创 超简单:用 Python 让 Excel 飞起来:用 openpyxl 把重复报表整理交给脚本
读表三参数中的data_onlyread_onlymin_row,决定了读取的正确性与性能;职责拆分:收集、统计、输出各自成函数,脚本才具备可维护、可交接的工程属性;产出必验:小样本、总量、行数三重对照缺一不可,宁可慢一步,不可错一分。但比结论更重要的,是模板意识。第一次编写合并报表脚本或许需要一小时;可一旦将其沉淀为带完整注释与类型标注的模板文件,下个月、下季度乃至换一批数据源时,往往只需改动数行配置即可复用。自动化的价值不在于第一次运行,而在于此后每一次运行所累积的时间复利。
2026-09-03 16:48:52
559
原创 华为小米荣耀集体调价,我用 Python 写了套可长期运行的手机比价监控
很多人先写请求再想存什么,抓回来一堆字段再筛。我反过来,先用 dataclass 把一条价格记录的形状定死,后续落库、写文件、画图都顺着这个结构,不用来回改。@dataclassmodel: strsku: strcaptured_at: datetime # 带时区的感知时间currency 和 sku 是我后来补上的。不同平台价格单位不统一,加上 sku 才能精确定位到具体商品,而不是只靠型号名去猜。captured_at 用 zoneinfo 带时区,机器时区一变数据就乱,这个坑我踩过。
2026-09-02 16:49:35
327
原创 API 调用错误处理实战:分层定位、有纪律地重试与可观测性设计
先分类——区分瞬态错误与持久性错误,这是所有处置决策的前提;再分层——将错误归因到 DNS、传输、HTTP、业务四个故障域之一,避免混合排查;重试有纪律——仅对瞬态错误执行全抖动指数退避,遵循,写操作须先确认幂等性;持续失败换故障域——IP 维度的风控应通过代理池分流解决,而非加重试硬扛;留证完备——结构化日志与 correlation_id 是一切复盘与协作的基础。API 报错本身并不可怕,可怕的是每次都从零开始归因。
2026-09-01 16:48:05
263
原创 从会说到会干:豆包工作 Agent 正式发布,这次是真的夯
自己维护 IP 池听起来很极客,实际上是个无底洞:找货源、写探活、做故障转移、处理 IP 污染、应对目标站策略变化……这些活儿跟你的核心业务毫无关系,且需要持续投入。隧道代理的思路是把复杂度收进云端采集端 → 固定入口地址(tun.16yun.cn:8000)→ 云端智能调度 → 动态出口 IP 池 → 目标站↑ ↑客户端只配一个地址 毫秒级切换,客户端无感代码侧接入就是一个代理 URL,业务逻辑一行不用改。豆包工作这次发布,真正的信号不是"又多了个 AI 产品",而是。
2026-08-31 16:45:43
305
原创 为什么 Agent 公司最后拼的是 Harness?
Agent 赛道走到现在,共识逐渐清晰:模型的智力会随基础模型迭代水涨船高,这个红利所有人都能吃到。Harness 的工程质量是另一回事,它需要踩坑、需要在半夜起来救火、需要一行一行地补防御性代码,而且换不来发布会的掌声。用户不关心你接的什么模型,用户关心的是任务有没有完成、失败了能不能自动恢复、数据准不准确、下个月账单上的推理成本是不是可控。这几件事,全部由 Harness 决定。所以回到标题的问题。为什么 Agent 公司最后拼的是 Harness?因为模型是买来的,大家的智力起点一样;
2026-08-28 16:49:03
340
原创 把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践
模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套带代理、能稳定采集、有接口有测试的数据后端——才会发现「一切皆插件」这套架构的延展性有多强。
2026-08-27 17:08:13
252
原创 把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践
模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套带代理、能稳定采集、有接口有测试的数据后端——才会发现「一切皆插件」这套架构的延展性有多强。
2026-08-27 16:52:11
705
原创 AI Agent 技术全景:从核心原理到工程落地,开发者必须掌握的关键要点
目标:摄入批量 PDF / 网页,生成结构化摘要并支持溯源追问。工具链:文档解析 + 向量检索(RAG)+ LLM 生成 + citation。价值:分钟级读完上百页资料,适用于研报、合同、论文场景。
2026-08-26 16:48:31
226
原创 OpenClaw 入门指南:核心原理、工程化接入与避坑实践
OpenClaw 是能力出色的对话框架,但请始终记住它是统计模型:善用、校验、不盲信。新手可沿"原理理解 → 快速上手 → 风险规避 → 工程实战"的路径推进,并将代理层作为可靠性设计的一部分纳入架构,而非事后补救。
2026-08-25 16:46:35
327
原创 《牛来》爆红背后:我用 Python 爬虫扒出了它的数据真相
回看整件事:《牛来》从首日 342 元到热搜 7352 元、排片 168 场,是一次典型的"互联网情绪发酵"。作为爬虫工程师,我们不必卷入情绪,而是可以用数据把这场发酵拆成可观察、可量化的信号。
2026-08-21 16:46:30
894
原创 子进程不退出?Python 多进程僵尸进程与资源泄漏的工程化排查
一、从一次线上事故说起:先厘清两个被混用的概念那天要跑一批网页抓取,几万条,单线程要两三个小时,我顺手用开了 8 个进程并行。本地抽样 200 条没问题,上线后主进程很快打印"完成",可top里仍有进程滞留:部分是Z(zombie),部分是D(不可中断睡眠),内存从 1.2G 悄悄爬到 3.5G,文件句柄数逼近ulimit -n。很多人把"僵尸进程"和"资源泄漏"当成一回事,其实它们是exit()waitpid()DS排查第一步,先用pspstree。
2026-08-20 16:47:40
550
原创 CuPy vs Numba vs PyTorch:GPU 加速方案怎么选
引言:数据进得来,才算得动大规模数据采集常被目标站点限流、封 IP、验证码拦截。企业级代理 IP 服务如可让采集在分布式节点间平滑切换出口,保障数据稳定入库。数据进来后,瓶颈转向算力——下面用代码直接对比 CuPy、Numba、PyTorch 三种上 GPU 的方式。
2026-08-19 16:50:15
368
原创 DuckDB 横空出世,Pandas 的「本地分析王座」要交出去了?
关键词:Pandas、DuckDB、列式存储、OLAP、PyArrow、Parquet、代理采集环境:Python 3.10+,文中代码均可直接复制运行(路径按本地环境替换即可)。
2026-08-18 16:44:01
458
原创 用Python抓美团景区评论数据,长隆水上乐园那次踩了不少坑
做景区运营分析的人,手头最缺的往往是真实的游客反馈。官方介绍写得再漂亮,也抵不过一条"周末排队两小时玩五分钟"的评论。我前阵子接了个活,要整理广州长隆水上乐园的游客评价,看看大家到底在吐槽什么、又在夸什么。数据源选了美团,理由是它的评论量大、带评分、还有游玩时间和同行人数这类结构化字段,比纯文本好处理。这篇文章把整个抓取过程拆开讲,包含接口分析、代理配置、代码实现和踩过的坑,代码都能直接跑。
2026-08-17 16:49:37
322
原创 长周期爬虫的数据一致性:断点续爬 + 事务回滚保障采集质量
一、重新定义问题:爬虫是一类有状态的流处理任务长周期爬虫(任务跨度数天、采集千万级页面)在工程上不应被当成"脚本",而应被建模为一条:待爬 URL 是输入流,落库记录是副作用(side effect),采集进度是消费位点(offset)。一旦这样抽象,文章标题背后的真问题就浮现了——在「消费输入」与「产生副作用」两个动作之间,如何让进度推进与数据写入保持原子?这正是 Kafka 消费者 exactly-once 语义的经典难题:若先提交 offset 再写库,崩溃会漏采;
2026-08-14 16:48:33
296
原创 把热榜存下来:用 SQLAlchemy + PostgreSQL 设计 A股_美股_基金榜单数据模型
维度选择理由ORM类型注解友好(Mapped),生态成熟,迁移工具 Alembic 开箱即用数据库原生 JSONB 兜底半结构化字段、丰富索引(BRIN 适合时序)、CTE 写分析查询很顺手驱动psycopg(psycopg3)SQLAlchemy 2.0 官方推荐,异步支持好重试tenacity为代理请求叠加指数退避重试,提升采集健壮性为什么不用 MySQL?榜单附带大量行情快照字段(价格、涨跌幅、成交额),后续还会追加不固定的扩展字段,PostgreSQL 的JSONB。
2026-08-13 16:48:59
539
原创 用 Python 批量生成销售日报,告别每天复制粘贴
销售日报需要汇总各渠道的订单数、销售额和客单价。渠道超过十个以后,手工把数据从各平台抄进同一张 Excel 就成了明显负担:耗时、易错、且无法追溯数据来源。以 11 个渠道、日均 42 分钟手工汇总估算,每月仅此一项就占用约 15 个小时。本文用一个可落地的 Python 脚本,把这份日报改成每天定时自动生成。流程拆成取数、归一化、算指标、写 Excel、调度五步,代码可直接复用,数据源与代理配置集中管理,渠道字段变动时只改对应函数。
2026-08-12 16:49:31
350
原创 我把 12 个 Scrapy 爬虫项目迁到 Crawlo,踩了这些坑
团队技术栈已全面转向 asyncio需要 Playwright 做动态页面渲染(Crawlo 原生支持,Scrapy 要装 scrapy-playwright 插件)对分布式调度有自定义需求新项目为主,历史包袱小Scrapy 项目运行稳定、性能满足需求 → 没必要折腾大量依赖 Scrapy 生态插件(scrapy-splash、scrapy-crawl-once 等)→ Crawlo 生态还不够丰富团队对 asyncio 不熟悉 → 学习成本不低。
2026-08-11 16:53:55
902
原创 B 站 UP 主动态爬取全流程:从首页到翻页的完整链路
一、问题的本质如果你动手写过 B 站爬虫,大概率撞上过这一幕:第一页的动态数据顺利到手,翻到第二页接口马上甩回或干脆。换 User-Agent、加time.sleep、甚至手动从浏览器抠 Cookie——统统不管用。根源在于 B 站引入的。所有含分页参数的 Web API(动态流、视频评论、空间历史等)都强制要求附带一个动态计算出的w_rid,该签名的生成逻辑藏在前端首页index.js中一段经过混淆处理的 JavaScript 里。。
2026-08-10 16:50:00
356
原创 Python 爬虫实战:抓取汽车之家二手车成交价格与里程数据
本文介绍了如何抓取汽车之家二手车平台的成交数据,用于残值率分析、定价模型和区域行情监控。重点包括: 数据价值:二手车作为非标品,成交价格和行驶里程是关键指标,结合车型、城市、上牌时间可构建价格-里程曲线,为买卖决策提供参考。 技术方法: 通过监听JSON接口而非解析HTML提高稳定性 使用云代理IP(如亿牛云)应对反爬机制 数据清洗将原始JSON转为规整DataFrame 应用场景: 建立动态行情表追踪价格变化 进行价格-里程相关性分析 为二手车交易提供定价基准 该方法相比传统估值工具更贴近市场实际,通过持
2026-08-06 16:45:45
441
原创 基于Python的抖音网页版视频点赞数增长趋势追踪系统设计与实现
一、问题背景短视频运营中存在一个普遍盲区:创作者只能通过抖音后台查看当前时刻的累计指标,无法获取指标的时序演化过程。然而,抖音推荐系统采用多级流量池递进机制——视频发布后先进入初始流量池(约200-500次曝光),系统根据该阶段的完播率、互动率决定是否推入下一级流量池。
2026-08-05 16:50:56
229
原创 新Tab 精准加载 + 接口实时监听:Python 智联招聘爬虫的两种武器
现代招聘平台普遍采用前后端分离架构,职位数据经由 XHR 异步下发,且核心字段分散于列表接口与详情接口。以requests直采静态 HTML 仅能获取渲染骨架,难以保证薪资区间、HR 活跃状态等字段的。本文基于 Playwright 构建采集流水线,以「接口实时监听」完成字段初采,以「新 Tab 精准加载」完成详情补全,并引入亿牛云(16yun)代理 IP 分散出口,形成一套可复用、抗风控的职位采集方案。
2026-07-30 16:47:56
673
原创 散户情绪不是玄学:Python 爬东方财富股吧并量化的方法
很多人一听到「散户情绪」就觉得是玄学,仿佛只有盘面高手靠直觉才能感知。其实东方财富股吧里每天几百万条发帖,就是最原始的散户情绪池子。帖子里有人喊「满仓干」,有人骂「这票废了」,有人发长长的复盘贴。把这些内容按条数抓下来,再用一套简单的规则给每条打分,散户情绪就能从感觉变成数字。举个真实的例子。某只票当天跌停,股吧前排热帖大概率是一堆「割肉了」「被套牢」的抱怨,这时候平均情绪分掉到负 0.6 以下很正常;过两天出个利好公告,热帖画风一转,满屏「加仓」「看好反转」,分数又能弹回正区间。
2026-07-29 16:50:36
392
原创 我是怎么用 Python 爬新浪新闻搜索结果的
前段时间有个需求,要批量采集某个关键词相关的新闻数据做舆情分析。选了一圈数据源,最后落在新浪新闻搜索上。原因有几个:收录量大,搜索结果带时间戳和来源媒体字段,数据结构相对规整,适合做时间序列分析。另外返回的是服务端渲染的 HTML,不需要处理 JavaScript 动态加载,采集成本低。这篇文章记录整个爬取过程的技术细节,包括请求构造、响应解析、反爬策略和代理池设计。
2026-07-28 16:46:22
835
原创 图片懒加载怎么破:爬去哪儿图集实战
在构建离线旅行攻略时,需要把去哪儿网游记中的图集批量抓取并整理为本地 Markdown 电子书。技术上的主要障碍并非反爬,而是图片懒加载:页面中数十张图片在初始 HTML 里仅以占位图形式存在,真实地址延迟到滚动进入视口时才加载。懒加载本身是标准的 Web 性能优化手段,但对只获取静态 HTML 的爬虫而言,拿到的永远是未赋值的占位标记。本文记录从原理分析到工程落地的完整方案,目标读者已具备 Python 与 requests 基础。
2026-07-27 16:50:43
293
原创 抓不到数据先别急,看看 Scrapy 代理有没有真起作用
抓不到数据时,先花两分钟确认代理是不是真在干活,通常比埋头改解析省事。把出口 IP 打出来、把和日志对上,问题在代理还是在本机代码,一眼分开。需要的话,我可以把这套验证加容错直接做成一个可挂的中间件,配个探测 spider,跑起来就能实时看到出口 IP 和异常切换。
2026-07-24 16:41:22
613
原创 异步爬虫里 aiohttp 超时设多少不会误杀正常请求
超时设 3 秒,跑半小时成功率从 98% 掉到 85%。目标站点 RTT 正常,代理 IP 存活,但大量请求抛。问题出在超时阈值与实际网络时序不匹配,把正常的处理延迟当成了网络故障。
2026-07-23 16:47:47
542
原创 SERP抓取做排名追踪:requests加BeautifulSoup够不够用
如果你要抓Google,关键词规模上千,需要追踪不同地区的排名,或者需要抓取Rich Snippet等JS渲染内容。如果你的客户在成都,你想追踪成都地区的排名表现,就得用成都的代理IP去请求。如果你的需求是:追踪几十到两三百个关键词在百度的排名,每周或每天更新一次,不需要抓JS渲染的内容,预算有限不想买商业API。如果你只关心前10条自然结果的排名,这个问题不大,因为自然结果的链接在初始HTML里就有。用代理之后,每个请求可以走不同的出口IP,搜索引擎看到的是分散的访问来源,不容易触发频率限制。
2026-07-22 16:48:18
828
原创 将 Lazada 爬取结果落地 MySQL:PHP 数据持久化实战
从页面解析到 MySQL 落库,链路的每个环节都有明确的工程约束:字符集决定能否完整存下标题,DECIMAL 决定金额是否可信,唯一键决定能否安全 upsert,代理决定采集能否持续。把这些约束前置到表结构和代码里,后续的比价、预警和趋势分析才站得住脚。
2026-07-21 16:52:44
244
原创 把 time.sleep 换成 await asyncio.sleep 之前,先想清楚谁在帮你并发
上周 review 一个同事的爬虫脚本,两千多行,注释里写着"已改成异步,性能提升十倍"。我在本地跑了一遍,比同步版本慢了将近一倍。问题出在哪?满屏的 await,却没有一个真正把控制权交出去。这件事值得单独聊,因为它踩中了 Python 异步里最容易被误解的那个坑:以为加了 async 和 await,代码就自动并发了。
2026-07-20 16:46:34
325
原创 企业内网场景下 Python 自定义 CA 证书信任链的正确配置方法
企业内网的自定义 CA 证书来自两类场景。内部服务 (API 网关、GitLab、Harbor、监控平台等) 使用内部域名或 IP 地址,公共 CA 无法签发此类证书,企业自建 CA 签发后要求客户端信任其根证书。网络安全设备 (防火墙、IDS、DLP) 对 HTTPS 流量做 MITM 检查,设备持有自签根证书,经其转发的连接会被重新签名。浏览器通过组策略信任该根证书,Python 不会。两类场景的本质相同:程序需要信任一个不在公共 CA 信任链里的根证书。通过精细控制 TLS 配置,挂载到。
2026-07-17 16:32:14
364
原创 两周完成爬虫技术栈升级:Scrapy 迁移 Crawlo 的路径与取舍
选择隧道而非前向代理,原因在于隧道把 IP 轮换和健康度管理收敛到代理侧:业务每次请求都打到固定隧道入口,由亿牛云在后端按策略切换出口 IP 并自动剔除被封节点,代码里不需要维护 IP 池、不需要写健康检查。回调里出现 CPU 密集的同步代码,比如大文档的 XPath 批量抽取、深回溯正则、或者 JSON 反序列化后的字段规整,reactor 就会被这一个回调独占,事件循环无法推进,同进程内其他所有在途请求一起排队。是纯函数,输入只有 HTML 和显式声明的元数据,输出是规整后的 record。
2026-07-16 16:49:35
575
原创 Python 随机打乱列表怎么实现?shuffle 避坑指南,90% 的人都用错了
这是一张图片,ocr 内容为:X 12345 图片由AI生成我见过太多人在这个问题上翻车。上周 code review,一个实习生写了,然后对着一个 None 报错抓了半小时头发。这不是个例,random.shuffle 的用法看着只有一行,真踩起坑来能让你怀疑人生。先说结论:shuffle 是原地操作,它不返回任何东西。很多人脑子里想的是"给我一个新列表",实际拿到的是空。这个认知偏差是九成错误的根源。
2026-07-15 16:43:03
329
原创 全网电影信息爬取:从单机脚本到分布式采集系统的工程实践
本文摘要(150字): 2024年影视数据聚合项目实践显示,传统爬虫技术已无法应对现代网站的反爬机制。项目初期采用requests+BeautifulSoup方案失败,成功率仅42%。重构后采用五层架构(调度层、采集层、解析层、清洗层、存储层),结合Playwright浏览器池和curl_cffi双通道采集方案,成功实现日均30万条电影元数据的采集。关键技术包括TLS指纹对抗(curl_cffi模拟)、浏览器指纹伪装(Playwright+stealth补丁)和动态签名逆向,有效应对了SPA渲染、Graph
2026-07-14 16:47:29
401
原创 深入 Pillow 底层:Python 图像通道、像素运算实战开发
大多数开发者对 Pillow 的使用停留在 + 。一旦涉及水印合成、通道混合、批量处理性能优化,对通道模型和像素运算的底层理解就成了分水岭。本文从 Pillow 的内部数据结构出发,拆解通道操作、像素级运算和性能优化机制。mode 是最核心的属性,它决定了每个像素的通道数和数据类型:惰性加载: 只读文件头解析元数据,不读像素。只有在调用 或任何需要像素的操作时才触发实际 I/O。批量只读尺寸时不会产生像素读取开销。RGBA 模式多一个 Alpha 通道,可用于透明度控制:三、生产级效果实现3.1
2026-07-13 16:45:49
339
原创 JS 逆向天花板姿势:JSRPC 远程调用实战
JS 逆向走到深处,最终都会撞上一堵墙:核心加密逻辑被 VMP 虚拟机保护、控制流平坦化、反调试陷阱层层包裹,静态分析几乎无法还原,AST 解析也无从下手。三个结构性优势:零逆向成本(不分析内部实现)、零维护成本(站点更新自动生效)、100% 环境还原(原生浏览器执行)。加密函数在浏览器原环境中正常执行,Python 爬虫通过 WebSocket 远程调用。容器化部署时,浏览器和 Python 服务端打包在同一镜像中。在 VMP 保护日益普及的当下,JSRPC 正从非常规手段变成 JS 逆向的标配技能。
2026-07-09 16:43:00
934
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅