- 博客(73)
- 收藏
- 关注
原创 大模型、Agent 与 Skill:三者协作机制与调用原理
# 大模型、Agent 与 Skill:三者协作机制与调用原理## 1. 先分清三个组件很多人会把 Agent 和大模型混为一谈,但在 Skill 体系里,必须拆成三个独立组件:
2026-07-13 20:23:53
391
原创 小微企业 SRE 稳定性建设
小微企业SRE稳定性建设的核心痛点与上线验收实践 本文针对小微企业的SRE稳定性建设提出了系统性方案。小微企业的典型特征包括研发兼岗运维、架构快速迭代但验证不足、安全意识薄弱三大痛点。文章强调稳定性建设的核心是"防火而非救火",通过上线前的严格验收避免后续重大故障。 作者提出了一套8步上线验收流程,重点包括: 变更与架构对齐,明确Pre与Prod差异 业务与接口测试,确保主流程和异常处理 服务器端巡检,验证数据层和中间件状态 压力测试,模拟真实业务规模 故障演练,覆盖主备切换、积压恢复等关键场景 安全审计,
2026-07-03 18:18:30
399
原创 SRE 为什么要学 Agent:从 N8N 工作流到 Tool Agent
摘要: 本文探讨了Senior SRE学习Agent技术的必要性,通过对比Chat、Workflow(如N8N)和Agent三类技术在不同运维场景下的适用性。Chat适合知识问答和文本处理,Workflow适用于流程固定的标准化任务(如告警分析、发布流水线),而Agent则以LLM为决策中枢,自主执行多步骤排查(如Pod异常分析)。文章强调Agent的核心价值在于动态规划路径和工具调用能力,弥补了Workflow在开放性问题中的不足。最终指出三者应分层协作:Chat处理知识、Workflow管理规范流程、A
2026-07-03 18:15:41
196
原创 一次 GitLab 大仓库 Clone 中断排查
家里 OpenVPN clone 大仓库(HTTP)→ 传输至 ~80% 时客户端或 pack 出现短暂 stall→ Nginx proxy_buffers 满 / upstream 60s 无新数据→ Nginx proxy_read_timeout(默认 60s)断开 upstream这次问题最值得记录的地方,不是简单地把改大,而是排查过程中几个容易误判的点。≠:前者是客户端到 Nginx,后者是 Nginx 到 GitLab看的是「连续无数据的空窗」,不是 clone 总时长。
2026-06-24 18:33:58
329
原创 K8S Filebeat DaemonSet 节点覆盖不全导致 Kafka 日志量偏少
摘要: 测试环境 nginx-only Filebeat 采集 Ingress access.log 写入 Kafka 数量偏少,排查发现核心问题并非 ConfigMap 配置错误,而是 DaemonSet 调度范围与 Ingress Controller 实际运行节点不匹配。原 Filebeat 仅部署在 5 个带 app=log-node 标签的节点上,而 8 个 Ingress 节点中只有 1 个被覆盖。通过删除 nodeSelector 并调整 nodeAffinity 排除专用节点后,Filebe
2026-06-21 10:34:53
364
原创 Logstash WebHDFS 异常导致历史日志补读与 OOM
摘要 Logstash集群因WebHDFS输出异常导致历史日志重复读取和内存溢出(OOM)故障。故障表现为Kafka数据量下降而Nginx日志量正常,排查发现Logstash进程虽运行但WebHDFS持续故障切换,触发历史文件重复读取。重启后因补读大量历史数据导致Kafka元数据更新超时和HDFS租约冲突,最终因内存队列堆积引发OOM。根因是WebHDFS/Kafka输出阻塞导致文件采集偏移量未及时更新,重启后继续补读大文件。解决方案包括优化Kafka配置、调整Logstash并发参数,最终通过移除WebH
2026-06-04 19:02:24
323
原创 OpenClaw 定时任务简单配置
OpenClaw定时任务机制通过两种方式实现:1)cron文件方式,在Agent工作区创建cron目录,按标准crontab格式编写定时任务,到点执行sessions_send命令触发会话消息;2)HEARTBEAT.md心跳文件,以Markdown清单形式记录周期性提醒事项。前者适合精确时间点的固定任务,后者用于周期性提醒。定时任务仅负责触发消息,具体执行逻辑由Skill/工具链处理,实现权限与业务逻辑分离。复杂流程可结合Taskflow编排,cron仅负责触发时机。系统提供cron reload/lis
2026-05-13 19:13:37
440
原创 OpenClaw 多 Agent + 双钉钉机器人 SOP(单网关)
OpenClaw多Agent钉钉机器人配置指南 本文介绍了如何在OpenClaw系统中配置双钉钉机器人实现多Agent协作。主要步骤包括: 钉钉平台创建第二个企业内部应用机器人 OpenClaw中新建k8sagent工作区并配置独立人设 修改配置文件实现多账号绑定,通过accountId将不同机器人路由到对应agent 验证双机器人会话隔离效果 关键点:两个机器人使用独立的钉钉应用凭证,共享技能目录但通过不同会话和人设实现功能区分。配置时需确保bindings部分accountId、agentId的对应关系
2026-05-06 21:39:08
488
原创 Spring Boot 项目在 K8S 中的打包、部署与运维发布实践
本文介绍了Spring Boot项目在Kubernetes环境中的完整发布流程。首先阐述了运维需要掌握Java项目交付链路的重要性,包括理解jar/war包区别、Spring Boot特性及Maven构建工具。重点讲解了从源码到Docker镜像的构建过程,通过多阶段Dockerfile实现编译打包与运行分离的实践方案。文中详细分析了Jenkins流水线的关键环节和常见失败点,如Maven依赖下载、源码拉取、多阶段构建等问题,为运维人员提供了从代码到上线的全链路视角,帮助提升K8S环境下的发布成功率与问题排查
2026-04-30 22:15:00
1166
1
原创 Wazuh 部署指南
Wazuh是一款开源XDR和SIEM平台,提供日志分析、入侵检测、文件完整性监控等功能。本文详细介绍了Wazuh的部署流程,包括环境准备、Docker安装、镜像拉取(使用华为云源替代Docker Hub)、证书生成和容器启动等步骤。部署完成后可通过443端口访问Dashboard(默认账号admin/SecretPassword)。文章还记录了常见问题解决方法,如Docker Compose版本兼容问题和镜像拉取超时等。Wazuh适合构建内部安全监控系统,具备完善的安全审计功能。
2025-12-24 19:00:30
1286
原创 N8N调用系统接口进行AI分析
本文介绍了使用N8N自动化工具调用巡检系统接口并生成AI分析报告的工作流程。主要内容包括:1)通过HTTP请求调用已开发的巡检接口获取数据;2)配置AI代理(使用DeepSeek免费模型)对巡检日志进行分析;3)设置钉钉机器人Webhook推送分析结果。文章详细说明了流水线构建步骤,包括接口调用、AI模型配置、结果推送等环节,并提示了钉钉消息推送时的JSON格式注意事项。该方案实现了巡检数据自动分析和报告推送的完整流程。
2025-12-22 19:00:00
289
原创 centos7源码编译安装python3
本文介绍了在CentOS7系统上通过源码编译安装Python3.10.6的过程。首先下载源码包并安装必要的依赖工具,然后进行常规编译安装。过程中遇到SSL模块报错问题,通过安装高版本OpenSSL(1.1.1q)并正确配置动态链接库路径得以解决。最终成功完成编译安装,验证了requests模块可正常使用。文章详细记录了安装步骤和问题解决方法,为在CentOS7上安装Python3提供了实用参考。
2025-07-03 18:19:53
606
原创 了解Hadoop
Hadoop 是 Apache 基金会开发的开源分布式计算平台,主要用于存储和处理大规模数据集。其核心组件包括 HDFS(Hadoop 分布式文件系统)、MapReduce(编程模型)和 YARN(资源管理系统)。HDFS 提供高容错性的数据存储,MapReduce 用于并行处理海量数据,YARN 则负责资源管理和任务调度。Hadoop 采用主从架构,通过守护进程如 NameNode、DataNode、ResourceManager 和 NodeManager 实现集群管理。Hadoop 支持本地模式、伪分
2025-05-09 17:33:31
1044
原创 学习influxDB的安装和使用
nfluxDB 是一种时序数据库,时序数据库通常被用在监控场景,用来收集各个节点采集到的监控指标,以及监控指标产生的时间点
2025-04-30 14:05:42
2402
原创 Pandas基础学习分析处理nginx日志
Pandas 是数据分析的利器,它不仅提供了高效、灵活的数据结构,还能帮助你以极低的成本完成复杂的数据操作和分析任务。
2025-04-22 10:55:13
448
原创 mysql限制用户登录失败次数,限制时间
mysql 需要进行用户登录次数限制,当使用密码登录超过 3 次认证链接失败之后,登录锁住一段时间,禁止登录
2023-09-21 16:02:29
5397
原创 Python多线程好玩弹窗代码
最近做了一个恶搞的弹窗代码发给朋友玩,,这里分享给大家..源码: 这里的这几个包都是要导入,可以在终端上使用pip工具导入.代码运行测试结束后,使用打包工具,Python代码的打包生成exe文件,可以在没有Python环境的系统上执行.首先: pip install Pyinstaller 安装这个包然后执行命令,-w参数,,隐藏程序黑框,只能从任务管理器关闭在命令的回显中找到文件生成的路径,就可以找到生成的可执行文件了, 然后就可以发送朋友了,效果:弹窗的同时会有声音的效果..
2022-06-01 18:02:38
2847
1
原创 LVS三种工作模式及原理详解
什么是 LVS?LVS 是 Linux Virtual Server 的简写,也就是 Linux 虚拟服务器,是一个虚拟的服务器集群系统,本项目在 1998 年 5 月由章文嵩博士成立,是中国国内最早出现的自由软件项目之一。官方网站:http://www.linuxvirtualserver.org,LVS 实际上相当于基于 IP 地址的虚拟化应用,为基于 IP 地址和内容请求分发的负载均衡提出了高效的解决方法,现在 LVS 已经是 Linux 内核标准的一部分。使用 LVS 可以达到的技术目标
2022-05-24 17:59:43
7723
原创 TCP的拥塞控制,慢开始是什么?
先来了解一下什么是拥塞控制:所谓的拥塞控制就是放止过多的数据注入到网络中,这样可以使的网络中的路由器,或者链路不会发生过载,拥塞控制所要做的就是都有一个前提,就是网络能够承受现有的网络负荷.,拥塞控制是一个全局性的过程,涉及到所有的主机,路由器,以及与降低网络除数性能相关的因素.拥塞控制的一般原理:在某段时间中,若网络中某一资源的需求超过了该资源所能提供的可用部分,网络的性能就会变坏,这种情况就称为拥塞,关系式: 对资源的需求>可用资源要解决网络拥塞的发生,不能简单增加不足的资源,
2022-05-19 16:57:59
3100
原创 KVM底层工作原理
以色列qumranet公司研发,后被RedHad公司收购(1)kvm只支持x86平台(2)依赖于 HVM,inter VT AMD-v· KVM是(Kernel-based Virtual Machine)的简称,是一个开源的系统虚拟化模块,自Linux 2.6.20之后集成在Linux的各个主要发行版本中。它使用Linux自身的调度器进行管理,所以相对于Xen,其核心源码很少。· KVM的虚拟化需要硬件支持(如Intel VT技术或者AMD V技术)。是基于硬件的完全虚拟化。而Xen早期则..
2022-05-15 16:53:34
770
空空如也
Jinja2中for循环的使用
2022-11-08
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅