自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(453)
  • 收藏
  • 关注

原创 玩转LlamaIndex:结构化输出

如果你想用正则匹配、关键词提取、第三方库等方式自己解析,可以用这个。99% 的场景用方式一就够了如果你有特殊需求(比如 LLM 输出的是 JSON 之外的格式),可以用自定义函数。"""自定义解析函数。输入是 LLM 收到的所有消息,输出必须是 dict。"""# 提取最后一条 assistant 消息# 这里可以写你的自定义解析逻辑# 例如:正则提取数字、调用第三方 NER 服务等import rereturn {"steps": ["用自定义解析得到"],

2026-08-06 09:12:47 89

原创 玩转LlamaIndex:多 Agent 协作

是 Agent 的"自我介绍",LLM 靠它来决定"这个用户问题该转给谁"。有时候多个 Agent 需要共享数据(比如"用户 ID"在所有 Agent 里都要能拿到)。所有用户输入首先进入 root_agent,它根据情况决定是自己处理还是转交给其他 Agent。完全自己写 Planner 函数,决定"下一步调哪个 Agent、用什么 prompt"。:每个 Agent 专精一个领域,用一个"总控"来分配任务。:A 交给 B,B 又交回 A,直到 token 耗尽。(A 交给 B,B 又交回 A)。

2026-08-05 09:41:12 165

原创 玩转LlamaIndex:HITL让 Agent 在关键操作前“问一下人“

HITL =。在 Agent 自动化执行任务中,插入人类决策点,让 AI 在做关键操作前先询问。如果让 Agent 完全自动跑,一旦出错代价太大。

2026-07-30 09:04:33 336

原创 玩转LlamaIndex:Context 记忆机制

Context 累积的消息越多,每次调 LLM 的 token 消耗就越大。多轮对话后,token 可能爆掉。解决思路:当历史超过阈值时,自动用 LLM 把老消息压缩成摘要。# 自定义一个带摘要的 memorytoken_limit=4000, # 超过 4000 token 自动摘要# 手动管理历史# 把历史消息塞到 memory 里memory.put(ChatMessage(role=MessageRole.USER, content="今天天气真好"))

2026-07-29 08:22:52 210

原创 玩转LlamaIndex:FunctionAgent 快速上手

"""将两个数相乘,返回它们的乘积。"""这一段是整个 Agent 设计的核心。FunctionAgent 会把这个函数自动转成 OpenAI 兼容的tool"description": "将两个数相乘,返回它们的乘积。",},所以三件事必须做好类型注解要具体:用float不用int,用list[str]不用list。越精确,模型调用越准。docstring 要详细:它就是工具的"产品说明书",模型读它来决定什么时候用这个工具。一句话的 docstring 在 demo 里能跑,生产环境会翻车。

2026-07-27 09:16:38 155

原创 LlamaIndex 安装与配置指南

干掉那些死板的套路,咱直接用大白话把 LlamaIndex 的环境搭起来。我用 conda 虚拟环境,用 DeepSeek模型;老规矩,先看下结果。

2026-07-22 14:07:44 189

原创 混沌工程、RTO/RPO、Runbook 这些缩写到底在聊什么?

主动搞破坏,测系统韧性。

2026-07-21 08:26:27 172

原创 初学者 LangChain vs. LlamaIndex:不是非黑即白

我的背景(大数据基础、LLM应用初学者),建议。:优势在于“”,而 LlamaIndex 的核心正是。它更专一,能快速产出成果,避免过早陷入复杂的agent中。

2026-07-20 09:20:49 158

原创 Flink 资源部署方式,你还在用Yarn吗?

新项目,无历史包袱:直接,用 Operator 或 Flink Native K8s 模式。已有 Hadoop 生态,且运维团队偏大数据方向:继续完全没问题,它是经过海量验证的稳定方案。极简单业务或测试:Flink Standalone 依然可用。简单说,现在云原生推动下,Flink on K8s 已经从小范围大厂专属,变成了中小公司的常规选择。目前面临选型的话,可以优先考虑 K8s 方案。

2026-07-16 09:02:12 361

原创 我们为什么放弃自建数据治理平台,全面上华为云 DataArts

架构师的价值是设计业务能力,不是堆砌开源组件。DataArts 帮你把“挑砖、和泥”的活干了,你只需要画好蓝图。

2026-07-14 08:36:05 199

原创 华为云DWS磁盘使用率超90%后集群只读

核心问题:临时表生命周期失控,凌晨ETL集中写入打爆磁盘。三板斧排错:显示事务+ 删临时表,腾出空间。踩坑:临时表要DROP不用TRUNCATE;命名带tmp不等于临时表;KILL 任务时清理语句不执行。调优:作业末尾强制清理 + 优先用TEMP TABLE+ 每日兜底作业 + 设置。参考DWS磁盘空间满处理方案。

2026-07-08 14:18:48 231

原创 frp 远程访问安全加固三问:Token 生成、密钥登录与权限解惑

云服务器安全组只开放了必要的端口,并限制了来源 IP。frp 通信受强 token 保护,防陌生人蹭隧道。Mac SSH 仅允许密钥登录,禁止密码,杜绝暴力破解。禁止 root 直接登录,普通用户仍可使用sudo管理。三招下来,你的远程开发环境既方便又抗揍,可以安心连自己的 Mac了。

2026-07-01 15:28:53 168

原创 frp 实现内网穿透:随时随地远程控制你的 Mac

家里 Mac 性能爆表,公司电脑想随时连,怎么办?

2026-07-01 14:29:52 331

原创 Docker 一键部署 MySQL 8.0

一个 Dockerfile,一个初始化脚本,5分钟拿到一个随时可用的 MySQL,后面接 Hive 时直接连。

2026-06-25 15:46:13 370

原创 Linux 查看端口监听三种方法

无输出 = 端口未被监听/占用。

2026-06-25 15:44:55 266

原创 Dockerfile 一键构建 Hadoop 镜像

读完这篇,你会用 Dockerfile + 外部配置文件的方式,从零构建一个 Hadoop 3.3.6 镜像。所有 XML 和启动脚本都放在宿主机目录里,修改方便,排错清晰。

2026-06-17 09:47:12 451

原创 用 Docker 装 Hadoop,看这篇就够了

本文带你从空白容器开始,敲命令、改配置、排错误,亲手搭出一个可用的单节点 Hadoop。

2026-06-17 09:23:32 362

原创 一招查清 Docker Hub 上所有 Ubuntu 可用版本

别再盲目拉latest了。两分钟锁定精确版本,让你的实验环境稳如磐石。

2026-06-15 09:55:29 164

原创 配置 Cloudflare Tunnel:把 Mac 上的 Web 服务变成安全域名

现在虽然域名能访问了,但其实只要知道域名的人都能打开你的 ollamawebui 界面,这非常危险。Cloudflare Access 可以在打开页面之前,强制要求输入邮箱,并发送一次性验证码,只有你指定的邮箱才能进入。左侧菜单点击Access→,然后点。选择。应用名称随便填,例如 “ollamawebui”,应用域名填ollamawebui.你的域名.xyz,点击 Next。在策略页面,Policy name 填 “Allow my email”,然后在Include选择器里选择。

2026-06-15 09:27:06 389

原创 Hermes|飞书 + 腾讯云搭建带记忆的 AI 智能助手

过去我们评价AI,看它现在能做什么;Hermes让我们开始问:它跟你多久了,学到了什么。Hermes Agent的意义,不在于它比别的框架多几个功能,而在于它重新定义了Agent的生命周期——Agent不只是工具,而是可以积累经验、记住偏好的数字伙伴。用一个月的成本,换一个越来越懂你的AI。这笔账,怎么算都划算。相关链接🌐 官网:https://hermesagent.org.cn📖 官方文档:https://hermesagent.nousresearch.com/docs。

2026-06-04 16:03:45 298

原创 NOT IN 的 NULL 陷阱:一次 UNION 数据“神秘消失“

NOT IN遇到 NULL,不是漏几条,是全部消失。而且不会报错,悄无声息。你以为是逻辑问题,其实是 NULL 在搞鬼。以后写 SQL,遇到NOT IN多长个心眼,或者直接换成NOT EXISTS,一劳永逸。你遇到过类似的 NULL 陷阱吗?评论区聊聊,一起排雷。

2026-06-02 16:17:28 300

原创 Python 打包 EXE 极简指南

拿:去dist文件夹取exe搞定。💬 你打包时遇到过什么奇葩报错?评论区聊聊,一起排查。

2026-06-02 08:24:07 263

原创 llama_index.vector_stores 模块没有怎么办?

这个错误表明您安装的版本较旧,或者缺少必要的集成包。是在较新版本中引入的模块结构。

2026-05-28 10:02:30 106

原创 卸载 conda(太大) 安装 miniconda

变量名路径(根据你的安装位置调整)Path 新增C:\miniconda3Path 新增C:\miniconda3\ScriptsPath 新增C:\miniconda3\Library\bin。官网:https://docs.conda.io/en/latest/miniconda.html。

2026-05-28 09:58:33 357

原创 Ollama 本地安装 C盘太小怎么办

Ollama程序本体必须装C盘(约100MB),但模型文件(几个GB到几十GB)可以通过环境变量轻松迁移到D盘/E盘,无需重装,立即生效。现在就去设置环境变量,把模型搬到空间充足的盘吧!

2026-05-27 11:30:39 382

原创 120 个必备的 AI工具

2026-05-27 11:24:40 419

原创 三个方法,看清Mac的GPU有没有在干活?

这是Mac自带的工具,就像公司里的监控摄像头,能直观看到所有“员工”的工作状态。只有当你直接在Mac上原生运行Ollama,或者使用Docker官方的Model Runner时,才能看到GPU被真正调用。因为Docker容器里的模型,压根摸不到你M1的真GPU,只是在用CPU硬算。如果你的Ollama是跑在Docker里,用上面任何方法看GPU利用率都。:打开“活动监视器”,顶部菜单点击“窗口” ->:如果只是大概看看,在“活动监视器”里切换到。标签页,也能看到GPU的整体利用率。

2026-05-26 15:03:18 400

原创 扣子(coze)高级实战-从“一张图”到“多镜头影视解说”

✅ 至此,循环体内一次执行就完成了一个分镜的“配音+出图+合成小视频”。循环执行完毕后,每个分镜都会输出一段小视频。如果循环内TTS或图像生成失败,检查插件是否正常工作;可先在循环外单独测试单个分镜的TTS+出图。:输出的是一个纯JSON。因为每个分镜的旁白就是独立文本,不再需要整段文案。是否保留了音频轨(默认会保留),必要时检查每个小视频是否包含音频。初版建议用简化音频方案先跑通,确认多画面切换效果后再做精确同步。把原来生成整篇文案的提示词,替换为以下内容。关注我,免费领取1月“plus”会员。

2026-05-26 14:53:50 1439 1

原创 M1 Mac 装 Ollama,我被 Docker 骗了三次

AI 工具的生态在过去六个月里发生了一件很微妙的事:本地部署从"极客玩具"变成了"普通人选项"。不是因为技术门槛降了,而是 API 账单这件事,开始真的让人肉疼了。Ollama 出现在这个节点不是偶然。它解决的不是"我想不想用 AI"的问题,而是"我愿不愿意每个月持续付钱换隐私"这个更现实的问题。现在最适合上手的,是那些用 AI 处理私人文件、代码、内部文档的人——律师、程序员、独立设计师、写作者。这些场景里,数据不能出门,这是刚需,不是偏执。

2026-05-25 09:00:43 579

原创 腾讯云OpenClaw服务器配置AI绘画完整指南

我目前在腾讯云上有一台OpenClaw的轻量型服务器,已经配置了智谱大模型和飞书IM。现在想让这个机器人具备AI绘画能力,经过一番摸索,找到了几种可行的方案。新手推荐:选择模力方舟官方Skill,配置最简单白嫖党首选:安装ClawRouter,免费模型够用技术达人:可以尝试对接阿里云或其他API,灵活性更高如果没有报错,格式就是正确的!

2026-05-25 08:52:18 620 2

原创 OpenClaw 能帮我干啥

一个 7×24 小时的内容助理—— 随时响应,永不疲倦一个多模型智能路由中枢—— 自动选择 KIMI/GPT-4/Claude 最优解一个可编程的自动化引擎—— 定时任务、工作流串联一个知识处理外脑—— 阅读、总结、翻译、写作核心价值:把您从重复性内容生产中解放出来,专注于创意决策和人际互动。

2026-05-24 20:51:26 367

原创 腾讯云+Dify+DeepSeek,手把手教你打造专属AI助手!

市面上虽然有很多AI工具,但要么收费高,要么数据安全没保障,要么功能受限。完全掌控数据:所有对话记录、知识库文件都存放在你自己的服务器上。自由选择模型:支持DeepSeek、OpenAI、腾讯混元、智谱等多种模型,随时切换。成本极低:2核4G服务器一年只要一百多块钱,DeepSeek的API费用几乎可以忽略不计。功能强大:可视化工作流、知识库问答、API集成……满足各种需求。接下来,我们就开始这场奇妙的AI部署之旅!

2026-05-24 12:55:33 430

原创 Git 死亡三连实录:pull 冲突 → push 被拒 → merge 炸锅,完整抢救指南

报错现象技术根因通俗解释解法本地 untracked 文件与远程同名文件冲突Git 不敢覆盖你没管过的文件或手动删除冲突文件本地与远程历史分叉成 Y 字形远程有新提交,你必须先同步才能上传先pull合并,再push等文件有本地修改,阻碍合并缓存文件挡在路中间,合并算法过不去丢弃修改在 CMD 里不认PowerShell 和 CMD 命令不通用你用 CMD 执行了 PowerShell 专属命令CMD 用del,PowerShell 用反复踩坑没有.gitignore。

2026-05-22 14:20:30 411

原创 Fish Audio(鱼声)+ Python:零门槛用自己声音合成任何文本

你的需求推荐方案🧪 我就想试试,零成本注册 API → 免费额度 → 跑 Demo✍️ 自媒体/内容创作Plus $11/月,性价比拉满🏭 批量生产Pro 套餐或本地部署🔒 数据敏感/离线使用本地部署(需 GPU)🎉 恭喜你读到这里!现在你已经是声音克隆理论 + 实战双修的选手了。📣 有任何问题(本地部署教程、效果调优、API 报错排查),随时告诉我,我给你续上!关注我,送你一个月的“plus”会员权益。

2026-05-22 13:57:23 1768

原创 创建个人知识库(lamaIndex + ChromaDB + 本地开源模型)

一个完整的、零成本的Windows环境搭建指南,使用LlamaIndex + ChromaDB + 本地开源模型。

2026-05-21 11:25:11 380

原创 阿里云电商数据 + Dify,部署自己的SQL Copilot

字段类型说明示例值用户IDTEXT主键,U开头U1000用户姓名TEXT中文真实姓名张伟用户性别TEXT男/女男用户年龄INTEGER18-65岁28用户城市TEXT12个一二线城市北京,上海,广州,深圳,成都,杭州,武汉,西安,南京,重庆,天津,苏州。字段:用户ID, 最后购买日期, 购买频次, 累计消费, 平均客单价, 消费周期天数。字段:商品类别, 销量, 销售额, 购买人数, 客单价, 女性占比。字段:用户城市, 订单数, GMV, 购买人数, 客单价。用途:品类矩阵分析,爆款识别。

2026-05-21 10:55:24 539

原创 高级 SQL 实战教程(华为云 DWS / PostgreSQL 版)

📌 本教程不会只扔代码。每一个知识点都会从真实的“业务问题”出发,先弄清楚,再讲明白,最后给出,并指出。

2026-05-20 16:27:49 462

原创 扣子(coze)高级实战-输入电影名,文案配音字幕全自动搞定

🖱️操作解读:登录扣子(coze.cn)→左侧“资源库”→“工作流”→“创建工作流”,起名“影视解说MVP🧩配置开始节点movie_nameString,用户输入的电影名称,如“《肖申克的救赎》”。

2026-05-20 15:33:38 1121

原创 你知道你的CSDN的原力等级吗?我是5级

CSDN原力值是基于用户在平台上的多种行为数据,综合计算出的一个影响力与贡献度评估指标。影响力评估:你发表的高质量文章、参与的深度讨论,都会提升你在社区中的声誉和曝光。贡献程度度量:通过内容创作、互动反馈、社区参与等多维度行为进行积分量化。核心逻辑:原力值越高,说明你的社区知名度越大,你的文章、回答等内容也会优先获得推荐和关注。✨CSDN原力值不仅是一份荣誉,更是技术成长路上的见证。无论你是刚入门的新手(🌱),还是正在冲刺5级(🚀)的活跃创作者,每一次原创、每一次帮助他人的回答,都在累积你的“原力”

2026-05-18 16:23:55 342

原创 告别付费!Claude 亲手打造的免费 PDF 工具箱

平时处理 PDF 真的是一堆零零碎碎的破事儿 😩。

2026-05-18 13:59:51 358 1

Claude+python打造的pdf工具

源码已上传,exe文件超出限制了;如需要给我留言,我在云盘里打包好了;如需定制也欢迎留言! 一、水印与背景清理(4 项) 这里原本有图示,我直接列一下功能: - F1:删除角标水印(支持自定义关键词) - F2:清除全页背景水印 - F3:去除扫描件的灰色底纹 - F4:抹掉指定区域的固定文字或图标 二、文字编辑(4 项) 可以批量改字、改日期、统一页眉页脚: - F5:批量查找替换文本(支持正则) - F6:修改文档属性标题/作者/主题 - F7:插入页眉或页脚文字 - F8:更新特定日期格式(如 2023→2024) 三、权限与格式(5 项) 最后阶段搞权限、合并拆分和压缩: - F9:去除打开密码 - F10:添加打开密码或权限密码 - F11:按页数拆分(例如每 5 页一个文件) - F12:多文件合并成一个 PDF - F13:压缩体积(可调质量)

2026-05-30

【大数据学习路线】基于Hadoop与Flink的核心技术栈:大数据工程师学习路径规划与实战项目设计

内容概要:本文是一份系统化的大数据学习路线图,全面覆盖从零基础到架构专家的四个阶段成长路径,包括基础准备期(Linux、Java/Python、SQL)、核心技术期(Hadoop、Hive、Kafka、Spark)、进阶提升期(Flink、HBase、数据仓库建模、数据湖)以及架构专家期(大数据架构设计、数据治理、OLAP引擎、性能调优)。 文档详细规划了各阶段的学习内容、技术要点、实战项目、检验标准,并提供针对不同背景人群的差异化学习计划、最新学习资源推荐及常见避坑指南,帮助学习者构建完整知识体系并具备企业级实战能力。 适合人群:大数据入门学习者、初中级工程师、希望系统复盘提升的技术人员、转行求职者以及计算机相关专业学生。 使用场景及目标: ①为初学者提供清晰的大数据技术学习路径与核心技术栈掌握方案; ②指导开发者完成从理论到实战的跨越,独立构建离线数仓、实时计算等企业级项目; ③辅助求职者进行面试准备、项目包装与技能查漏补缺;④支持不同背景的学习者根据自身情况定制个性化学习计划。 阅读建议:学习过程中应坚持“动手实践+原理理解+项目驱动”的原则,避免只看视频不动手、忽视SQL基础或盲目追新,建议结合文档中的实战项目与推荐资源边学边练,并定期复盘以形成体系化能力。

2026-05-09

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除