- 博客(940)
- 资源 (152)
- 收藏
- 关注
原创 Agent评测中的Scorer的设计思路
Agent 的输出大多是开放式、多维度、有程度差异的,几乎没法用Pass或者Fail这种简单测试结果直接判定。Scorer 的作用就是把模糊的好坏变成可量化、可比较、可自动化、可诊断的分数。量化与可比较同一个 Agent 版本 A 和版本 B,如果只说测了 200 条,A 过了 160 条,B 过了 165 条,你几乎无法判断谁更好,因为Pass的标准可能不一致。有 Scorer 后,你可以给出:各维度平均分加权总分分数分布关键维度的通过率这样版本对比才有意义。
2026-08-28 17:57:59
14
原创 评测视角的Agent分类及应用
对于 Agent Evaluation,仅仅把 Agent 简单划分为若干类型并不足以支撑实际评测。一个 Agent 往往同时具有多种能力、执行方式和环境交互特征,因此单一分类很难直接决定应该采用什么评测方法。
2026-08-27 11:15:17
28
原创 简单快速的理解LOOP
这次个都满足,那么就可以考虑使用loop来解决问题。这里必须明确,每一个Loop必须有停止条件和check条件。Loop的解决方案并不便宜,因此Loop的每一步都值得精雕细琢。● 这个Loop你要一直使用,只做一次的task不需要一个loop。● hunman不在loop中,我们给出目标,agent给出结果。● task有自己的检查点,在不需要你的情况下也能确定是不是完成。● 最终的结果是一个客观结果而不是一种凭感觉给出好坏评价的内容。那么如何衡量一个task是不是需要用Loop来解决呢?
2026-08-21 15:32:43
13
原创 一个Agent的会话分析
一个code agent在完成用户交付的任务的过程就是通过过agent不断的发送request给LLM,然后LLM响应对应的response来完成的。Agent发送的每一个request都包含了system prompt、类似Agent.md的文件、tools的定义以及一些会话历史。在任何一个Agent中上下文都会随着使用过程不断地增长,一旦上下文超过了LLM的限制,LLM就会拒绝响应了(当然当前的Agent中有各式各样的上下文压缩技术来避免这种情况的出现)。
2026-08-18 14:09:56
14
原创 Agent 中 Skill 与 MCP Tool 的加载与调用机制总结
MCP 负责在启动时把“手”和“工具”准备好;Skill 负责在需要时把“操作手册”塞进脑子。Agent 看到两者的描述后,自己决定先翻手册还是直接拿工具,或者两者配合使用。
2026-07-28 11:21:36
40
原创 Agent Skills的评测:SkillsBench
智能体的SKills是基于文件系统的可重用程序包,在无需修改模型权重的情况下推理过程中增强Agent能力。Skills封装了特定领域的流程、管理、启发式规则、模板以及可执行资源。SkillsBench是量化评估“智能体技能”(Agent Skills)对基于大语言模型(LLM)的 AI 智能体实际效能影响的系统性基准。它专为确保可重复性、确定性及防作弊能力而设计,SkillsBench包含了8个领域的87个专业级别的任务,如果有需要自己也可以添加任务。Task的包结构。
2026-07-15 13:55:37
60
原创 存量系统Agent Tools设计思考:On-the-Fly
在启动阶段只加载轻量能力索引,任务执行时按需发现系统、现场生成 CLI、持续沉淀为可复用资产,实现"按需构建 → 持续沉淀 → 逐步完善 →能力成长"的工具演进闭环。解决了Agent 如何按需学习能力,并将能力沉淀为可长期复用的资产。→ CLI Construction(LLM 按需生成)→ CLI Registry(cli.md 注册)→ Runtime Reuse(直接调用)→ Progressive Accumulation(能力库增长)
2026-07-08 16:54:30
37
原创 存量系统Agent Tools设计思考:On-the-Fly
在启动阶段只加载轻量能力索引,任务执行时按需发现系统、现场生成 CLI、持续沉淀为可复用资产,实现"按需构建 → 持续沉淀 → 逐步完善 →能力成长"的工具演进闭环。解决了Agent 如何按需学习能力,并将能力沉淀为可长期复用的资产。→ CLI Construction(LLM 按需生成)→ CLI Registry(cli.md 注册)→ Runtime Reuse(直接调用)→ Progressive Accumulation(能力库增长)
2026-06-26 16:23:51
48
原创 如何测试一个Skills
当前定义一个skills就是好的,满足需求的这个标准其实还很困难。因此这里只说一种大致的参考测试评价过程,这个过程也包含了部分主观评价的内容,虽然我们都知道一个客观的benchmark测试会更加精确,但是目前对于SKills还很困难。因此这里定义了量化和定性两个方向的指标。
2026-05-27 15:43:27
167
原创 “绊网”(Tripwire)机制
无论应用于哪个领域,“绊网”机制的核心价值都在于“防患于未然”。它本身不一定是阻挡敌人的坚固城墙,但它是发现危险的“神经末梢”和触发全面防御的“导火索”。
2026-05-26 16:35:17
119
原创 Claude Code的Hook
Claude Code hooks是在claude 生命周期的固定节点自动执行的命令。例如,Claude Code生成代码后,可能不跑格式化工具,挂在 PostToolUse 上的 Hook 会在每次文件编辑后跑 Prettier(Prettier 是一个流行的、“有主见”(Opinionated)的自动化代码格式化工具。它能解析代码并按照统一的风格重新打印,自动处理缩进、换行、引号、分号等样式细节,主要用于提升代码风格的一致性,减少代码审查中的风格争议);
2026-05-20 14:48:11
182
原创 使用Ollama的Claude
很多agent都可以使用ollama完成大模型接入,可以使用ollama的cloude模型,包含了openclaw、hermes、claude desktop以及coding agent(claude code、codex、copilot CLI、opencode、droid、Goose、Pi、Pool等)
2026-05-08 14:44:56
425
原创 大模型应用中数据格式的选择
这样结合了两者的优点:Markdown 负责“知识表示友好 + token 节省”,JSONL 负责“训练格式标准化”。
2026-03-31 09:34:51
246
原创 Agent使用的浏览器自动化工具对比分析
本文对四款常见的浏览器自动化 / AI Agent 工具进行全面对比,帮助开发者根据具体场景选择最合适的方案。四个工具覆盖了从个人账号登录态复用、跨浏览器 E2E 测试、前端调试分析到高频数据抓取的不同需求层次,定位各有侧重,部分场景存在重叠。cookie-proxy 是一个专为设计的 Skill,核心价值是让 Claude Code 直接借用用户浏览器里已有的登录状态,访问任何需要登录的网站,或在已登录页面执行点击、填写表单、提交等交互操作。↓ 发出请求。
2026-03-26 08:09:30
169
原创 Skill中为用户建立用户配置
让 Skill 在第一次运行时收集必要信息并保存,以后直接复用,避免每次重复询问。本质上是给无状态的 LLM 加了一层"长期记忆"。
2026-03-24 15:40:37
158
原创 Skill的嵌套
Skill的嵌套就很简单,直接引用其他的Skill就好了。在一个 Skill 的 SKILL.md 中,可以明确指示 Claude 去读取另一个 Skill 的文档。
2026-03-18 09:37:37
872
原创 Skill中python代码的鉴权处理
方案Key 进入上下文安全性适合场景命令行参数✅ 会低临时调试环境变量❌ 不会中日常使用.env 文件❌ 不会中开发环境系统密钥链❌ 不会高本地生产MCP Server❌ 不会最高正式集成如果你的 Skill 要长期使用、访问重要系统,MCP Server 方案值得投入,一次封装好鉴权逻辑,后续所有调用都干净安全。
2026-03-13 09:56:13
166
原创 为Skill开发的python脚本一些经验
其中SKILL.md的职责是调度,不是实现,这里面要写清楚如下三点:脚本会自动生成:如果缺少依赖:这样就实现了分工,脚本用来完成格式转换、统计计算、文件生成;Claude做理解用户意图、选择参数、解释结果、处理特殊需求等。Claude 调用脚本时,所有参数都通过命令行传递,本质上都是字符串。但在脚本内部,应该明确转换成正确类型,而不是全程当字符串用。因此,强烈建议使用argparse里声明正确的type,如下: 的 参数会自动做转换和报错,比在代码里手动 更安全,报错信息也更清晰。特别注意如下
2026-03-12 17:24:15
724
原创 Claude Skills的技术详解
摘要:Skills是一个渐进式加载的三层架构系统,Claude通过读取skill的name和description判断是否需要调用。触发后,Claude会查看SKILL.md获取完整指令。每个skill包含SKILL.md(核心文件)、scripts(可执行代码)、references(参考文档)和assets(资源文件)。开发时需注意description质量,应明确skill用途和触发场景。示例展示了translator和csv-analyzer两种skill的实现方式,强调结构化指令、可预测性和脚本处
2026-03-06 11:23:20
546
原创 concolic testing是什么
Concolic testing是符号执行和具体执行的结合体,是软件测试和程序分析领域广泛使用的技术,尤其是在自动生成测试用例、路径探索、漏洞检测等方面。concolic是concrete(具体)和symbolic(符号)两个单词的结合体。Concolic testing 的核心目标是自动生成输入数据来覆盖程序的不同执行路径,从而发现bug、验证属性或提升代码覆盖率。它特别适合处理复杂的条件分支、循环和约束。它使用数学求解器来系统地探索路径,而不是纯随机。这也是和fuzzing test最根本的区别。
2026-03-02 10:53:21
130
原创 测试工程师面对大模型应用的思考
现在有很多开源的大模型编排的框架,例如LangChain、Llamaindex、crewAI等等,那么无论面对的是一个多么奇幻的系统,对于测试工程师而言都是简单直接“大模型编排框架就是被测系统的应用架构多了一层公共部分,任何被测系统的组成部分都要进行测试,所以大模型编排框架也应该被测试。传统的测试我们关注正确或者错误的输出,但是大模型是基于概率运行的,而不是我们确定性的输出。在自动化测试的时候,借助原来自动化测试框架的能力就可以实现上述验证内容的自动化,我们只需要变换一下断言的写法。
2026-02-04 15:53:11
120
原创 模拟Clade Code的Skills机制的demo代码
GitHub:https://github.com/crisschan/mini_skills_runtime本地 Skill 执行运行时 - 完全对齐 Claude Code 的 Skills 组织方式快速开始1. 安装依赖2. 启动 Ollama(用于 LLM 功能)3. 运行 Demo基础 Demo(无 LLM)展示:展示:简单对话注意: 方法仅用于演示 LLM 基础功能,实际项目中建议直接使用 Skill 执行流程。工具调用LLM Runtime 支持工具调用。当
2026-02-02 16:12:23
309
原创 提示词工程中的上下文隔离
已经进入context的prompt是没有办法让大模型真正的忘记的,但是可以通过prompt技巧强约束模型的后续推理中“不再使用、不再提及、不再引用”某部分提示词,这其实是一种行为抑制(behavior suppression),并不是删除。
2026-01-13 16:55:20
179
原创 LangChain的Deep Agents测试的反思
langchain搭载了几个deepagent,在这些deepagent测试过程中,他们总结了如下几点经验。
2026-01-12 17:25:09
215
原创 上下文工程入门
这是Agent可以使用的工具,每一个工具都包含了名字、描述、参数和返回格式。tools的定义一般在序列化后放在系统提示词的前面或者后面。工具描述引导了agent的行为,推荐工具的描述要包含使用上下文、例子和一些默认值。
2025-12-30 17:45:36
127
原创 Claude的Skills详解
skill目录下最小集合是必须有一个SKILL.md文件,其他类似scripts/,references/,assets/等都是可选择项。在SKILL.md文件中,YAML格式的定义内容是必须存在的。---------metadata:---FieldRequiredYes最大64个字符。仅限小写字母、数字和连字符。不得以连字符开头或结尾。Yes最大1024个字符。非空字段。描述技能功能及使用场景。No许可证名称或捆绑许可证文件的引用。No最大500个字符。
2025-12-26 18:08:11
4783
原创 U+2011(Non-Breaking Hyphen)在UI测试中需要关注的问题
U+2011(Non-Breaking Hyphen,非断行连字符)是一种Unicode字符,旨在防止在连字符处自动换行,主要用于排版和文档处理中(如保持复合词如"non-breaking"在行尾不被拆分)。它与普通的ASCII hyphen-minus(U+002D,即"-“)在视觉上相似,但作为不同的码点,在实际渲染时容易引发兼容性问题。这个问题主要是因为字体支持不完整和宣言引擎的差异造成的。
2025-12-16 14:16:08
153
原创 BDD测试用例:Playwright的MCP Server实战
Playwright MCP Server建立了大模型和真实的浏览环境之间的桥梁,可以让大模型操作多款浏览器完成测试任务。
2025-12-09 17:03:05
293
原创 BDD测试用例:Playwright的MCP Server实战
使用了Claude Desktop,配置了playwright mcp server,在模型上使用的 sonnet-4.5,完成的所有的工作。
2025-12-09 14:45:49
295
原创 搭建 Newman + Postman + Git + Jenkins 环境教程
一步步搭建 Newman、Postman、Git 和 Jenkins 的环境。这些工具常用来做 API 测试和 CI/CD 自动化,尤其是 Postman 和 Newman 搭配 Git 和 Jenkins,能实现 API 集合的版本管理和自动测试。
2025-12-08 16:38:44
379
1
原创 Gherkin格式的测试用例和需求的设计
中文英文用途功能Feature描述一个功能规则Rule业务规则(可选)背景Background每个场景前都会执行场景Scenario单个测试场景场景大纲数据驱动模板例子Examples场景大纲的数据表给定Given前置条件当When触发动作那么Then预期结果并且And延续上一步(任意)但是But否定延续。
2025-12-05 17:05:13
350
原创 软件质量工程是熵减在工业过程控制领域的实现
熵(Entropy)是信息论里最核心的概念,发明人香农把它叫做“信息熵”。它其实就是衡量一个随机变量(或消息)的不确定性有多大,是系统无序或者不确定性的度量。我们可以通过平均需要多少比特来描述一个随机变量的不确定性来描述熵的大小。举个例子,假设天气预报有四种可能,分别是晴、阴、雨、雪,每种天气的概率都是25%,那么我们可以使用2个bit,也就是00、01、10、11来表示这四种平均概率的天气,因此熵就是2bit。
2025-11-19 16:02:08
225
原创 知识工程简介
知识工程(Knowledge Engineering,KE)是一门以知识为处理对象,利用人工智能原理、方法和技术,设计、构造和维护知识型系统的学科。它被视为人工智能的一个重要应用分支,旨在将人类专家的知识转化为计算机可处理的格式,从而构建能够模拟专家决策的智能系统。知识工程的概念最早于1977年提出,当时主要围绕专家系统的研究展开。专家系统是将专业领域的专家知识收集、存储并应用于问题求解的核心形式。
2025-10-24 10:09:36
465
原创 白话FNN、RNN、Attention和self-attention等
我尝试同过炸酱面的例子,让所有人都能理解Transformer的核心Self-Attention。你在做老北京炸酱面的酱,食谱包括一系列步骤:准备食材(干黄酱、甜面酱、猪肉、葱姜等)、洗菜、切菜(葱姜蒜等)、炒肉,调和干黄酱、甜面酱、凉水、酱油后,加入锅中,慢炖成酱。我们将从FNN开始讲起,最终讲到Self-Attention,每个算法将以不同的方式处理这个食谱,从简单的单步处理到复杂的全局优化,模拟从新手到大师级厨师的进化。
2025-08-27 14:58:52
363
ACIS--CAD开发类库7
2009-06-10
ACIS CAD开发类库9
2009-06-10
ACIS--CAD开发类库
2009-06-10
ACIS--CAD开发类库4
2009-06-10
ACIS CAD开发类库8
2009-06-10
ACIS--CAD开发类库6
2009-06-10
为集成LLM到测试平台提供更便捷的方式:为讯飞的LLM星火创建接入LangChain类(全部源代码)
2023-11-02
个人版强制更新破解Xshell5的nslicense.dll
2019-01-02
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅