自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(24)
  • 收藏
  • 关注

原创 从 0 到 1 搭建 AI Agent 自动化测试体系:评测集、断言、回归怎么设计

本文分享测试团队构建AI Agent持续评测体系的实战方法,聚焦“评测集、断言、回归”三核心。通过分层设计(回答、过程、底线)构建20条核心题库,逐步扩展为冒烟、回归、对抗三类题集;采用规则断言+大模型评分+人工抽检组合判断,提升准确性;强调多次运行、对比变化、动态门禁,实现改动后快速验证与风险预警。建议按4周节奏落地,从零搭建可迭代的Agent质量保障体系。

2026-09-24 11:26:34 358

原创 大模型输出不确定,测试用例的预期结果该怎么写?

面对大模型输出不确定性,测试用例应从“对答案”转向“查得分点”。核心思路是:事实写死、表达放开、关键场景多轮验证。通过拆解预期为“必须包含要点”“禁止内容”“行为要求”“格式约束”“评分标准”及“通过率”等维度,实现可执行、可复现的测试。结合实际场景灵活组合使用,既能避免“回答正确”类模糊表述,又能精准定位问题,提升AI产品测试效率与质量。

2026-09-24 11:25:20 227

原创 LLM 应用测试的 10 个坑:幻觉、提示词注入、多轮上下文丢失

测大模型应用和测传统软件,最大的区别不在工具,而在于你要面对的问题类型完全变了。传统软件的 bug 大多是「代码写错了」,行为是固定的,复现一次就能定位;大模型应用的问题更像「一个聪明但偶尔犯迷糊的新员工」,大部分时候表现不错,但会在一些意想不到的地方出岔子。这篇文章整理了测试 LLM 应用时最常见的 10 类问题。每一类都会讲清楚:它是什么、为什么会出现、怎么设计测试用例去发现它。你可以把这篇当成一份测试清单来用。

2026-09-24 11:23:51 184

原创 怎么给一个测试团队设计一整套 Skill 生态

摘要 本文探讨如何设计一套有效的Skill生态,而非简单堆砌独立功能。作者将测试团队的Skill按测试生命周期划分为需求分析、用例设计、缺陷处理等十余个环节,并构建三层架构:基础设施层(如统一文档样式)、原子能力层(单一职责的独立Skill)和编排层(流程串联)。核心原则包括:严格分层实现高内聚低耦合、原子Skill保持单一职责与清晰边界、通过契约对齐实现Skill组合、编排层遵循Unix哲学保持"薄"逻辑。全生态贯彻两条纪律:确定性工作归脚本/语义工作归LLM,以及保持产出一致性。建议采用渐进式建设路径,

2026-07-21 16:31:09 104

原创 功能测试如何将AI工具用起来

这篇文章是一份面向非技术背景功能测试人员的Claude Code使用指南,核心观点是无需编程基础也能利用该工具提升工作效率。文章首先澄清了常见误解,强调Claude Code区别于普通AI聊天的核心价值在于能直接处理文件和生成交付物,而非仅提供文字建议。通过具体场景展示了工具的实用价值,包括将需求文档转化为结构化测试用例、生成规范bug单、制作测试报告等典型工作场景。提供了从安装到使用的完整指引,包含可直接套用的对话模板和实战案例(如需求文档转Excel测试用例的全过程)。最后客观指出工具的局限性,强调AI

2026-07-21 16:19:20 238

原创 怎么写一个真正好用的 AI agent Skill

本文探讨如何编写高效的AI技能(Skill),强调Skill不仅是存储的提示(Prompt),而是模型可复用的一项能力。文章分为六个部分:首先解析Skill的三层加载机制(元数据、正文、附带资源),强调description的关键作用;其次详细讲解正文应作为操作手册而非产品介绍;第三部分指导如何合理分配内容至正文、脚本和参考资料;第四部分提出测试与迭代的重要性;最后列举常见误区,如欠触发、内容冗余等。核心观点包括:Skill设计需精准触发、内容分层、流程清晰、边界明确,并通过测试持续优化,而非单纯堆砌内容。

2026-07-21 16:03:56 320

原创 需求分析-生成用例skill

如何编写qa的skill

2026-07-21 15:55:03 571

原创 Claude Code + Playwright MCP 使用

本文介绍了Claude Code与Playwright MCP工具的集成方案,主要包含以下内容: 组件介绍:Claude Code是终端AI编码代理,Playwright MCP提供浏览器控制能力,二者结合可实现自然语言驱动浏览器测试。 适用场景:包括自助QA、探索式测试、不稳定用例复现、自动化用例生成和CI流水线集成等。 工作原理:基于三层架构(推理层、协议层、执行层),通过无障碍树交互和全本地执行保证效率与安全。 安装配置:详细说明了环境准备、MCP注册、范围控制和验证步骤,支持个人和团队使用场景。 测

2026-06-09 18:58:48 678

原创 LangChain+Python实现登录脚本智能生成

本文介绍了一套基于LangChain和Python的零门槛智能工具,可在10分钟内生成可直接运行的登录接口自动化脚本。该工具采用轻量级技术栈(LangChain、Python3.8+、Requests等),支持单接口测试和token关联,具有配置化操作(通过YAML文件配置)、隐私安全(本地执行)、扩展性强等特点。项目结构清晰,只需修改配置文件即可使用,提供完整的提示词模板和核心代码,无需编写核心逻辑即可生成标准化Pytest脚本。操作步骤包括安装依赖、配置YAML文件、运行主程序三个简单环节,适合新手快速

2026-03-23 18:21:57 380

原创 Dify 工作流新手教程(超详细·新手必看)

本文介绍了在Dify平台搭建AI问答工作流的完整流程:1)首先配置大模型API(如DeepSeek、GPT等),测试连接成功;2)创建Chatflow应用,在工作流画布中依次添加"开始"节点(接收用户输入)、LLM节点(配置模型和提示词)和"结束"节点(输出回答);3)调试运行后发布使用。文中特别提醒了三个常见问题:模型未配置、变量格式错误和节点未连线。该教程适合新手快速搭建基础问答助手,支持后续嵌入网站或API调用。(149字)

2026-03-17 18:38:25 2536

原创 linux服务器Docker容器中部署Dify

本文详细介绍了在CentOS 7系统上使用Docker Compose部署Dify AI平台的完整流程。内容包括:Docker环境准备、部署目录创建、官方配置下载、核心参数修改(端口、数据库密码、密钥等)、容器启动与状态检查、初始化管理员账号等关键步骤。特别针对国内用户提供了镜像源优化方案,并附带了常见问题(如网络冲突、镜像拉取失败)的解决方法。通过清晰的命令行示例和配置说明,帮助用户快速完成Dify的部署与验证。

2026-01-27 16:02:24 1225

原创 Linux服务器安装Docker(CentOS系统)

本文档提供了CentOS系统下Docker标准化部署流程,重点解决Docker默认网关与服务器网关冲突问题。适用于CentOS 7/8/9系统,详细说明了从清理旧版本、安装Docker Engine到修改daemon.json配置文件的全过程。核心内容包括自定义Docker桥接网关网段、配置国内镜像源加速,以及启动验证和常见问题排查方法。通过调整bip参数和default-address-pools设置,有效规避网络冲突,确保Docker网络功能正常。文档还提供了安装验证步骤和格式检查方法,帮助用户快速完成

2026-01-27 15:56:53 1061

原创 MCP + Cherry Studio 实战:MySQL MCP 服务搭建与应用(本地部署)

本地部署MySQL MCP服务指南 本文详细介绍了本地部署MySQL MCP服务的完整流程,包含四大核心部分: 本地部署优势:数据零泄露、断网可用、高效调试、全系统适配; 环境准备:需安装MySQL、Python 3.10+等工具,并配置本地测试数据库; 服务搭建:通过虚拟环境安装依赖,编写Python脚本实现本地连接,配置.env文件存储敏感信息; Cherry Studio对接:通过STDIO协议连接本地服务,实现自然语言操作数据库。 整个流程严格限定127.0.0.1访问,确保数据安全,适合企业内网环

2026-01-15 10:00:49 1924 2

原创 Apifox CLI + Claude Skills 接口自动化项目搭建全流程(附代码Demo+CI/CD接入)

本项目实现基于Apifox和Claude的接口自动化测试方案,核心价值包括:自动化生成测试脚本、接口变更自适应、全流程嵌入研发、可视化报告告警。主要流程为:研发提交代码触发CI/CD→导出最新接口文档→生成测试脚本→运行测试→推送报告。环境准备需安装Node.js、Apifox CLI等工具,并配置API密钥。项目结构清晰,包含配置、技能脚本、执行脚本等模块。核心功能通过Claude Skills实现,读取OpenAPI文档生成包含正反例的Postman测试脚本,支持参数校验和响应断言,输出符合规范的JSO

2026-01-14 10:10:48 1980

原创 AI驱动UI自动化框架Maestro:从环境搭建到实战Demo

Maestro是一款AI增强的安卓UI自动化测试框架,相比传统工具具有显著优势。它通过AI智能识别控件、动态容错机制和极简YAML语法,解决了传统工具依赖固定定位符和手动延迟管理的问题。环境搭建简单,支持多平台部署。核心功能包括自然语言控件定位、自动等待机制和AI视觉验证,大幅提升测试稳定性和效率。实战演示了淘宝App搜索流程自动化,展示如何利用AI特性完成复杂交互和断言。该框架可降低70%维护成本,稳定性提升至98%,是安卓自动化测试的理想选择。

2026-01-12 17:39:00 1964 11

原创 AI驱动UI自动化框架Midscene完全指南:安卓自动化从入门到实战

Midscene是一款AI驱动的UI自动化框架,通过自然语言脚本大幅降低自动化门槛。它结合视觉识别与DOM分析精准定位元素,支持Web和安卓自动化,提供YAML/TS脚本编写方式。核心优势包括低门槛、高精度和多场景覆盖,推荐优先使用专为UI设计的UI-TARS模型。环境配置需安装Node.js、Midscene CLI和ADB(安卓场景)。脚本编写需优化定位描述、合理选择操作指令并添加断言验证。常见问题包括元素定位失败和模型调用错误,可通过优化描述和检查配置解决。适用于常规业务流程自动化,但不适合高频性能测

2026-01-09 14:29:03 3020

原创 Windows 环境下 JMeter 可视化平台搭建(InfluxDB + Grafana 实时图表监控)

本文介绍搭建JMeter+InfluxDB+Grafana性能监控平台的详细步骤。通过将JMeter压测数据实时存储到时序数据库InfluxDB,再利用Grafana进行可视化展示,解决了JMeter自带监听器在高并发场景下的卡顿问题。文章包含环境准备、InfluxDB安装配置、JMeter数据推送设置、Grafana仪表盘创建等完整流程,并提供了常用性能指标的查询语句模板。该方案可实现响应时间、吞吐量、错误率等关键指标的实时监控,帮助测试人员快速构建可视化性能监控系统。

2026-01-08 16:56:17 861

原创 SonarQube 9.9 LTS 实战:Linux(CentOS)完整安装教程

本文详细介绍了在CentOS/RHEL系统上部署SonarQube代码质量检测工具的完整流程。主要内容包括:系统准备(Java 11+、PostgreSQL 10+等环境要求)、PostgreSQL数据库安装配置、SonarQube 9.9 LTS版本的下载安装、目录权限设置、核心配置文件修改、系统资源限制调整以及服务启动测试。最后提供了将SonarQube配置为systemd系统服务的方法,支持开机自启和状态监控。全文步骤清晰,包含关键命令和配置示例,适合运维和开发人员快速搭建代码质量管理平台。

2026-01-08 16:47:44 1415 1

原创 火山引擎 UI-TARS 大模型:开通流程与在线推理接入指南

本文详细介绍了在火山引擎平台开通UI-TARS大模型服务的完整流程。首先需要完成账号注册、实名认证及权限开通等前置准备。主要步骤包括:登录控制台进入大模型菜单,搜索并开通UI-TARS模型(个人账号有每日1000次免费调用额度),创建API访问凭证(需妥善保存Key信息),以及获取模型Endpoint和专属Model ID等关键配置参数。整个过程配有详细操作指引和界面截图,为后续Midscene框架集成提供必要准备。企业账号可选择付费版本获取更高调用额度。

2026-01-07 18:17:13 1594 2

原创 Jenkins 在 Linux 服务器的安装、配置与最佳实践

本文详细介绍了在CentOS/RHEL系统上安装Jenkins的完整步骤。主要内容包括:准备工作(服务器配置、SSH工具使用)、通过Xshell连接Linux服务器、添加Jenkins软件源、安装Java环境、Jenkins安装与配置、开放8080端口以及通过浏览器访问Jenkins界面。文中特别强调了新手易错点,如初始密码获取、服务启动检查等,并提供了常见问题的解决方法。按照本文提供的step-by-step指南,即使是初学者也能顺利完成Jenkins的安装和基础配置,为后续的自动化构建和部署工作做好准备

2026-01-07 15:56:01 2010

原创 深度解析 Appium 高频问题:原因分析 + 解决方案 + 预防技巧

本文总结了Appium自动化测试中常见问题及解决方案,涵盖环境配置、设备连接、元素操作等场景。针对驱动缺失、iOS工具链安装、端口冲突、App崩溃等典型问题,提供了分步解决指南。对于元素定位失效、WebView切换等难点,给出了多种技术方案,包括强制点击、iframe切换等实用技巧。同时强调日志分析和分层验证的重要性,建议通过调试日志和设备日志精准定位问题根源。文末推荐维护环境配置清单以避免版本兼容性问题,为Appium测试提供了系统化的问题解决框架。

2026-01-06 17:03:53 712

原创 基于Appium+pytest+Allure的App UI自动化测试框架实战(含完整项目架构与落地指南)

本文详细介绍了一套基于Appium+pytest+Python+Allure的App UI自动化测试框架,包含完整的技术栈选型、项目架构设计和环境配置步骤。框架采用POM设计模式实现页面元素与操作封装,支持数据驱动测试,通过配置文件管理测试参数,具备高可维护性和易扩展性。环境搭建部分详细说明了Python、Appium、Java/Android SDK等核心工具的安装配置流程,并提供了项目依赖清单。该框架可直接应用于Android平台应用测试,显著提升回归测试效率和版本迭代质量。

2026-01-06 10:58:48 1944

原创 AI赋能软件测试:全流程智能化提效实践指南(2025进阶版)

随着软件研发敏捷化与复杂化,测试工程师面临高频迭代与质量保障的双重挑战。AI技术正突破传统测试瓶颈,推动测试向智能化升级。本文系统解析AI在测试全流程的应用场景,包括智能用例生成、测试数据构造、自动化脚本开发、缺陷诊断及报告生成等,提供前沿工具与实战案例。AI通过数据驱动决策、自动化复杂任务,实现测试从被动执行到主动预判的转变,提升效率40%以上。未来测试工程师需掌握AI工具,聚焦质量架构与智能设计,通过人机协同实现高效精准的测试体系,成为研发体系中的核心质量保障者。

2025-12-31 17:20:14 2638 1

原创 基于 Coze(扣子)平台的智能体搭建指南及核心用途

Coze是字节跳动推出的AI应用开发平台,支持零代码/低代码构建智能体。智能体具备自主决策与任务执行能力,架构涵盖交互层、大模型决策层及功能操作层,适用于三大场景:1)生活陪伴(行程规划、情感互动);2)办公提效(文档生成、数据分析);3)垂直领域(金融、翻译、自媒体等)。通过Coze平台,用户可快速配置插件、知识库、数据库等功能模块,利用可视化工作流编排复杂任务,测试优化后发布至社交平台或集成到业务系统。平台优势包括低门槛开发、强扩展性及多端部署能力,赋能个人与企业高效打造AI应用。

2025-12-31 17:11:26 1931

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除