- 博客(16)
- 收藏
- 关注
原创 RAG文档切分怎么选按字数标题还是语义
图:切分策略需要根据文档结构、问题粒度和检索测试结果组合选择RAG效果不好时,文档切分往往是最先被调整的参数之一。把块从500字改成800字,有时会变好,有时反而让无关内容更多。原因是切分没有统一最优值,它取决于文档结构、用户问题粒度和后续检索方式。
2026-08-21 16:20:09
229
原创 RAG知识库POC测试集怎么设计
这种方法适合演示,不适合验收:问题会变化,判断依赖感觉,也无法比较不同切分、Embedding、重排或提示词版本。一套好的企业知识库验收测试,不追求所有问题都得到回答,而是要求系统在有依据时答得准确、依据不足时知道拒绝、无权限时不能泄露,并且每个重要结论都能回到原文。POC期间发现的新问题,不应只修一次。先判断失败属于解析、切分、召回、重排、提示词、权限还是资料本身,再把问题和期望行为加入回归测试集。每道题应至少包含:问题文本、期望结论、权威来源、允许引用的片段、适用用户、是否应该拒答,以及评分说明。
2026-08-20 17:40:40
225
原创 Prompt评测与发布流程怎么做?
校验模板变量、Schema、长度、转义和输出格式,再运行离线对比。权限、敏感数据和工具审批必须由后端实施,不能把安全控制全部写进Prompt。企业AI大脑若直接在线改文本,短期可能修好一个问题,却无法确认其他场景是否退化。业务人员看事实与口径,技术人员看结构和性能,安全人员看红线。准备正常、无答案、冲突、越权和提示注入样本,区分调试集与保留集。每条题记录期望证据、允许行为和红线,不只比较语言相似度。小流量观察质量、延迟、成本和失败样本,再扩大。每次请求记录版本,出现红线立即回滚,并把线上失败加入回归集。
2026-08-18 15:51:25
182
原创 企业AI大脑项目该由谁负责?
制度内容错误交给资料与业务确认,引用不准交给知识和技术共同排查,越权访问立即由安全与技术处理,流程写入失败由系统负责人恢复。业务负责人对“为什么做、解决谁的什么任务、哪些结果可以采用”负责,并给出真实问题、当前基线和验收门槛。若所有人都能否决却没人最终负责,范围也会长期停滞。技术团队负责解析、索引、检索、模型、权限、接口、日志、发布和回退,确保错误能够被定位。服务商负责约定范围内的实现和文档,企业IT负责账号、网络和现有系统配合。技术人员应把故障分成内容错、检索错、生成错、权限错和接口错,并提供可读记录;
2026-08-18 11:21:12
233
原创 LLM应用可观测性要监控什么?
为请求分配Trace ID,记录模型与Prompt版本、知识版本、权限策略、召回与重排、工具调用和最终状态。监控首Token时间、总延迟、超时、Token、模型路由、缓存命中和每任务成本。Agent看参数校验、审批、执行与回退。摘要:从请求Trace、质量、性能、成本、安全和反馈六个维度,整理企业LLM应用可观测性的核心监控内容。关键词:LLM可观测性、企业AI大脑、RAG监控、AI Agent、应用监控。
2026-08-17 15:58:02
204
原创 企业RAG知识更新流水线怎么设计?
企业RAG进入生产后,文档会新增、修改、撤回,权限也会变化。更新流水线应把原文、切分、索引和评测版本统一关联。保留高频题、无答案题、冲突题和越权题,检查Recall、排名、引用、拒答与延迟。记录文档ID、业务负责人、版本、生效时间、适用范围和权限标签,计算内容哈希识别重复。每个Chunk保存原文位置、解析器版本、切分策略和父文档版本。权限收紧时,检索层和原文层都要生效。日志记录发布者、版本、测试结果和切换时间。可回退、可审计,才是生产级更新。把新版本写入独立索引,运行完整性、权限和检索测试后再切换别名。
2026-08-17 11:24:54
156
原创 企业AI大脑是什么?四层结构讲清楚
实际上,企业AI大脑是什么、企业AI大脑能做什么,关键不在对话界面,而在于它能否连接企业知识、业务系统、工作流程和人员权限。相对需要注意的是,前期资料整理、权限配置和流程确认需要企业内部人员参与,会增加一定的准备工作,但也有助于降低后续答非所问或权限混乱的风险。比如,面对客户咨询时,模型负责理解问题,知识库提供产品信息,业务规则判断服务范围,工具则负责生成记录或提醒相关人员。简单来说,它的价值不只是“说得像人”,而是理解企业资料、遵守企业规则,并在可核验、可控制的前提下帮助员工完成工作。
2026-08-14 15:36:16
212
原创 企业RAG评测集怎么建?从50题开始
评测报告同时展示总体和分类型结果,避免标准问题高分掩盖未知、冲突或权限问题。记录Recall@K、正确证据排名、答案有据率、引用准确、拒答、越权、延迟和成本。50个经过业务确认的问题,已经能暴露切分、召回、版本和权限问题。同一意图用简称、错别字、倒装或上下文省略表达,检查Embedding和查询改写是否稳定。使用不同角色运行同一问题,检查检索候选、最终引用、缓存和日志。从搜索日志、客服记录或员工访谈中抽取真实问法,标注正确文档、章节和关键条件。图:开发者应同时观察检索、答案、权限、延迟与成本。
2026-08-14 10:51:02
229
原创 从零搭建企业AI大脑:RAG到Agent
先让一条链路稳定,再扩展更多场景,比同时接入多个模型和系统更容易定位问题,也能避免一次改动影响多个环节却找不到原因。先定义用户、资料范围、期望答案和风险边界,再写代码。至少统计证据命中、答案有据率、拒答、越权、延迟和调用成本。企业AI大脑的优势是能把知识与动作连起来,限制是工程链路更长、维护工作更多,因此每增加一个能力,都要增加对应测试。保留标题、章节、页码、版本和权限元数据。日志记录请求、证据、模型版本、工具参数和结果,同时控制敏感内容暴露。涉及发送、写入和删除时,增加审批、幂等和回退。
2026-08-13 16:48:13
190
原创 RAG检索效果差?7个常见问题排查
更有效的做法,是先记录查询改写、召回候选、相似度、过滤条件、重排结果和最终上下文。从“原文是否正确入库”开始,依次看切分、Embedding、混合召回、过滤、Top-K、重排、上下文和生成。RAG是完整链路,只有让每一步可观察、可复现、可评测,才能稳定迭代。应根据文档结构切分,并保留标题、章节、页码等元数据。部门、时间、版本和权限过滤如果字段缺失或类型不一致,正确片段可能在相似度计算前就被排除。建立包含问题、期望证据和可接受答案的评测集,分别统计召回命中、排序位置、答案有据率、延迟和成本。
2026-08-11 17:06:11
162
原创 向量数据库到底存了什么?从Embedding到相似度检索讲清RAG底层
当RAG答错,第一步应打印检索候选、相似度、元数据和实际送入模型的上下文。向量数据库是检索基础设施,只有放进可观察、可评测的链路中,才能真正服务RAG。含义接近的文本通常在向量空间中距离更近,因此“怎样申请休假”和“请假流程是什么”即使关键词不同,也可能被匹配。迁移前应保留固定问题集,对比正确片段的召回率、排序位置、延迟和成本,而不是只看数据库是否成功写入。在RAG系统里,向量数据库常被描述成“让AI拥有私有知识”,但它的职责更具体:保存文本片段的向量表示,并根据相似度快速找到候选。
2026-08-10 10:48:16
168
原创 服务案例复盘:从零搭建技术支持RAG知识库,先把检索链路做可观察
流程只保留文档解析、分段、Embedding、向量检索、可选重排和生成六个环节。每次请求都记录文档版本、召回片段、分数、最终引用、延迟和异常。目标是为技术支持人员提供内部问答辅助:输入故障现象后,系统检索操作手册、版本说明和历史解决记录,生成带引用的处理建议。分别评估检索是否召回依据、引用是否匹配结论、生成是否超出来源、无答案时能否拒答。支持人员可对答案标记“有用、缺资料、引用错误或越界”,反馈进入待处理队列。最小链路、真实评测、分层排错、版本管理和人工确认,才决定RAG能否从Demo走向日常服务。
2026-08-07 11:58:15
215
原创 RAG方案选型对比:全托管、本地开源还是混合架构
更合理的顺序是先确定数据敏感度、上线时间、团队运维能力、预期规模和退出路径,再决定使用全托管服务、本地开源栈或混合架构。自建解析器、Embedding服务、向量库和模型网关,可以定制切分、权限、索引与部署位置,适合敏感数据和深度优化。托管方案通常集成文档解析、Embedding、向量索引、检索和监控,适合个人项目、原型和小团队。无论哪条路线,都要能查看解析结果、Chunk、召回片段、分数、引用、延迟和成本。混合方案兼顾开发速度与控制,但需要统一身份、网络、密钥、日志和降级,链路调试也更复杂。
2026-08-06 11:04:44
164
原创 普通人怎样把AI用进工作?一套可以直接照做的5步流程
下面这套五步流程,不需要复杂技巧,适合用于整理资料、写邮件、做提纲和比较方案。把与任务直接相关的笔记、事实和格式要求放在一起,删除姓名、电话、客户数据等敏感内容。资料不完整时,可以先让它列出缺少的信息,再决定是否补充,而不是让模型自行猜测。先从每周都会重复、结果容易检查的工作开始,例如把会议记录整理成待办、将长文提炼成要点、根据已有资料写邮件初稿。按“任务目标、输入资料、限制条件、输出格式、核验方法”组织请求。找一段不含隐私的会议记录,用两分钟写清目标和格式,三分钟让AI整理,五分钟对照原文核验。
2026-08-05 09:49:06
163
原创 大模型应用开发避坑:别把所有问题都归咎于Prompt
开发大模型应用时,最容易形成一种排错惯性:输出不理想,就继续改Prompt。原因是一个LLM请求通常经过文档解析、检索、上下文组装、模型生成、工具调用和结果校验,任何一层都可能出错。至少要关联请求ID、模型与Prompt版本、检索结果、工具调用、Token、延迟和异常原因,并对敏感字段脱敏。回答错误可能是没有召回、召回了错误版本,也可能是模型忽略证据。可靠的大模型应用依赖干净数据、可控权限、分层评测和全链路观测。先让问题可复现、可定位、可回归,再谈框架和Agent能力,工程效率会高得多。
2026-08-04 10:26:32
216
原创 AI应用开发入门:从模型、Prompt到RAG与Agent的技术栈全景
当应用需要查询订单、执行计算或调用内部服务时,可以把受控函数描述给模型,由模型选择工具和参数。一条典型链路可以概括为:用户请求进入后端,系统补充Prompt与检索资料,模型按需调用工具,结果经过校验后返回前端,同时写入监控和评测系统。选型时不应只比较榜单分数,还要关注上下文长度、结构化输出、工具调用、多模态能力、响应延迟、单次成本和数据合规。检索增强生成通常包括文档清洗、切分、向量化、索引、召回、重排和生成。一个能进入生产环境的系统,至少要把模型能力、业务数据、工具接口和传统软件架构组合起来。
2026-08-03 14:12:02
307
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅