- 博客(350)
- 资源 (1)
- 收藏
- 关注
原创 1.简单工作流智能体
能自主理解任务、拆解步骤、调用工具、执行动作、反馈结果的 AI 程序,本质是「给大模型装上了 “手脚” 和 “大脑”」,能代替人完成有逻辑的连续任务核心组成(4 个核心,记不住只记前 2 个):感知模块:接收用户的输入指令 / 文本规划模块:大模型核心,负责理解任务、拆解执行步骤执行模块:调用工具 / API,执行具体动作(比如调用大模型问答、读取文件、搜索信息)记忆模块:存储对话历史、执行记录,实现上下文理解一次调用、一次执行、直接返回结果。
2026-08-06 11:12:18
231
原创 FastAPI+FunASR实现局域网WebSocket实时语音识别 | 解决麦克风权限、10054连接重置、PyAudio硬件报错全记录
架构优化:前端拾音+后端纯服务,彻底消灭PyAudio声卡硬件报错;权限最优解:Hosts配置.local内网域名,不用给所有访客安装证书、修改浏览器配置;协议严格区分:http对应ws,https对应wss,避免二进制音频被浏览器拦截;完善异常捕获,解决Windows套接字10054强制断开警告;增加静音自动清空字幕逻辑,大幅提升流式识别体验。
2026-07-01 14:44:36
478
原创 10.最简 RAG 雏形完成
PDF 知识库→大模型生成精准回答」的完整闭环。你可以把它理解成「RAG 的 Hello World」,所有复杂的企业级 RAG系统,都是在这个最简雏形的基础上扩展来的。最简 RAG 雏形,就是去掉所有复杂的工程化封装、冗余代码,只保留 RAG 最核心的 7 步逻辑,用最少的代码,实现「用户提问→基于你的。
2026-06-24 11:21:56
175
原创 7.faiss-cpu向量库安装
之前 给每个文本块生成了对应的向量,现在需要把这些「文本 +向量」对存起来,当用户提问时,能在几毫秒内从成千上万的向量里,找到和用户问题向量最像的前几个文本块 ——faiss 就是专门干这个的,是 RAG 系统能实现精准、快速检索的核心底层引擎。激活成功后,你会看到终端最前面的前缀,从(base)变成了(D:\RAG-Learning-Project\env\rag-env),说明已经成功进入其他盘的虚拟环境了。,你可以把它理解成「RAG 系统的智能向量储物柜 + 超快检索引擎」。
2026-06-16 16:54:27
267
原创 6.文本转向量
文本转向量是 RAG 项目的核心环节,承上启下,连接文本分块和向量库搭建,是 RAG 系统能精准检索的底层基础企业级 RAG 项目中,文本转向量必须是工程化、可复用、可批量处理的,不能是零散的单文本调用向量化结果必须标准化,包含完整的元数据(文本内容、ID、长度、生成时间)和向量信息,可直接用于向量库搭建中文 RAG 场景,通义向量模型是企业级项目的主流选型,中文语义理解能力强,长文本支持好,云端 API 调用稳定,无部署成本。
2026-06-16 15:09:25
216
原创 5.通义向量模型调用
通义向量模型是阿里云通义千问团队推出的、专门针对中文语义优化的文本向量模型,是国内企业级 RAG 项目的主流选型之一,你可以把它理解成「中文语义理解能力拉满的国产向量生成工具」。通义向量模型的核心作用也是:把中文文本转换成代表语义的固定长度数字向量,实现「语义越像、向量越近」的精准匹配,是 RAG 系统精准检索的核心底层技术。原因:你后面用的 cosine_similarity 相似度计算函数,一维数组直接丢进去,程序识别不了,就会报错。,不接收一维数组,不加这行代码会直接报错。
2026-06-12 11:10:21
280
原创 4.向量概念通俗理解
embedding 向量 = 文本的「智能语义身份证」,也叫「语义数字指纹」。**我们人能看懂中文、能理解一句话的意思,但计算机完全看不懂中文,它只认识数字embedding 向量,就是把一句中文文本,转换成一串有固定长度的数字,这串数字不是随便编的,它完全代表了这句话的「语义意思」语义越相似的两句话,它们对应的 embedding 向量(数字串)就越像;语义完全无关的两句话,向量就完全不一样。
2026-06-10 10:08:55
199
原创 2.PDF长文档完整读取
RAG = 给大模型(比如 ChatGPT、豆包、开源大模型)外挂了一个你自己的私有知识库,让大模型能精准、无差错地回答你私有数据里的内容,不会瞎编、不会用过时的知识。大模型是一个超级会说话、会总结的「秘书」,但她的知识是固定的、过时的,而且完全不知道你电脑里的 PDF、文档、笔记这些私有内容RAG 就是你给这个秘书配的一个专属智能文件柜 + 精准检索神器,你把自己的所有文档、PDF、笔记都放进这个柜子里,秘书回答问题前,会先去这个柜子里精准找到对应的内容,再基于这些内容给你回答,绝对不会瞎编。
2026-06-04 15:51:21
296
原创 5.封装对话函数,实现多轮对话
就是把重复使用的代码打包,像一个工具。以后想调用 AI,直接用工具,不用再写几十行代码。你:1+1 等于几AI:等于 2你:再加 3 等于几AI:等于 5这就是多轮对话,AI记住了历史内容。
2026-05-29 10:20:09
53
原创 4.大模型 API 核心参数与可复用对话代码 零基础逐点精讲
这些参数不是必须填的,但是学会了之后,你就能像「遥控器」一样,精准控制大模型的回复,让它完全按你的要求来,这是从「会调用」到「会用好」的关键。大白话含义:就像你和大模型的微信聊天框,里面的每一条消息,都要告诉大模型「是谁发的、发了什么内容」,大模型会根据完整的聊天记录来回复你。大白话含义:就像你给大模型定的「停止信号」,只要大模型的回复里出现了你设置的这个词,就会立刻闭嘴,不再继续说下去,精准控制回复的长度。user:用户,也就是你发的问题、指令,所有你要问大模型的内容,都用这个角色。
2026-05-26 15:20:38
325
原创 3.requests 库基础 零基础逐点精讲(AI API 调用核心工具)
所有 AI 大模型的 API 调用,不管是通义千问、ChatGPT、豆包,还是其他任何 AI 模型,底层都是用 requests 库来实现「发问题、收答案」的,这是 AI 行业最通用、最核心的基础技能,没有之一。大白话版:requests 就是 Python 里专门用来「让你的电脑和互联网服务器对话」的工具,相当于你电脑里的「微信 / 外卖 APP」。互联网上的服务器(比如通义千问的大模型服务器、百度的服务器)= 饭店 / 你的朋友。requests 库 = 你的手机微信 / 外卖 APP。
2026-05-26 14:31:44
215
原创 2.认识 API 密钥、Python 环境配置 零基础逐点精讲
之前给你说过,大模型 API 是官方给你开的「专属后门」,那apiKey就是这个后门的唯一门禁卡 + 身份证,而且是「一卡通用」,不用再分开输账号和密码,新手用起来更简单。额度统计:你每调用一次大模型,服务器就会根据这个apiKey,统计你用了多少免费额度,不会扣错、也不会让你超用,完全透明。权限隔离:这个apiKey只属于你一个人,别人没有这个卡,就进不了这个后门,用不了你的免费额度,也不会给你带来任何风险。以后你写的代码多了,每个文件都要复制一遍密钥,不仅麻烦,还很容易写错、复制漏;
2026-05-26 14:20:23
76
原创 7.关键词简单提取
1.简单关键词提取逻辑:清洗 → 分词 → 过滤 → 词频统计 → 取高频前几个。3.一行调用就能自动提取,以后做文本摘要必备。2.词频最高的词,就是文章核心关键词。
2026-05-18 11:51:29
42
原创 5.简单词频排序
word_count.items():把 {词:次数} 变成 [(“词 1”, 次数 1), (“词 2”, 次数 2)]key=lambda x:x[1]:排序依据选第二个值(就是出现次数)reverse=True:倒序,多的排前面,少的排后面。不用深究原理,直接背下来当固定模板用就行。
2026-05-15 14:16:16
31
原创 4.分词遍历 + 统计词频的练习
自定义词 + 分词 + 过滤 + 遍历 + 词频,是传统 NLP 标配全套流程。词频统计两种:手写 for 循环(懂原理)、Counter(干活用)分词遍历:用 for word in 分词列表 挨个取出词语。过滤三条件:不在停用词 + len>1 + 不是数字。知识点总结(背这 4 句就够)
2026-05-15 11:21:00
38
原创 3.jieba 自定义词语添加
词多就用 jieba.load_userdict(“词典文件.txt”) 批量加载。jieba.add_word(“词语”) 临时加单个自定义词。jieba 默认普通词没问题,专业词、新词、品牌名容易拆错。
2026-05-15 10:54:48
41
原创 18.总结:txt、csv、json三种文件的读写对比
存储班级成绩、商品列表、词频统计结果、批量结构化数据,NLP数据处理最常用。基于键值对的结构化格式,支持嵌套、数组,是前后端数据交互的通用格式。存储单条/多条数据的属性、配置信息、API返回结果、复杂嵌套数据。用英文逗号分隔的结构化表格格式,行列固定,纯文本存储。纯文本格式,无任何结构化规则,仅按行/字符存储内容。存储无固定结构的长文本、日记、单篇文章、简单日志。Python 内置 json 库,无需额外安装。Python 内置 csv 库,无需额外安装。
2026-05-12 15:53:08
316
原创 16.csv 表格简单读写
只要你用 csv.writer 对 CSV 文件做写入 / 追加数据的操作,不管是用 writerow 还是 writerows,必须给 open() 函数加上这个参数,一个都不能漏。只要是用 csv.writer 写入 / 追加 CSV 文件,必须给 open() 函数加上这个参数,和 encoding=“utf-8” 是固定搭配,记死就不会再出问题。只有你用 csv.reader 读取 CSV 文件的时候,不用加这个参数,因为 csv.reader 会自动处理所有换行符,不会出现空行问题。
2026-05-11 15:46:11
165
原创 8.代码复用写法
class 父类名:def __init__(self, 通用参数):# 通用的初始化代码self.通用属性 = 通用参数def 通用方法1(self, 参数):# 通用的功能代码return 处理结果def 通用方法2(self, 参数):# 通用的功能代码return 处理结果class 子类名(父类名):def __init__(self, 通用参数, 子类特殊参数):# 先调用父类的初始化方法,继承父类的所有属性super().__init__(通用参数)
2026-04-23 15:57:38
189
MATLAB实战指南:从基础到信号处理案例.md
2025-06-23
Kotlin实战精要:现代开发的高效之道.md
2025-06-23
Rust 语言实战:安全、并发与高效开发指南.md
2025-06-23
Swift语言实战精要:现代开发技巧与原创案例.md
2025-06-23
C++语言精要:高效编程的核心技术与实战案例.md
2025-06-23
汇编语言探秘:直击机器核心的编程艺术.md
2025-06-23
Go语言极速上手:高并发与工程化实战指南.md
2025-06-23
TypeScript 类型体操进阶.md
2025-06-23
大数据基石:数据采集的技术架构与工程实践.md
2025-06-23
MySQL从入门到面试求生(附通关秘籍).md
2025-06-18
计算机二级考试心得攻略:过来人的大实话.md
2025-06-18
【编程语言领域】Python安装与初步使用教程:从零基础到运行首个程序的详细指引
2025-06-17
【Linux系统运维】常用命令精讲:从零基础到高手的实战指南与技巧汇总
2025-06-17
轻松搞定!VSCode配置C-C++开发环境指南(Windows版).md
2025-06-17
一学就会!Anaconda 安装图文教程(Windows-macOS-Linux 通用).md
2025-06-17
DeepSeek 本地部署教程.md
2025-06-17
paho-mqtt压缩包.zip
2025-05-30
mongodb安装程序msi版本.zip
2025-05-15
微信小程序实战项目开发完整教程(新手零基础落地版).pdf
2026-06-17
决胜ACM:团队协作、策略选择与赛场避雷的核心要素.md
2025-07-29
新手必看!零基础详细图文教程:VMware虚拟机安装与初体验.md
2025-07-29
美赛制胜:建模精髓与实战策略深度解析.md
2025-06-23
机器人开发实战指南:从理论到落地的关键路径.md
2025-06-23
单片机开发实战:从环境搭建到温湿度监测案例.md
2025-06-23
大学生创新创业训练计划:从实验室到田野的智慧农业物联网实战.md
2025-06-23
硬件开发实战:高效上传传感器数据至云端.md
2025-06-23
蓝桥杯竞赛:培养信息技术精英的实战舞台.md
2025-06-23
毕业设计终极上传指南:避开陷阱,赢得导师赞赏.md
2025-06-23
计算机编程期末作业:Python学生成绩管理系统实现.md
2025-06-23
YOLOv8 数据集构建:核心要素与实战解析.md
2025-06-23
Python爬虫核心技术解析:从请求到数据存储.md
2025-06-23
PHP实战精要:高效开发技巧与避坑指南.md
2025-06-23
C#核心编程实战:面向对象精髓与文件处理案例.md
2025-06-23
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅