- 博客(6)
- 收藏
- 关注
原创 自己动手微调大模型:使用PEFT库对Qwen进行指令微调
本文介绍了如何使用LoRA(低秩适应)技术对Qwen-7B大模型进行监督微调(SFT),以提升其在特定领域的表现。首先阐述了全参数微调的高成本问题,指出LoRA通过仅训练少量额外参数(可减少99%以上显存占用)的解决方案。接着详细说明了环境准备、数据集格式要求及预处理方法,重点展示了如何构建符合Qwen模型的ChatML对话格式。然后指导了模型加载和LoRA配置步骤,解释了关键参数如秩(r)和缩放因子(alpha)的作用。最后提供了训练参数设置建议,包括批次大小、梯度累积和混合精度等优化技巧,使开发者能在有
2026-07-18 16:45:28
184
原创 从零手把手教你LoRA微调Qwen2.5:完整训练代码+显存优化策略
本文介绍了使用LoRA方法微调Qwen2.5-0.5B医疗问答模型的完整流程。首先说明硬件要求(6GB以上显存GPU)和Python环境搭建步骤,包括创建conda虚拟环境和安装必要的依赖库。然后详细描述了数据集预处理过程,重点是如何将原始医疗问答数据转换为模型需要的对话格式,并构造仅计算回答部分损失的labels标签。接着解释LoRA原理,展示模型加载和LoRA配置方法,包括参数设置和显存优化技巧(如bfloat16精度和4-bit量化)。最后提供训练脚本实现,涵盖数据加载、数据整理和训练参数设置等关键步
2026-07-18 16:37:38
174
原创 别再直接喂Prompt了!从零搭建RAG知识库:文档切分、向量检索与LLM结合全流程代码实战
本文介绍了如何从零搭建一个基于RAG(检索增强生成)的知识库问答系统。当大模型缺乏公司内部资料时,RAG通过结合知识库检索来解决"编造答案"问题。系统架构分为四步:用户提问→向量检索→拼装Prompt→生成答案。具体实现包括:1) 用文本切分器将文档分块;2) 使用Sentence Transformer生成语义向量;3) 用FAISS构建高效向量索引;4) 检索相关内容后交由大模型生成回答。文章提供了完整Python代码示例,并给出优化建议:调整切块策略、升级Embedding模型和加入重排序机制。这套方
2026-07-16 21:09:18
194
原创 大模型微调利器:使用 LLaMA-Factory 对 Qwen2.5 进行 LoRA 微调全流程
一、为什么选择 LLaMA-Factory + Qwen2.5?1.1 传统微调的三大痛点在过去,想要微调一个大模型,开发者往往面临三重困境:硬件门槛高:全参数微调需要多卡A100集群,个人开发者望而却步技术复杂度大:分布式训练、参数调优、环境配置环环相扣,一个报错卡半天工具链碎片化:从数据处理到模型部署需要拼接多个工具,流程冗长1.2 LLaMA-Factory 的破局之道LLaMA-Factory 的出现彻底改变了这一局面。
2026-07-08 21:23:17
359
原创 5分钟搞定!Llama 3 本地私有化部署实战(Ollama + 终端指令详解)
一、为什么选择Ollama + Llama 3?在AI大模型火热的今天,很多开发者面临一个两难选择:云端API方案:数据需上传第三方服务器,存在隐私泄露风险,且长期使用成本不菲,每次调用都要付费传统本地部署方案:需要安装CUDA、配置Python环境、处理依赖冲突,门槛极高,新手往往卡在环境配置环节Ollama彻底改变了这一局面。作为一个专为本地运行设计的开源工具,它的核心优势是零依赖部署:无需安装CUDA、Docker等复杂环境,甚至纯CPU也能流畅运行,真正做到开箱即用。
2026-07-08 21:02:15
161
原创 LangChain+ChatGLM实现本地知识库:从PDF加载到向量检索全链路
一、为什么要做本地知识库?用过ChatGPT的人都有这种体验:问它“我上个月写的那个项目文档里写了什么”,它只能给你一个抱歉的表情。大模型虽强,但它的知识截止到训练数据那一天,你的私有文档它一概不知。本地知识库问答系统(也叫RAG,检索增强生成)要解决的正是这个问题。核心思路很简单:不让大模型凭空回答,而是先从你的文档里找到相关内容,再让模型基于这些内容生成答案。这样一来,既能保护数据隐私(一切在本地运行),又能让模型回答你专属的问题。整个流程分两个阶段:离线阶段把本地文档切碎、向量化、存进数据库。
2026-07-07 16:07:26
554
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅