大模型
文章平均质量分 87
lipeng08
字节跳动 分布式存储系统 开发工程师
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
大模型系列22-MCP
MCP(Model Context Protocol)是一个用于定义模型与外部工具如何交互的协议。它可以告诉大模型有哪些工具可用、工具的参数和返回格式,然后触发外部 Agent(如Cline)调用工具,实现让大模型更好的使用工具的能力。说是大模型使用工具,其实是Agent发送给模型自己的工具列表,模型判断出要使用什么工具,然后模型告诉Agent去调用,Agent执行工具调用之后,然后将调用结果返回给模型,由模型决策后续的行为(或者是直接总结工具的结果返回给用户,或者是进一步调用工具等)。原创 2025-05-26 00:23:07 · 1996 阅读 · 0 评论 -
大模型系列21-AI聊天机器人
Streamlit是一个用于构建快速、交互式 Web 应用的 Python 库,特别适用于机器学习和数据科学项目。通过简单的 Python 代码,Streamlit 可以让你快速展示数据可视化、创建交互式界面和展示机器学习模型的结果。总的来说是可以用于快速验证思路,进行demo展示。原创 2025-02-03 22:44:38 · 1645 阅读 · 4 评论 -
大模型系列18-AI Agents
Al Agent智能体,是指一种能够模拟人类思考和行为来自动执行任务,以解决复杂问题的程序或系统架构图思考->行动->观测实际输入给大模型的prompt具体执行步骤如下。原创 2025-01-04 20:56:40 · 431 阅读 · 0 评论 -
大模型系列17-RAGFlow搭建本地知识库
这里我们做的机器学习论文库,因此可以将“解析方法”从“General”调整为“Paper”模式,对论文进行解析。列出所有的模型,有两个Embedding模型以及一个qwen2:7b的模型。文件中,可以修改 端口号、ragflow的镜像版本等。参考写的安装open-webui的文章。将刚才添加的模型设置到系统默认配置中。新建一个论文助理,用于后续的聊天对话。ragflow使用的各种环境变量在。论文上传完毕后,执行论文内容的解析。论文解析过程,花了10几分钟。参考写的ollama的文档。原创 2025-01-01 00:33:26 · 2017 阅读 · 0 评论 -
大模型系列13-迁移学习(WIP)
这些前缀向量会参与模型的计算过程,通过调整前缀向量的参数来影响模型的输出,从而实现对特定任务的微调。例如,在一个 Transformer 架构的语言模型中,通常只对多头注意力(Multi - Head Attention)机制中的查询(Q)和键(K)矩阵应用 LoRA,这些矩阵的维度较高,通过低秩分解可以有效地减少需要更新的参数数量。在自然语言处理领域,迁移学习是一种关键技术,用于将从一个任务或领域中学到的知识迁移到另一个任务或领域中,从而减少训练时间、计算资源,并提升模型在特定任务上的表现。原创 2024-12-19 08:33:00 · 1537 阅读 · 0 评论 -
大模型系列4--开源大模型本地部署到微调(WIP)
一直想真正了解大模型对硬件资源的需求,于是准备详细看一篇视频,将核心要点总结记录下。原创 2024-12-14 09:42:39 · 2377 阅读 · 0 评论 -
大模型系列7-从零实现GPT(WIP)
dataclass。原创 2024-12-14 09:40:16 · 280 阅读 · 0 评论 -
大模型系列10-推理优化(WIP)
在这个过程中,DeepSpeed Inference 会自动将模型分割到指定数量的 GPU 上,并插入为 Transformer 模型运行多 GPU 推理所需的必要通信代码——用户无需更改模型代码。一方面,快手使用了零冗余优化器,在非 MoE 层上面使用了 ZeRO—2,把 optimizer states 数据和 gradients 数据做了一些零冗余的切分。在不增加通信量的情况下,可以降低 GPU 的显存占用。在 MoE 层禁用了 ZeRO,避免掉跨机之间做通讯的情况。原创 2024-12-14 09:39:40 · 384 阅读 · 0 评论 -
大模型系列12-KV Cache
预填充性能评估指标:TTFT(time to first token)TTFT 即生成首个标记的时间,是预填充阶段关键评估指标。实际应用中,通常会设定 TTFT SLO,这是对系统的性能要求,只有系统满足该指标,其性能才达标。例如,设定 P90 TTFT SLO 为 0.4 秒,即要求系统 90% 的请求其 TTFT 值小于等于 0.4 秒。解码性能评估指标:TPOT(time per output token)TPOT 是生成每个输出标记的时间,是解码阶段重要评估指标。原创 2024-12-14 09:38:28 · 1513 阅读 · 0 评论 -
大模型系列2--Transformer(WIP)
输入 -> MultiHead Attention -> Residual + Layer Norm -> FC -> Residual + Layer Norm -> 上述网络重复N遍 -> 输出问题Residual的价值。原创 2024-07-29 09:36:15 · 818 阅读 · 0 评论 -
大模型系列5--卷积神经网络
利用前述知识,可以很容易构建一个三层CNN,它包括两个卷积层和一个全连接层,每个卷积后面接Relu和MaxPooling,经典网络有2卷1pooling,和三卷1pooling的。conv1:第1层卷积conv2:第2层卷积out:全连接层特别要注意的是卷积的各个参数的设定in_channels:输入数据的第三维的大小out_channels:输出的特征图的个数kernel_size:卷积核第1和2维的大小stripe:卷积的滑动窗口步长。原创 2024-07-29 09:33:59 · 1639 阅读 · 0 评论 -
大模型系列11-ray
ray是分布式的计算框架原创 2024-11-24 18:57:18 · 1229 阅读 · 0 评论 -
大模型系列9-ZeRO123 (WIP)
以 GPT-2 为例,GPT-2 模型含有 1.5B 个参数,如果用 fp16 格式,模型本身只占 3GB 显存,但是实际训练过程中的模型状态需要耗费 24GB!激活值可以使用activation checkpoint来进行优化掉,因此优化是显存优化的重点。模型状态的优化,ZeRO使用的方法是分片策略,每张卡只存储1/N的模型状态原创 2024-10-28 00:27:48 · 1429 阅读 · 0 评论 -
大模型系列8-Latex
为了更好的记录,写了一些大模型的博客,不专业,只备忘。前几年写论文很常用,但是现在过了几年了,基本都忘得差不多了,于是乎专门记录一个博客,将常用的Latex符号给记录下,便于未来帮助查看。参考: https://blog.csdn.net/xxzhangx/article/details/52778539。参考:https://www.acwing.com/blog/content/3067/小于约等于 a \lesssim b =大于约等于 a \gtrsim b =约等于 a \approx b =原创 2024-08-13 09:20:35 · 1030 阅读 · 0 评论 -
大模型系列6--神经网络(WIP)
为了学习Transformer,我开始投入一部分精力来学习神经网络。这篇文章会持续更新。主要讲述了神经网络的基础知识原创 2024-08-13 01:22:09 · 685 阅读 · 0 评论 -
大模型系列3--pytorch dataloader的原理
pytorch dataloader代码分析原创 2024-07-14 23:24:29 · 1761 阅读 · 0 评论 -
机器学习-线性回归
#线性回归 线性回归基本介绍假定数据集合中有mm个样本点,对于每一个样本点xix_i,具有值yiy_i,且x={xi|i∈{0,1,…,m−1}}x = \{x_i | i \in \{0, 1, \ldots, m-1\} \}与结果y={yi|i∈{0,1,…,m−1}}y = \{y_i |i \in \{0, 1, \ldots, m-1\} \}呈现线性关系。原创 2017-11-22 22:09:43 · 521 阅读 · 0 评论 -
机器学习-决策树
决策树基本介绍决策树是一个树结构,它既可以是二叉树,也可以是多叉树。 它的每一个非叶子节点代表对某一个属性的测试,而每一个叶子节点存放具体的类别。 它的决策从根节点开始,根据分支节点来测试属性并进入到树的下层相应的分支,直到抵达叶子节点得到类别。 决策树是基于树结构进行决策的,这符合我们对问题的决策方案,可解释性较强。 当我们判断一个人能不能偿还债务的时候,我们原创 2017-11-26 00:04:18 · 601 阅读 · 0 评论
分享