【AI大模型应用开发】【补充知识】文本向量化与向量相似度（含Python代码）

AI-入门

于 2024-09-11 09:33:05 发布

阅读量400

点赞数 6

文章标签：人工智能 python 开发语言深度学习 prompt chatgpt agi

本文链接：https://blog.csdn.net/2401_86518761/article/details/142127605

版权

在上篇文章[【AI大模型应用开发】3. RAG初探 - 动手实现一个最简单的RAG应用中，我们动手实现了一个RAG基本流程。里面涉及到向量数据库和向量检索。对于没接触过的人可能比较懵。本文介绍下文本向量化的概念，以及向量检索的原理，只是简单介绍，不会深入，所以不用担心看不懂，想要详细研究的，可以去搜相关论文，涉及到机器学习和模型训练等。

0. 文本向量

0.1 什么是文本向量

文本向量（Text Vector）是一种将文本数据转换为数值向量的技术，以便于机器学习和数据分析。通过将文本数据转换为数值向量，我们可以使用机器学习算法对文本数据进行处理和分析。

0.2 文本向量是怎么得到的

（1）构建相关（正立）与不相关（负例）的句子对儿样本

（2）训练双塔式模型，让正例间的距离小，负例间的距离大

参考：arxiv.org/pdf/1908.10…

1. 获取文本向量

前面已经说了文本向量是怎么得到的，其实也是训练了一个模型。使用这个训练的模型，给一个输入，就可以得到该输入的向量。这里我们可以使用OpenAI开放的文本向量化接口embeddings.create来获取某个文本的向量值。

python代码解读复制代码from openai import OpenAI
import os
# 加载环境变量
from dotenv import load_dotenv, find_dotenv
_ = load_dotenv(find_dotenv())  # 读取本地 .env 文件，里面定义了 OPENAI_API_KEY

client = OpenAI()

def get_embeddings(texts, model="text-embedding-3-small"):
    '''封装 OpenAI 的 Embedding 模型接口'''
    data = client.embeddings.create(input=texts, model=model).data
    return [x.embedding for x in data]

可以测试一下这个接口，看下这个接口输出的向量长什么样：

python代码解读复制代码test_query = ["测试文本"]
vec = get_embeddings(test_query)[0]
print(vec[:10])
print(len(vec))

在这里插入图片描述

输出结果如下：

在这里插入图片描述可以看到 “测试文本” 这四个字对应的输出是一个 1536 维的向量，这就是 “测试文本” 的向量表示。

注意：相同的文本使用不同的向量化模型获取的向量化结果是不同的，所以请保证你的RAG应用中使用的是同样的向量化模型和方式。

2. 向量间相似度计算

通过上面文本向量化，我们可以将一段文本转换成一串多维的数字，也就是数学上的向量。

2.1 向量间的距离

对于向量，相似度计算很简单，就是计算两个向量之间的距离。

距离的计算有多种，具体可看这篇文章：向量距离计算的几种方式，这里面最常用的还是余弦距离和欧式距离。（下图来源网络，表示了欧式距离和余弦距离的样子。）

在这里插入图片描述

2.2 向量距离计算 Python代码

python代码解读复制代码import numpy as np
from numpy import dot
from numpy.linalg import norm

def cos_sim(a, b):
    '''余弦距离 -- 越大越相似'''
    return dot(a, b)/(norm(a)*norm(b))


def l2(a, b):
    '''欧式距离 -- 越小越相似'''
    x = np.asarray(a)-np.asarray(b)
    return norm(x)

3. 向量相似度示例代码

python代码解读复制代码# 能支持跨语言
query = "global conflicts"

documents = [
    "联合国就苏丹达尔富尔地区大规模暴力事件发出警告",
    "土耳其、芬兰、瑞典与北约代表将继续就瑞典“入约”问题进行谈判",
    "日本岐阜市陆上自卫队射击场内发生枪击事件 3人受伤",
    "国家游泳中心（水立方）：恢复游泳、嬉水乐园等水上项目运营",
    "我国首次在空间站开展舱外辐射生物学暴露实验",
]

query_vec = get_embeddings([query])[0] # 计算自身的向量
doc_vecs = get_embeddings(documents) # 计算示例句子的向量

print("Cosine distance:")
print(cos_sim(query_vec, query_vec)) # 首先打印自身与自身的余弦距离
for vec in doc_vecs:
    print(cos_sim(query_vec, vec)) # 打印自身与示例句子的余弦距离

print("\nEuclidean distance:")
print(l2(query_vec, query_vec))  # 首先打印自身与自身的欧式距离
for vec in doc_vecs:
    print(l2(query_vec, vec)) # 打印自身与示例句子的欧式距离

运行结果如下：

可以看出，余弦距离越大表示相似度越高。欧式距离约小，表示相似度越高。

向量检索，就是将相似度最高的k个检索结果召回

大模型资源分享

“最先掌握 AI 的人，相较于较晚掌握 AI 的人而言，将具备竞争优势。”这句话放在计算机、互联网以及移动互联网的开局时期，同样适用。

我在一线互联网企业工作长达十余年，期间指导过众多同行后辈，助力许多人实现了学习与成长。为此，我将重要的 AI 大模型资料，包括 AI 大模型入门学习思维导图、精品 AI 大模型学习书籍手册、视频教程以及实战学习等录播视频免费分享出来。
在这里插入图片描述

一、全套 AGI 大模型学习路线

AI 大模型时代的精彩学习之旅：从根基铸就到前沿探索，牢牢掌握人工智能核心技能！

在这里插入图片描述

二、640 套 AI 大模型报告合集

此套涵盖 640 份报告的精彩合集，全面涉及 AI 大模型的理论研究、技术实现以及行业应用等诸多方面。无论你是科研工作者、工程师，还是对 AI 大模型满怀热忱的爱好者，这套报告合集都将为你呈上宝贵的信息与深刻的启示。

在这里插入图片描述

三、AI 大模型经典 PDF 书籍

伴随人工智能技术的迅猛发展，AI 大模型已然成为当今科技领域的一大热点。这些大型预训练模型，诸如 GPT-3、BERT、XLNet 等，凭借其强大的语言理解与生成能力，正在重塑我们对人工智能的认知。而以下这些 PDF 书籍无疑是极为出色的学习资源。
在这里插入图片描述

阶段 1：AI 大模型时代的基础认知

目标：深入洞悉 AI 大模型的基本概念、发展历程以及核心原理。
内容

：
- L1.1 人工智能概述与大模型起源探寻。
- L1.2 大模型与通用人工智能的紧密关联。
- L1.3 GPT 模型的辉煌发展历程。
- L1.4 模型工程解析。
- L1.4.1 知识大模型阐释。
- L1.4.2 生产大模型剖析。
- L1.4.3 模型工程方法论阐述。
- L1.4.4 模型工程实践展示。
- L1.5 GPT 应用案例分享。

阶段 2：AI 大模型 API 应用开发工程

目标：熟练掌握 AI 大模型 API 的运用与开发，以及相关编程技能。
内容
：
- L2.1 API 接口详解。
- L2.1.1 OpenAI API 接口解读。
- L2.1.2 Python 接口接入指南。
- L2.1.3 BOT 工具类框架介绍。
- L2.1.4 代码示例呈现。
- L2.2 Prompt 框架阐释。
- L2.2.1 何为 Prompt。
- L2.2.2 Prompt 框架应用现状分析。
- L2.2.3 基于 GPTAS 的 Prompt 框架剖析。
- L2.2.4 Prompt 框架与 Thought 的关联探讨。
- L2.2.5 Prompt 框架与提示词的深入解读。
- L2.3 流水线工程阐述。
- L2.3.1 流水线工程的概念解析。
- L2.3.2 流水线工程的优势展现。
- L2.3.3 流水线工程的应用场景探索。
- L2.4 总结与展望。

阶段 3：AI 大模型应用架构实践

目标：深刻理解 AI 大模型的应用架构，并能够实现私有化部署。
内容
：
- L3.1 Agent 模型框架解读。
- L3.1.1 Agent 模型框架的设计理念阐述。
- L3.1.2 Agent 模型框架的核心组件剖析。
- L3.1.3 Agent 模型框架的实现细节展示。
- L3.2 MetaGPT 详解。
- L3.2.1 MetaGPT 的基本概念阐释。
- L3.2.2 MetaGPT 的工作原理剖析。
- L3.2.3 MetaGPT 的应用场景探讨。
- L3.3 ChatGLM 解析。
- L3.3.1 ChatGLM 的特色呈现。
- L3.3.2 ChatGLM 的开发环境介绍。
- L3.3.3 ChatGLM 的使用示例展示。
- L3.4 LLAMA 阐释。
- L3.4.1 LLAMA 的特点剖析。
- L3.4.2 LLAMA 的开发环境说明。
- L3.4.3 LLAMA 的使用示例呈现。
- L3.5 其他大模型介绍。

阶段 4：AI 大模型私有化部署

目标：熟练掌握多种 AI 大模型的私有化部署，包括多模态和特定领域模型。
内容
：
- L4.1 模型私有化部署概述。
- L4.2 模型私有化部署的关键技术解析。
- L4.3 模型私有化部署的实施步骤详解。
- L4.4 模型私有化部署的应用场景探讨。

学习计划：

阶段 1：历时 1 至 2 个月，构建起 AI 大模型的基础知识体系。
阶段 2：花费 2 至 3 个月，专注于提升 API 应用开发能力。
阶段 3：用 3 至 4 个月，深入实践 AI 大模型的应用架构与私有化部署。
阶段 4：历经 4 至 5 个月，专注于高级模型的应用与部署。

AI-入门

关注

6
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
【AI大模型应用开发】【补充知识】文本向量化与向量相似度（含Python代码）

文本向量（Text Vector）是一种将文本数据转换为数值向量的技术，以便于机器学习和数据分析。通过将文本数据转换为数值向量，我们可以使用机器学习算法对文本数据进行处理和分析。
复制链接

扫一扫