openAI，fine-tuning的示例代码

openwin_top

已于 2024-03-10 07:49:34 修改

阅读量1.3k

点赞数

分类专栏：人工智能文章标签：人工智能

于 2023-02-18 17:19:35 首次发布

本文链接：https://blog.csdn.net/zhangzhechun/article/details/129102256

版权

人工智能专栏收录该内容

55 篇文章 4 订阅

订阅专栏

我们将微调一个ada分类器来区分两个运动：棒球和曲棍球

首先，你需要安装openai的Python包：

pip install openai

先准备并处理数据

from sklearn.datasets import fetch_20newsgroups
import pandas as pd
import openai

categories = ['rec.sport.baseball', 'rec.sport.hockey']
sports_dataset = fetch_20newsgroups(subset='train', shuffle=True, random_state=42, categories=categories)
labels = [sports_dataset.target_names[x].split('.')[-1] for x in sports_dataset['target']]
texts = [text.strip() for text in sports_dataset['data']]
df = pd.DataFrame(zip(texts, labels), columns = ['prompt','completion']) #[:300]
df.head()
df.to_json("sport2.jsonl", orient='records', lines=True)

用openai的工具进行数据预处理

!openai tools fine_tunes.prepare_data -f sport2.jsonl -q

我们运行以下命令来训练数据集。由于这是一个分类任务，我们想知道在提供的验证集上的泛化性能，以用于我们的分类应用场景。该工具建议添加–compute_classification_metrics --classification_positive_class "baseball"以计算分类指标。
我们可以直接从CLI工具复制建议的命令。我们特别添加了-m ada来微调一个更便宜和更快的ada模型，通常在分类应用场景中与更慢更昂贵的模型相当。

!openai api fine_tunes.create -t "sport2_prepared_train.jsonl" -v "sport2_prepared_valid.jsonl" --compute_classification_metrics --classification_positive_class " baseball" -m ada

我们现在可以下载结果文件，观察在保留的验证集上的预期性能。

!openai api fine_tunes.results -i ft-2zaA7qi0rxJduWQpdvOvmGn3 > result.csv

用代码查看训练结果

results = pd.read_csv('result.csv')
results[results['classification/accuracy'].notnull()].tail(1)
results[results['classification/accuracy'].notnull()]['classification/accuracy'].plot()

调用模型，加载校验数据

test = pd.read_json('sport2_prepared_valid.jsonl', lines=True)
test.head()

我们需要使用与微调期间相同的分隔符，即\n\n###\n\n。在这种情况下，由于我们关心分类，因此我们希望温度尽可能低，并且只需要一个标记完成来确定模型的预测。

ft_model = 'ada:ft-openai-2021-07-30-12-26-20'
res = openai.Completion.create(model=ft_model, prompt=test['prompt'][0] + '\n\n###\n\n', max_tokens=1, temperature=0)
res['choices'][0]['text']

为了获取对数概率，我们可以在完成请求上指定logprobs参数。

res = openai.Completion.create(model=ft_model, prompt=test['prompt'][0] + '\n\n###\n\n', max_tokens=1, temperature=0, logprobs=2)
#查看结果
print(res['choices'][0]['logprobs']['top_logprobs'][0])

过请求log_probs，我们可以看到每个类别的预测（对数）概率。

向量数据库简介
 RedisTimeSeries开源的时序数据数据库
 BNF 语法描述
 python将抽象语法树转换回源代码的工具库astor
Python 的抽象语法树库ast
python可以执行字符串形式的 Python 代码的库exec
python用于解析复杂文本数据的库Ply
python 用于解析复杂文本数据的库PyParsing
python用来进行代码语法高亮的库Pygments
Pylint
python处理网格数据的一个库GridDataFormats
python开发的开源数学软件系统SageMath
Python端到端的测试的生态系统库pyATS
Python 强大的模板引擎库 Skeleton BootStrap
python读取和编写配置文件库ConfigObj和ConfigParser
python在Web应用程序中安全地转义和渲染HTML的库MarkupSafe
Python为命令行界面（CLI）工具自动生成解析器的库Docopt
python的模板引擎库Mako，生成代码也很简单
 python生成PDF文档的库reportlab
python的生成艺术字体的库pythonwordart

openwin_top

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
打赏
3
评论
openAI，fine-tuning的示例代码

这段代码中，我们首先使用 openai 库读取了一个包含 prompt 和 completion 的数据集。接下来，我们将数据集的每个条目连接成一个训练示例，并将其存储在 training_data 列表中。然后，我们使用 openai 的 Model 类创建一个 GPT-3 模型实例，并使用 fineturn 方法对其进行微调，最后保存微调好的模型。最后，我们使用微调好的模型对一篇文本进行分类，将结果打印到控制台上。
复制链接

扫一扫