GLM-4 开源多语言多模态对话模型教程

雷芯琴

于 2024-08-08 07:48:05 发布

阅读量650

点赞数 7

本文链接：https://blog.csdn.net/gitblog_00157/article/details/141011242

版权

GLM-4 开源多语言多模态对话模型教程

GLM-4GLM-4 series: Open Multilingual Multimodal Chat LMs | 开源多语言多模态对话模型项目地址:https://gitcode.com/gh_mirrors/gl/GLM-4

1. 项目介绍

GLM-4系列是由智谱AI推出的一个开源多语言多模态聊天语言模型。该模型支持包括中文、英文在内的26种语言，能够进行多轮对话，还具备诸如网页浏览、代码执行、自定义工具调用及长文本推理等功能。GLM-4-9B是这一系列中一个强大的预训练模型，在多种评估任务中展现出优越性能，超越了类似规模的其他模型如Llama-3-8B。

2. 项目快速启动

安装依赖

确保你的环境中已经安装了transformers库和相关的python环境，如果没有，可以通过下面的命令安装：

pip install transformers

下载模型

使用Hugging Face Transformers接口下载GLM-4V-9B模型：

from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("THUDM/glm-4v-9b")
model = AutoModelForCausalLM.from_pretrained("THUDM/glm-4v-9b")

图片描述示例

import torch
from PIL import Image
from transformers import pipeline

# 打开图像文件
image_path = "your_image.jpg"
img = Image.open(image_path).convert('RGB')

# 初始化处理管道
caption_pipeline = pipeline('text-generation', model=model, tokenizer=tokenizer)

# 将图片转成编码
inputs = {'image': img}

# 生成描述
output = caption_pipeline(inputs)[0]['generated_text']
print(output)