通义千问Qwen-VL-Chat大模型本地训练（二）

王八羔子有点甜.

已于 2024-07-12 17:58:38 修改

阅读量4.2k

点赞数 11

文章标签： python 计算机视觉语言模型

于 2024-07-12 17:55:59 首次发布

本文链接：https://blog.csdn.net/liukangjie520/article/details/140384306

版权

前言

人工智能大模型是一种能够利用大数据和神经网络来模拟人类思维和创造力的人工智能算法。它利用海量的数据和深度学习技术来理解、生成和预测新内容，通常情况下有数十亿乃至数百亿个参数，可以在不同的领域和任务中表现出智能拟人的效果。

现在大模型火的不行，项目中如果没有大模型好像都缺少点啥？没办法要跟着时代进步，最近研究了一下开源的通义千问大模型，翻阅了大量文档，记录一下使用心得。我使用的是通义千问Qwen-VL-Chat多模态模型。LLM模型可以通过Ollama下载官网最新推出的Qwen2模型，网上教程很多比较简单，但我们怎么可能仅仅只用聊天，必须得上多模态，Ollama的多模态模型很少，并且尝试过效果都不好，最后盯上modelScope上的Qwen-VL-Chat多模态，官网提供了modelScope和transformers两种途径获取模型，训练需要用到transformers，梯子已经架好。

环境准备

硬件： 本人使用的是window10系统，电脑为工作站内存，显存不需要考虑，正常情况下16G内存，6G显存能跑低7亿参数的模型。

软件： Anconda、Pytorch、Python、cuda（有GPU的考虑）主要用到这3个，其它包稍后说明。版本之间要按照官网上的说明来寻找适合的版本。我使用的版本如下：

Anconda：23.3.1；

Pytorch：2.0.1；

Python：3.10；

cuda：11.7；

软件安装

详细环境安装请看通义千问Qwen-VL-Chat大模型本地部署（一）；

数据准备

[
  {
    "id": "identity_0",
    "conversations": [
      {
        "from": "user",
        "value": "你好"
      },
      {
        "from": "assistant",
        "value": "我是Qwen-VL,一个支持视觉输入的大模型。"
      }
    ]
  },
  {
    "id": "identity_1",
    "conversations": [
      {
        "from": "user",
        "value": "Picture 1: <img>https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-VL/assets/demo.jpeg</img>\n图中的狗是什么品种？"
      },
      {
        "from": "assistant",
        "value": "图中是一只拉布拉多犬。"
      },
      {
        "from": "user",
        "value": "框出图中的格子衬衫"
      },
      {
        "from": "assistant",
        "value": "<ref>格子衬衫</ref><box>(588,499),(725,789)</box>"
      }
    ]
  },
  { 
    "id": "identity_2",
    "conversations": [
      {
        "from": "user",
        "value": "Picture 1: <img>assets/mm_tutorial/Chongqing.jpeg</img>\nPicture 2: <img>assets/mm_tutorial/Beijing.jpeg</img>\n图中都是哪"
      },
      {
        "from": "assistant",
        "value": "第一张图片是重庆的城市天际线，第二张图片是北京的天际线。"
      }
    ]
  }
]

数据格式如上，文件喂.json格式。<img>标签为图片地址标签，<box>标签为左上角，右下角坐标，用于标出矩形框，<ref>引用文本标签。