大模型笔记【3】 gem5 运行模型框架LLama

南方铁匠

已于 2024-01-22 22:02:41 修改

阅读量700

点赞数 10

文章标签：笔记 llama

于 2024-01-21 22:28:09 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/hit_shaoqi/article/details/135736726

版权

一 LLama.cpp

LLama.cpp 支持x86，arm，gpu的编译。

1. github 下载llama.cpp

https://github.com/ggerganov/llama.cpp.git

2. gem5支持arm架构比较好，所以我们使用编译LLama.cpp。

以下是我对Makefile的修改

开始编译：

make UNAME_M=aarch64

编译会使用到aarch64-linux-gnu-gcc-10，编译成功可以生成一个main 文件，这里我把main重命名成main_arm_backup了。

可以使用file main查看一下文件：

3. 下载一个大模型的model到llama.cpp/models的目录下，这里我下载了llama-2-7b-chat.Q2_K.gguf。

这个模型2bit量化，跑起来不到3G的内存。

GGML_TYPE_Q2_K - "type-1" 2-bit quantization in super-blocks containing 16 blocks, each block having 16 weight. Block scales and mins are quantized with 4 bits. This ends up effectively using 2.5625 bits per weight (bpw)

4. 此时我们可以本地运行以下main和模型，我的prompt是How are you

./main -m ./models/llama-2-7b-chat.Q2_K.gguf -p "How are you" -n 16

下图最下面一行就是模型自动生成的

二 gem5

gem5下载编译好后，我们可以使用gem5.fast运行模型了。

build/ARM/gem5.fast

--outdir=./m5out/llm_9

./configs/example/se.py -c

$LLAMA_path/llama.cpp/main-arm

'--options=-m $LLAMA_path/llama-2-7b-chat.Q2_K.gguf -p Hi -n 16'

--cpu-type=ArmAtomicSimpleCPU --mem-size=8GB -n 8

此时我的prompt是Hi，预期是n=8，跑8核。

上图是gem5运行大模型时生成的simout，我增加了AtomicCPU 运行指令数量的打印，这是在gem5的改动。

如果你下载的是gem5的源码，那么现在运行起来应该只是最前面大模型的输出。

模型的回答是Hi，I'm a 30-year-old male, and

但是我预期的是8核，实际上运行起来：

可以看出来，实际上只跑起来4核，定位后发现，模型默认是4核，需要增加-t 8选项，即threadnumber设置成8，下面的红色标注的command.

build/ARM/gem5.fast

--outdir=./m5out/llm_9

./configs/example/se.py -c

$LLAMA_path/llama.cpp/main-arm

'--options=-m $LLAMA_path/llama-2-7b-chat.Q2_K.gguf -p Hi -n 16 -t 8'

--cpu-type=ArmAtomicSimpleCPU --mem-size=8GB -n 8

如上图所示，8核都跑起来了，处理到Hi这个token的时候，CPU0执行了2.9 Billion指令，相对于4核时的5.4 Billion约减少了一半。

关注

10
点赞
踩
9

收藏

觉得还不错? 一键收藏
1
评论
大模型笔记【3】 gem5 运行模型框架LLama

如上图所示，8核都跑起来了，处理到Hi这个token的时候，CPU0执行了2.9 Billion指令，相对于4核时的5.4 Billion约减少了一半。可以看出来，实际上只跑起来4核，定位后发现，模型默认是4核，需要增加-t 8选项，即threadnumber设置成8，下面的红色标注的command.上图是gem5运行大模型时生成的simout，我增加了AtomicCPU 运行指令数量的打印，这是在gem5的改动。如果你下载的是gem5的源码，那么现在运行起来应该只是最前面大模型的输出。
复制链接

扫一扫

南方铁匠 CSDN认证博客专家 CSDN认证企业博客

码龄9年

178: 原创

3万+: 周排名

1万+: 总排名

54万+: 访问

: 等级

6319: 积分

475: 粉丝

529: 获赞

94: 评论

2285: 收藏

私信

关注

热门文章

分类专栏

最新评论

MMU和cache详解（TLB机制）
xyzQ_Q: 您好，我有一点疑问，4. CPU访问内存时的硬件操作顺序中的第4点：“如果允许cache，则以VA为索引到cache中查找是否缓存了要读取的数据“，此处描述是否有问题？这个时候已经cpu已经把VA发送到mmu，通过mmu获取到了PA，应该是使用PA进行物理地址和cache地址的映射来尝试命中cache，这个映射取决于主存地址和cache之间的映射规则是直接映射、全相联映射或组相联映射。而不是通过最初的虚拟地址VA来索引cache。
Gem5 simpoint 全流程
两点水儿: 您好请问restore的时候为啥要切换CPU呢
大模型笔记【3】 gem5 运行模型框架LLama
CSDN-Ada助手: 恭喜你这篇博客进入【CSDN每天值得看】榜单，全部的排名请看 https://bbs.csdn.net/topics/617977177。
gem5 arm架构 fullsystem spec2017 benchmark 仿真
两点水儿: 请问大佬2017的多核多线程的有跑过吗
gem5 arm架构 fullsystem spec2017 benchmark 仿真
南方铁匠: 不好意思，没有试过啊。MLperf是不是用gpgpusim跑的比较多，你想用gem5的cpu去跑吗

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。