郑纬民院士|构建支持大模型训练的计算机系统需要考虑的4个问题

本文由郑纬民院士探讨构建支持大模型训练的计算机系统,涉及基于GPU、国产AI芯片和超级计算机的算力系统,强调国产AI芯片的生态系统和超算的软硬件协同设计。文章指出利用超级计算机进行大模型训练面临的挑战,包括新型硬件、应用程序和系统工程化,并提出拓扑感知的混合并行策略、体系结构感知的访存性能优化和大规模检查点存储性能优化等解决方案。
摘要由CSDN通过智能技术生成

7415a06a090b060862bb8876209bec2c.png

本文刊载于《大数据》2024年第1期“战略研究”

395ae890813e394524fcc0eebec7092b.png

郑纬民  中国工程院院士,清华大学计算机科学与技术系教授,中国计算机学会第十届理事长,数博会专家咨询委员会委员,《大数据》主编,何梁何利科学与技术进步奖获得者,中国存储终身成就奖获得者,享受国务院政府特殊津贴。获北京市优秀教师奖和北京市教学名师称号,获国家科技进步奖一等奖1项、二等奖2项,国家技术发明奖二等奖1项,2016年获ACM戈登·贝尔奖。2019年当选中国工程院院士。主要研究方向为网络存储系统,长期从事网络存储系统科学研究、工程建设和人才培养,在存储系统扩展性、可靠性和集约性等科学问题和工程技术方面,取得了国内外同行认可的创新性成果;研制的网络存储系统、容灾系统和自维护存储系统在多个重大工程中发挥了重要作用。教学方面长期讲授计算机系统结构课程,2008年被评为国家级精品课程;已编写和出版计算机系统结构教材和专著10本,与合作者一起发表论文530余篇。

DOI:10.11959/j.issn.2096-0271.2024016

郑纬民. 构建支持大模型训练的计算机系统需要考虑的4个问题[J]. 大数据, 2024, 10(1): 1-8.

1 三大算力系统

目前,有3种支持大模型训练的算力系统,分别为基于英伟达公司GPU的系统、基于国产AI芯片的系统,以及基于超级计算机的系统,3种算力系统各有优劣。

  • 基于英伟达公司GPU的系统的硬件性能好、编程生态好,但英伟达GPU产品价格高,一卡难求。

  • 基于国产AI芯片的系统已经取得了很多成果,但其生态系统不好。

  • 除了GPU这种算力形态,超级计算机也可以用于支持大模型训练。部分超算中心的算力利用率并不饱和,可将空闲算力用于大模型训练。

2 国产AI芯片的破局之路

目前国内已经有30多家公司推出了国产芯片,并取得了很多优秀的成果,进步很大。但用户不喜欢用国产AI芯片,最主要的原因是国产AI芯片的生态系统不好。

要改变国产AI芯片生态系统不好的局面,需要做好10个关键软件,分别是:编程框架、并行加速、通信库、算子库、AI编译器、编程语言、调度器、内存分配系统、容错系统、存储系统。

目前,上述10个软件都有国产的,但仍存在不足,比如种类做得不够齐全、性能不够好等。如果国产AI芯片硬件性能达到国外芯片性能的60%,只要把软件和生态做好,用户也会满意的

3 做好软硬件协同设计,超算也可以支持大模型训练

目前,我国超算水平已经处于国际第一梯队,有14个国家一级超算中心&#

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值