大模型时代，算法工程师如何更有竞争了更吃香？

AI大模型-搬运工

于 2024-09-12 10:47:43 发布

阅读量848

点赞数 36

文章标签：算法算法工程师大模型 AI大模型大语言模型自然语言处理 LLM

本文链接：https://blog.csdn.net/2401_84208172/article/details/142169054

版权

毫无疑问，全栈型的算法工程师将更为抢手，如果你精通大模型从训练到应用的整个流程，你走到哪里都不怕。

但往往人的精力有限，如果从数据、预训练、微调、对齐、推理、应用几个方面来看的话，个人觉得现在重要性排序是“预训练>应用>数据>对齐>推理>微调”。

先说一下各个方向的特点，再说我为啥这么排序吧。纯个人看法，不喜勿喷，交流欢迎讨论。

数据方面

不可否认的一点，现在很多算法工程师，都可以称为数据工程师，在模型调优的绝大时间里，其实90%甚至更多的时间，都在做数据相关的工作，无论是数据爬取、数据构造，还是数据清洗、数据混合。

“garbage in, garbage out”也是业界公认，数据的质量和数据量决定着模型的效果。这也是为什么都是基于llama的模型，都用lora方法训练，用的都是llama-factory的代码，但你的模型效果不行的原因，很多时候是数据层面的因素，可能是你的数据并没有很好的激发出模型本身的性能，也可能是给模型灌入的知识质量很差。

对于数据方面，已经有很多工作，但哪些有效，哪些适合你自己的场景，对于你自己的场景是否有更好地数据构造、清洗方法，都是算法工程师要考虑的事情。

现在合成数据也变成了大模型可以走更远的基础，无论是Llama3.1，还是Qwen2系列模型，都用了很多合成数据，并且各细分领域的合成数据也可以更好的激发模型效果（Qwen2-Math）。

预训练方面

大模型时代可以做真正做预训练的企业非常少，做该部分工作的算法工程师也就更少。（当然用20B Token数据，对1B参数模型预训练，咱不算哈，别杠~）

真正对千万级别参数大模型进行几甚至十几T tokens进行预训练的，对机器要求很高。在多机之间通信过程中，会存在很多问题，训练过程中也会出现很多问题，那么如何解决这些问题，是十分宝贵的经验。毕竟Llama3.1 450B预训练阶段54天也是断了466次。

由于真正有机会做这些的人少之又少，所有该部分算法工程师很宝贵，毕竟物以稀为贵。如果有了这些人，也许可以少走很多坑，或者说可以更快的训练出大模型。

当然除了从头预训练还有一些增量预训练，虽然资源消耗没用那么明显，但超大模型的全量参数训练，依然需要考虑性能、成本的因素。

说白了，就是你最多用过多少张卡，训练优没优化相关性能。

微调方面

现在网上开源项目很多，微调基本上已经成为了有手就行。把数据准备好，环境准备好，甚至可以web-ui一键训练。全参、lora、qlora等等方法已经成为了很多项目的标配。

可能当你任务有特殊要求时，会简单修改一些dataloader部分，trainer、deepspeed基本就是config参数配置，改改学习率，改改轮数，然后bash train.sh。

现在基本上在面试实习生的时候，人手标配，微调过xxxx模型，然后细节一概不知，反正就是跑起来了，一问效果就是感觉好了一些。

但模型调的好不好，还是看人。

对齐方面

无论是人类偏好对齐，还是安全性对齐，对于ToC端大模型是必要的，这样可以大幅度提高模型的友好性。对齐过程也是坑比较多，有时模型对着对着，就炸了，开始不说人话了。

llama2是根据多种reward模型进行rlhf对齐，现在也有很多简单高效的对齐方法，比如DPO、ORPO等，但实际训练过程中也是一言难尽，需要深入研究。反正我对齐不好，就是怪数据不行。

但对于ToB端来说，貌似对齐的意义不大，因为很大程度上，大模型已经被限制了仅在固定场景中使用，或者即使内部出现不安全问题，也不会引发公众影响，ToB更关心的是效果。

那么就看你司业务主攻方向了。

推理方面

大模型参数太大了，对于推理资源的消耗是巨大的，因此加速大模型推理速度、减少大模型推理资源是十分重要的。

随着时代的发展，相信以后端侧大模型会越来越多，直接把大模型部署在手机上，有效解决推理资源的问题；并且现在很多模型都支持100K以上的Token，如何提升用户体验、减少自己的硬件资源消耗，是至关重要的。

现在推理加速框架也是很多，例如：vllm、fastllm、llamacpp等等，但很多大厂有自己更好的一套，比较轮子不能白造。

对于99%的公司来说，vllm、llamacpp真就够了。当然只是我个人片面的想法，很多时候研究半天，不如等vllm更新一波。

不过前一阵子月之暗面的大模型推理论文确实值得一读，《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》。

应用方面

大模型最简单的形态是以Chat形式展现，但可以有更好的产品形态，让用户在某些场景可以更好地利用大模型的能力，来解决核心问题。那么就需要将大模型包装成一个好的产品，需要更好地激发大模型能力。

当然真正做应用的，并不是说调调prompt、few-shot一下就完事儿了，这里是只需要考虑如何将复杂问题进行拆分，当一些模型能力不足时如何利用其他手段进行兜底。

当然很多做应用的还需要少量的模型微调，甚至要灵活运用之前的小模型，以满足产品对应的要求。

写在最后

上面在说各个方面特点的时候，你应该就可能知道我为啥觉得“预训练>>应用数据>对齐>推理>微调”了。

因为掌握预训练的人才较少，毕竟物以稀为贵；而数据由是大模型的重点，毕竟有多少数据就有多少智能嘛；对齐主要是很多场景真没必要，毕竟我是做ToB较多，认知也许比较狭隘了；推理其实主要是很多开源框架已经支持的很好了，感觉对于很多厂商来说也许开源就够用了；微调到现在这个阶段，真快成为了有手就行；各大公司已经不在无脑砸钱做底层训练，大模型应用落地、变现是现在的重点。

如何学习AI大模型？

大模型时代，火爆出圈的LLM大模型让程序员们开始重新评估自己的本领。 “AI会取代那些行业？”“谁的饭碗又将不保了？”等问题热议不断。

不如成为「掌握AI工具的技术人」，毕竟AI时代，谁先尝试，谁就能占得先机！

想正式转到一些新兴的 AI 行业，不仅需要系统的学习AI大模型。同时也要跟已有的技能结合，辅助编程提效，或上手实操应用，增加自己的职场竞争力。

但是LLM相关的内容很多，现在网上的老课程老教材关于LLM又太少。所以现在小白入门就只能靠自学，学习成本和门槛很高

那么针对所有自学遇到困难的同学们，我帮大家系统梳理大模型学习脉络，将这份 LLM大模型资料 分享出来：包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等, 😝有需要的小伙伴，可以 扫描下方二维码领取🆓↓↓↓

👉[CSDN大礼包🎁：全网最全《LLM大模型入门+进阶学习资源包》免费分享（安全链接，放心点击）]()👈

学习路线

在这里插入图片描述

第一阶段：从大模型系统设计入手，讲解大模型的主要方法；

第二阶段：在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用；

第三阶段：大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统；

第四阶段：大模型知识库应用开发以LangChain框架为例，构建物流行业咨询智能问答系统；

第五阶段：大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型；

第六阶段：以SD多模态大模型为主，搭建了文生图小程序案例；

第七阶段：以大模型平台应用与开发为主，通过星火大模型，文心大模型等成熟大模型构建大模型行业应用。

在这里插入图片描述

👉学会后的收获：👈

• 基于大模型全栈工程实现（前端、后端、产品经理、设计、数据分析等），通过这门课可获得不同能力；

• 能够利用大模型解决相关实际项目需求：大数据时代，越来越多的企业和机构需要处理海量数据，利用大模型技术可以更好地处理这些数据，提高数据分析和决策的准确性。因此，掌握大模型应用开发技能，可以让程序员更好地应对实际项目需求；

• 基于大模型和企业数据AI应用开发，实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能，学会Fine-tuning垂直训练大模型（数据准备、数据蒸馏、大模型部署）一站式掌握；

• 能够完成时下热门大模型垂直领域模型训练能力，提高程序员的编码能力：大模型应用开发需要掌握机器学习算法、深度学习框架等技术，这些技术的掌握可以提高程序员的编码能力和分析能力，让程序员更加熟练地编写高质量的代码。

在这里插入图片描述

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集

👉获取方式：
😝有需要的小伙伴，可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

AI大模型-搬运工

关注

36
点赞
踩
6

收藏

觉得还不错? 一键收藏
0
评论
大模型时代，算法工程师如何更有竞争了更吃香？

毫无疑问，全栈型的算法工程师将更为抢手，如果你精通大模型从训练到应用的整个流程，你走到哪里都不怕。但往往人的精力有限，如果从数据、预训练、微调、对齐、推理、应用几个方面来看的话，个人觉得现在重要性排序是“预训练>应用>数据>对齐>推理>微调”。
复制链接

扫一扫