新能源时代！看大模型（LLMs）如何助力汽车自动驾驶！

最新推荐文章于 2024-07-16 09:41:30 发布

黑客-雨

最新推荐文章于 2024-07-16 09:41:30 发布

阅读量1.5k

点赞数 30

文章标签：汽车自动驾驶人工智能 AI大模型大模型

本文链接：https://blog.csdn.net/2401_84204207/article/details/139256027

版权

引言

本文主要介绍大模型(LLMs)如何助力汽车自动驾驶，简单来说，作者首先带大家了解大模型的工作模式，然后介绍了自动驾驶大模型的3大应用场景，最后指出自动驾驶大模型将会是未来的发展趋势，只要坚持，国内新能源造车新势力还是很有机会的。本文没有深入讲解算法架构，而是化繁为简，能够让您很快的对自动驾驶大模型有个较为全面的理解。

背景介绍

青霉素发现之前，科学家们的研究方向是在无菌实验室中不断的试错，旨在希望通过传统的医学方法来解决复杂的问题。然而，一个偶然的事件却改变了事件的发展，苏格兰医生弗莱明忘记关闭培养皿，导致培养皿被霉菌污染。这时，弗莱明注意到了一些奇怪的事情：所有靠近水分的细菌都死了，而其他细菌则幸存下来。

其中的水分到底是由什么构成的呢？带着这个一文，弗莱明发现霉菌的主要成分青霉素是一种强大的细菌杀手，从此人类发现青霉素的作用，从而产生了我们今天使用的抗生素。反过来想，如果一个医生按照传统的医学方法在无菌实验室里进行研究，青霉素的发现或许还要晚上很多年，甚至有可能也发现不了。

那么，汽车的自动驾驶是否也有可能出现类似的事情呢？前几年的汽车自动驾驶大多都是基于所谓的“模块化”构建，其主要包括感知模块、定位模块、规划模块、控制模块等，这里的控制模块会根据其他模块的信息来实现汽车的转向、变道等功能。如下图所示：

随着模型框架的发展，研究人员提出了端到端学习，核心思想是用预测转向和加速度的单个神经网络替换每个模块，这同样会引入黑盒问题，尽管如此仍然无法解决自动驾驶问题。那么近两年快速发展的大语言模型能否成为实现自动驾驶的答案呢？为此，本文将探讨大模型如何助力汽车自动驾驶。

LLM概述

简单来说，大模型主要包含Token化、Transformer、文本生成三大概念。其中：

「Token化」：给大模型输入一个文本，返回也是一个文本。但实际上是需要将输入文本转换成Token。那么什么是Token呢？简单来说一个Token可对应一个单词、一个字符、一个短句等。神经网络的输入始终是数字，因此您需要将文本转换为数字；这就是Token化。如下图所示：

「Transformer」：将输入文本转换成一个个的Token之后，就要将其输入到神经网络中，目前大部分的模型的基础网络架构都是Transformer，如下图所示。下图展示的是Encode-Decode架构的模型，不过现在大多数大模型都是Decode架构，例如GPT、LIaMA、ChatGLM等。不管怎样，它们都共享核心 Transformer 模块：多头注意力、层归一化、加法和串联、块、交叉注意力等…

「文本生成」 当上述Token进入Transformer网络中，文本是如何一个一个的生成的呢？如上图，编码器主要是学习输入文本特征并理解上下文，解码器主要是试图生成一个一个的单词，当然在一个一个单词生成的过程中主要依赖概率来进行判断输出。如下图所示：

LLM赋能自动驾驶

基于上面对LLM基本原理的介绍，那么它该如何应用到自动驾驶中呢？上面是将文本数据输入到模型架构中，在此场景下，这里将图像、传感数据（激光雷达点云、3D图像点云等）、算法数据（车道线、障碍物等）等转换成Token作为模型输入，模型架构基本上无需进行变动。输出则是基于我们想要汽车驾驶操作，例如当传感器检测到前面有车，左侧后方无车辆，可以左侧进行变道操作。

以上变道只不过是LLMs任务中的一种，除此之外LLM还能解决哪些自动驾驶任务呢？结合目前国内新能源汽车最新发展趋势，主要涉及这几个方面：

「环境感知」：在此情况下，输入通常是一系列的图像，例如最新的特斯拉取消的激光雷达采用全视觉感知，输出通常是一组对象，例如显示屏中模拟的车道、行人、障碍物等。就大模型而言，其主要有3个核心任务：检测、预测和跟踪。如下图所示，将车辆行驶图像输入到ChatGPT中，可以要求其描述发生的状况：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

不单单是ChatGPT，其他的模型同样可以做到，例如 HiLM-D 、MTD-GPT ，有的模型（例如PromptTrack）甚至可以为目标分配唯一的ID标识。

在上图PromptTrack模型中，多个传感器图像会被发送到Encoder-Decoder网络中，通过该网络可以预测对象注释(如3D边界框和注意图)，然后结合LLM提示“找到正在右转的车辆”，接着下一个块会找到 3D 边界框定位，并使用二分图匹配算法分配 ID。

「决策规划」 如果大模型在图像中发现了目标，那么它会告诉你面对该种情况该如何操作。这就是任务规划，即根据当前感知来规划从A到B的路径，当前在这块做的较好模型为Talk2BEV。除此之外，为了方便驾驶人更好的理解周围的环境，模型会结合多个视图生成鸟瞰视图。

如上图所示，这并不是纯粹基于“提示”，因为核心目标检测模型仍然是鸟瞰感知，但是LLM被用来“增强”输出，通过建议一些区域，查看特定的地方，并预测路径。

其他模型（例如 DriveGPT）经过训练，将 Perception 的输出发送到 Chat-GPT 并对其进行微调，以直接输出驾驶轨迹。如下图所示：

总结一下，结合上面我们对大模型的理解，这里的大模型（LLMs）输入是Token化的图像或者是感知算法的输出，然后将现有模型（BEV 感知、二分匹配……）与语言提示融合在一起，让大模型来寻找正在移动的车辆，最后，根据不同场景任务，根据输入数据对大模型进行细致的微调即可。

「图像生成」 您听说过 Wayve 的 GAIA-1 模型吗？该架构将图像、动作和文本提示作为输入，然后使用世界模型（对世界及其交互的理解）来生成视频，其模型架构如下所示：

类似地，您可以看到 MagicDrive，它将 Perception 的输出作为输入并使用它来生成场景：

还有一些模型能够根据当前的图像，生成未来可能的场景，例如：Driving Into the Future 、Driving Diffusion。根据这类模型，可以生成很多的汽车应用场景数据，进而可以训练出更好的模型，形成模型都迭代优化闭环。

自动驾驶LLM可信吗？

我们都知道，大模型当面对自己不了解的现实知识时，有很大概率会出现模型幻觉。那么将其应用到自动驾驶方面是否同样会出现类似的情况，答案是肯定的。

不过现在对自动驾驶LLM下定论也为时过早！因为，ChatGPT出现才不到一年半的时间，现在的大模型已经可以实现视频生成（例如Sora）、音乐生成（例如：Stable Audio 2.0、Prompt-Singer等），且效果惊人，未来的自动驾驶大模型也将会乘风破浪，成为自动驾驶的主流核心技术。紧跟技术迭代更新，只要坚持，国内新能源造车新势力还是很有机会的。

可能大家都想学习AI大模型技术，也想通过这项技能真正达到升职加薪，就业或是副业的目的，但是不知道该如何开始学习，因为网上的资料太多太杂乱了，如果不能系统的学习就相当于是白学。为了让大家少走弯路，少碰壁，这里我直接把全套AI技术和大模型入门资料、操作变现玩法都打包整理好，希望能够真正帮助到大家。

👉AI大模型学习路线汇总👈
大模型学习路线图，整体分为7个大的阶段：（全套教程文末领取哈）
在这里插入图片描述

第一阶段：从大模型系统设计入手，讲解大模型的主要方法；

第二阶段：在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用；

第三阶段：大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统；

第四阶段：大模型知识库应用开发以LangChain框架为例，构建物流行业咨询智能问答系统；

第五阶段：大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型；

第六阶段：以SD多模态大模型为主，搭建了文生图小程序案例；

第七阶段：以大模型平台应用与开发为主，通过星火大模型，文心大模型等成熟大模型构建大模型行业应用。

👉大模型实战案例👈
光学理论是没用的，要学会跟着一起做，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。

👉大模型视频和PDF合集👈
观看零基础学习书籍和视频，看书籍和视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

在这里插入图片描述

👉学会后的收获：👈
• 基于大模型全栈工程实现（前端、后端、产品经理、设计、数据分析等），通过这门课可获得不同能力；

• 能够利用大模型解决相关实际项目需求：大数据时代，越来越多的企业和机构需要处理海量数据，利用大模型技术可以更好地处理这些数据，提高数据分析和决策的准确性。因此，掌握大模型应用开发技能，可以让程序员更好地应对实际项目需求；

• 基于大模型和企业数据AI应用开发，实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能，学会Fine-tuning垂直训练大模型（数据准备、数据蒸馏、大模型部署）一站式掌握；

• 能够完成时下热门大模型垂直领域模型训练能力，提高程序员的编码能力：大模型应用开发需要掌握机器学习算法、深度学习框架等技术，这些技术的掌握可以提高程序员的编码能力和分析能力，让程序员更加熟练地编写高质量的代码。

👉获取方式：
😝有需要的小伙伴，可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓
在这里插入图片描述

黑客-雨

关注

30
点赞
踩
16

收藏

觉得还不错? 一键收藏
0
评论
新能源时代！看大模型（LLMs）如何助力汽车自动驾驶！

因为，ChatGPT出现才不到一年半的时间，现在的大模型已经可以实现视频生成（例如Sora）、音乐生成（例如：Stable Audio 2.0、Prompt-Singer等），且效果惊人，未来的自动驾驶大模型也将会乘风破浪，成为自动驾驶的主流核心技术。本文主要介绍大模型(LLMs)如何助力汽车自动驾驶，简单来说，作者首先带大家了解大模型的工作模式，然后介绍了自动驾驶大模型的3大应用场景，最后指出自动驾驶大模型将会是未来的发展趋势，只要坚持，国内新能源造车新势力还是很有机会的。那么什么是Token呢？
复制链接

扫一扫