- 博客(21)
- 收藏
- 关注
原创 Hivt(2)
forward的结构很清晰,旋转矩阵是生成将所有目标转换到当前agent的旋转矩阵,forward过程有三步显示localencoder然后global interaction,最后decoder,与论文插图对应。然后来看local encoder。
2024-12-18 16:05:28
262
原创 Hivt预测方法(1)
设置随机种子:确保实验可复现。定义和解析命令行参数:使用来配置训练相关的参数(如批量大小、GPU 数量、最大训练轮数等)。初始化回调和训练器:设置模型检查点回调,监控特定的评估指标(如val_minFDE),并初始化 PyTorch Lightning 的训练器。创建模型和数据模块:实例化模型HiVT和数据模块。启动训练:通过启动模型训练过程。
2024-12-03 10:37:33
1359
1
原创 端到端UNIAD概述
backbone是多视角摄像头图像输入,经过BEV Former输出BEV特征,这个地方如果不是纯视觉方案应该也可以用BEV Fusion。
2024-11-18 20:43:50
866
原创 Bevformer(2)(完)
再获取历史bev特征以后,img_feats = self.extract_feat(img=img, img_metas=img_metas),开始提取图像特征,这个函数和获取历史bev特征的函数一样。这段代码前面是变换维度,核心是img_feats_list = self.extract_feat(img=imgs_queue, len_queue=len_queue)获取图像特征。这里调用了model字典里的pts_bbox_head,调用了BEVFormerHead类。上一篇写到获取历史Bev。
2024-11-12 17:16:36
620
原创 Bevformer(1)
讲Bevformer的人有很多,我只写我觉得比较关注的地方。整体结构很清晰,也很简单,输入源为多视角摄像头的图像,经过backbone网络提取特征,BEV Queries Q和历史BEV做TSA,时间维度上的自注意力特征提取,然后和图像特征做空间维度SCA相互注意力提取。最后检测分类。看起来和detr有点像,但是TSA和SCA有很多细节不一样。
2024-11-08 17:00:15
503
原创 carla学习(2)-- 基本概念
以下内容翻译自官方文档,https://carla.readthedocs.io/en/latest/core_world/
2024-10-17 10:54:29
290
原创 学习DETR的记录(1)
看了好久,还是感觉似懂非懂,整理一下。DETR是一种端到端的目标检测,减少了预设anchor和nms等过程。上一张论文框架图整体结构很清晰,backbone提取特征,直接和position embedding相加,过transformer encoder和decoder,然后每一个query会经过FFN进行分类和边框回归。大致流程就是这样。
2024-10-14 16:17:27
744
自适应MPC的卡尔曼估计
2023-12-01
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅