- 博客(1)
- 收藏
- 关注
原创 CVPR2024—Monkey模型
大型多模态模型(LMMs)在视觉任务中有不错的表现,但在高分辨率输入和详细场景理解方面存在困难。为了解决上述两个主要问题,文章提出了一个Monkey模型来增强LMM的功能,Monkey模型主要提出下述两个部分的增强:1、首先,Monkey通过将输入图像分成均匀的小块来处理图像,每个块与训练有素的视觉编码器的原始训练中使用的大小相匹配(例如448*448)。Monkey为每个patch配置单独的适配器,可以处理高达1344*896像素的更高分辨率,从而能够详细捕获复杂的视觉信息。2、其次,
2025-09-30 17:52:12
892
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅