Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models

本文是LLM系列文章,针对《Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models》的翻译。

多模态大语言模型中推理的即插即用基础

摘要

以其先进的指令遵循和推理能力而闻名的多模态大型语言模型(MLLMs)的兴起,极大地推动了视觉推理领域的发展。然而,由于其图像标记化过程的局限性,大多数MLLM难以捕捉图像中文本和对象的精细细节,尤其是在高分辨率样本中。为了克服这一限制,我们引入了P2G,这是一种用于MLLMs即插即用接地的新框架。P2G利用MLLM的工具使用潜力,使用专家代理将推理动态地嵌入图像中的关键视觉和文本元素,从而通过多模态提示实现深思熟虑的推理。此外,我们开发了P2GB,这是一个基准测试,旨在评估MLLM在理解具有挑战性的高分辨率图像中的对象间关系和文本内容方面的熟练程度。在视觉推理任务上的大量实验证明了P2G的优越性,在具有7B主干的P2GB上实现了与GPT-4V相当的性能。我们的工作强调了在MLLMs中使用外部代理进行基础推理的潜力,为单纯的模型缩放提供了一种很有前途的替代方案。

1 引言

2 方法

3 P2GB基准

4 实验

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值