ICLR2024：大视觉语言模型中对象幻觉的分析和缓解

汨攸

已于 2024-09-06 17:43:56 修改

阅读量656

点赞数 3

文章标签：语言模型人工智能自然语言处理 nlp 深度学习 LLM

于 2024-09-06 17:39:05 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_52965867/article/details/141965207

版权

https://arxiv.org/pdf/2310.00754

https://github.com/YiyangZhou/LURE

背景

对象幻觉：生成包含图像中实际不存在的对象的描述

早期的工作试图通过跨不同模式执行细粒度对齐（Biten et al.，2022）或通过数据增强减少对象共现模式（Rohrbach et al.，2018； Kim et al.，2023）来解决小规模多模态预训练模型中的对象幻觉问题。最近的一些工作（Li et al.，2023c；Liu et al.，2023a；d）研究了通过增强用于微调的数据集的质量来减少LVLM中的对象幻觉。

经验和理论发现都揭示了对象幻觉可以归因于三个关键因素：共现、不确定性和对象位置。

首先，如果训练数据包含对象之间的虚假共现模式，语言模型可能会基于这些学习到的虚假关联生成输出，从而导致幻觉描述。

其次，在生成过程中，幻觉更频繁地发生在以高不确定性为特征的对象上。

最后，位置因素也发挥了作用，因为由于误解的积累，更多的对象幻觉倾向于出现在生成描述的后半部分。

贡献

提出了轻量级的后处理方法LVLM幻觉审阅器（LURE），通过重建较少幻觉的描述来事后纠正LVLM中的对象幻觉

LURE开发了一个对象幻觉审校器。这个审校器将潜在的幻觉描述作为输入，并将它们转换为准确的。

在这里插入图片描述

为了创建审校器，我们首先使用GPT-3.5生成一个幻觉数据集，方法是对原始正确的标题进行两次修改：

（1）在描述中插入额外的对象文本，这些文本很可能与初始描述中包含的对象共同出现。这种修改允许LURE学习有效地解开这种共现模式；

（2）用占位符支架替换不确定的对象或描述末尾的对象，鼓励审校器重新评估这些对象。

最后，我们利用获得的幻觉数据集训练我们的幻觉审校器。一旦经过训练，审校器可以与任何LVLM无缝集成，以纠正潜在的幻觉描述。

实验

为了验证我们的方法的性能增益不是来自于使用额外的数据来训练修订器，我们使用额外的数据集微调了原始LVLM

在这里插入图片描述
幻觉因素是否有助于性能增益？为了证明考虑共现、不确定性和物体位置在减少幻觉方面的影响，我们进行了消融实验，并在表4中报告了结果，其中“原始”代表了MiniGPT-4的描述。

在消融实验中，我们在没有三个因素的情况下训练和部署了修正器，一次一个。结果表明，所有三个因素都有助于训练一个强大的幻觉修正器来减少物体幻觉

在这里插入图片描述

关注

3
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

汨攸 CSDN认证博客专家 CSDN认证企业博客

码龄4年

西安交通大学

28: 原创

105万+: 周排名

4万+: 总排名

1万+: 访问

: 等级

565: 积分

130: 粉丝

192: 获赞

3: 评论

187: 收藏

私信

关注

热门文章

分类专栏

笔记 7篇
数据结构 1篇

最新评论

ICLR2024：大视觉语言模型中对象幻觉的分析和缓解
alankuo: 不错的分享，多谢了！
幻觉消除论文阅读：通过诱导幻觉缓解大型语言模型的幻觉
CSDN-Ada助手: 你好，CSDN 开始提供 #论文阅读# 的列表服务了。请看：https://blog.csdn.net/nav/advanced-technology/paper-reading?utm_source=csdn_ai_ada_blog_reply 。如果你有更多需求，请来这里 https://gitcode.net/csdn/csdn-tags/-/issues/34?utm_source=csdn_ai_ada_blog_reply 给我们提。
解决module ‘tensorflow.python.ops.array_ops‘ has no attribute ‘stack‘
普通网友: 大佬高质量文章，图文并茂，逻辑清晰，受益匪浅，期待大佬新作。【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
解决module ‘tensorflow.python.ops.array_ops‘ has no attribute ‘stack‘
CSDN-Ada助手: 不知道 Python入门技能树是否可以帮到你：https://edu.csdn.net/skill/python?utm_source=AI_act_python
【图】DFS实现拓扑排序
CSDN-Ada助手: 恭喜您写了第9篇博客！标题看起来很有趣，我对DFS实现拓扑排序很感兴趣。您一直持续创作真是令人钦佩。如果可以的话，我希望您能继续分享一些关于DFS的应用场景或者其他常用的图算法实现。谦虚地说，我相信您一定有更多精彩的内容可以与我们分享。期待您的下一篇博客！

大家在看

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。