AI解读清明上河图--Caption Anything 细粒度可控的图像描述

我爱计算机视觉

于 2023-04-20 12:19:40 发布

阅读量785

点赞数

文章标签：人工智能

原文链接：https://mp.weixin.qq.com/s?__biz=MzIwMTE1NjQxMQ==&mid=2247613084&idx=3&sn=814dacd02aad8517458f5b19d8329ac5&chksm=96f148c8a186c1de1c43884f34056dda6e765f4a7f41b22f50bff1c815e5b18340fdb4a33386&scene=126&sessionid=0

版权

关注公众号，发现CV技术之美

清明上河图

近日南方科技大学和腾讯ARC Lab开源了一款交互式图像描述工具, 基于Segment Anything, BLIP-2 Captioning和chatGPT实现, 通过视觉控制(鼠标点击)获取特定区域的object, 并以多样化的语言风格描述出来.

传统图像描述或密集描述通常以解析全图为目的, 如果遇到清明上河图等场景丰富且object交互特别复杂的图像, 一个简单的句子或非常长的段落, 对用户阅读很不友好. Caption Anything想看哪里即点击哪里, 根据用户需求定制化地关注局部区域, 进行细节描述及后续推理任务. 同时具有速度优势.

描述一幅图是一对多的映射, 不同用户对图像区域关注重点不同, 语言风格需求也不同. 面对如此多样的文本输出空间, 交互式控制模型输出可以与用户的需求更加对齐. 如下图所示, Caption Anything提供了视觉控制和语言控制.

Caption Anything支持视觉控制和语言控制

用户界面: 支持鼠标点击(连续或单次点击), 输出描述的语言风格控制(情感, 语种, 想象), 利用chatGPT输出物体对应的wiki知识, 同时支持chatGPT进行对话. 代码同时支持Linux和Windows平台.

用户界面

Github: https://github.com/ttengwang/Caption-Anything

Hugging Face Demo: https://huggingface.co/spaces/TencentARC/Caption-Anything

本文为粉丝投稿。投稿邮箱 amos@52cv.net。

知乎链接：https://zhuanlan.zhihu.com/p/622314514

END

欢迎加入「图像字幕」交流群👇备注：IC

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。