微软开源Visual ChatGPT,7天斩获2.2万stars

微软近日开源了VisualChatGPT,它将ChatGPT与视觉模型结合,使用户能在ChatGPT聊天中发送和接收图像,增强了趣味性和应用范围。该项目自3月10日发布以来,已获得大量关注。VisualChatGPT可根据用户输入决定是否使用VFM进行图像处理,提供了全新的交互体验。
摘要由CSDN通过智能技术生成

点击“开发者技术前线”,选择“星标”

让一部分开发者看到未来

来自 | OSC开源社区(ID:oschina2013)

除了大力投资 Open AI ,微软还亲自下场大搞 AI 。7 天前,微软开源了 Visual ChatGPT ,这个软件可以连接 ChatGPT 和一系列视觉模型,以实现在 ChatGPT 的聊天过程中发送和接收图像。

众所周知,尽管 ChatGPT 的功能非常强大,甚至可以用来写小说写论文,但目前也仅限于文字交流。但表情包早已成为日常文本聊天不可或缺的功能。

Visual ChatGPT 的出现,就像在以文字交流的 APP 中首次添加了表情包功能,而且还是根据用户输入的文本自动生成的 “定制化表情包”,大大提升了 ChatGPT 的趣味性和应用领域。

e82284477570d101452215d7891a89e5.gif

一方面,ChatGPT(或 LLM)充当通用界面,提供对图像的理解和用户的交互功能。另一方面,基础图像模型通过提供特定领域的深入知识来充当背后的技术专家。

仓库中列出了技术架构及原理图:

58e1ce9d43c163659562ff623a8705fc.jpeg

Demo 中共进行了三种不同类型的对话,分别是 Visual ChatGPT 接收用户的图像、Visual ChatGPT 根据用户的文本修改图像并发送给用户,以及 Visual ChatGPT 识别图片,并回答用户的提问。Visual ChatGPT 会根据用户的输入,判断是否需要使用 VFM  (Visual Foundation Model,视觉基础模型)来处理该问题。

仓库中还给出了 Visual ChatGPT 所使用的图像模型和显存使用情况:

61152fb5e54367ec0082ad743fbccd5b.png

更详细的内容可以阅读 Visual ChatGPT 的 arxiv 论文:https://arxiv.org/abs/2303.04671

Visual ChatGPT 在 3 月 10 日发布,截至 3 月 16 日早 15 点,该项目已暂获 21.9K Stars ,可谓是火箭式上涨。

ba2e139830b3691f85263bb6765fc153.png

相关链接:https://github.com/microsoft/visual-chatgpt

— 完 —
点这里👇关注我,记得收藏订阅哦~

历史推荐

重磅!百度发布文心一言!对比 GPT-4现场实测,股价大跌10%,百度背水一战?

Docker翻脸暂停账户,强制收费,不再开源!

前端已死?2023 年前端十大 Web 趋势

好文点个在看吧

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值