大脑视觉信号被Stable Diffusion复现图像!“人类的谋略和谎言不存在了” | CVPR2023...

点击上方“小白学视觉”,选择加"星标"或“置顶

重磅干货,第一时间送达

前言

 

现在Stable Diffusion已经能重建大脑视觉信号了!就在昨晚,一个听起来细思极恐的“AI读脑术”研究,在网上掀起轩然大波。

转载自丨量子位

72741b2ee7c52b0bb1bec229e44fdb9e.png

这项研究声称,只需用fMRI(功能磁共振成像技术,相比sMRI更关注功能性信息,如脑皮层激活情况等)扫描大脑特定部位获取信号,AI就能重建出我们看到的图像!

4a377faf282d8c1ab305c5303e94e261.png

例如这是一系列人眼看到的图像,包括戴着蝴蝶结的小熊、飞机和白色钟楼:

39d2a671759e8e3187a112c636267cbc.png

AI看了眼人脑信号后,立马就给出这样的结果,属实把该抓的重点全都抓住了:

46c5cd4b1adefbe53d8366382f5bb8a9.gif

再发展一步,这不就约等于哈利波特里的读心术了吗??

80ea8f378cf8dab59dcb0731a3edc245.png

更有网友感到惊叹:如果说ChatGPT开放API是件大事,那这简直称得上疯狂。

f057ae25a96d959849c4d13dbbe0c356.png

所以,这究竟是怎么一回事?

用Stable Diffusion可视化人脑信号

这项研究来自日本大阪大学,目前已经被CVPR 2023收录:

57155ba9f9011ad21e95afc37aebb7c5.png

研究希望能从人类大脑活动中,重建高保真的真实感图像,来理解大脑、并解读计算机视觉模型和人类视觉系统之间的联系。

要知道,此前虽然有不少脑机接口研究,致力于从人类大脑活动中读取并重建信号,如意念打字等。

然而,从人类大脑活动中重建视觉信号——具有真实感的图像,仍然挑战极大。

例如这是此前UC伯克利做过的一项类似研究,复现一张人眼看到的飞机片段,但计算机重建出来的图像却几乎看不出飞机的特征:

a5ef08342cdb07544ce068024745b7d6.png
图源UC伯克利研究Reconstructing Visual Experiences from Brain Activity Evoked by Natural Movies

这次,研究人员重建信号选用的AI模型,是这一年多在图像生成领域地位飞升的扩散模型

当然,更准确地说是基于潜在扩散模型(LDM)——Stable Diffusion。

整体研究的思路,则是基于Stable Diffusion,打造一种以人脑活动信号为条件的去噪过程的可视化技术。

它不需要在复杂的深度学习模型上进行训练或做精细的微调,只需要做好fMRI(功能磁共振成像技术)成像到Stable Diffusion中潜在表征的简单线性映射关系就行。

它的概览框架是这样的,看起来也非常简单:

仅由1个图像编码器、1个图像解码器,外加1个语义解码器组成。

99c11b6d161f9cd08248c38733482c90.png

具体怎么work?

如下图所示,第一部分为本研究用到的LDM示意图。

其中ε代表图像编码器,D代表图像解码器,而τ是一个文本编码器(CLIP)。

2ee90b2a40e591b2b229f5e4596144a9.png

重点是解码分析,如下图所示,模型依次从大脑早期(蓝色)和较高(黄色)视觉皮层内的fMRI信号中,解码出重建图像(z)和相关文本c的潜在表征。

然后将这些潜在表征当作输入,就可以得到模型最终复现出来的图像Xzc

10bba1a199871b7f99d42bd53c755e9d.png

最后还没有完,如编码分析示意图,作者还构建了一个编码模型,用来预测LDM不同组件(包括图像z、文本c和zc)所对应的fMRI信号,它可以用来理解Stable Diffusion的内部过程。

fcdc64ecf06d8e2eb75a8171df7df06a.png

可以看到,采用了zc的编码模型在大脑后部视觉皮层产生的预测精确度是最高的。(zc是与c进行交叉注意的反向扩散后,z再添加噪声的潜在表征)

3edaa467be6d0448c470f996f6c8ce95.png

相比其它两者,它生成的图像既具有高语义保真度,分辨率也很高。

67923412a5a4a878af576a48a5332deb.png

还有用GAN重建人脸图像的

看完这项研究,已经有网友想到了细思极恐的东西:

这个AI虽然只是复制了“眼睛”所看到的东西。

但是否会有一天,AI能直接从人脑的思维、甚至是记忆中重建出图像或文字?

359d346aa47cb84fc7bbcdfef4997169.png

“语言的用处不再存在了”

0e9b07348d0718bb8d9987e17b959f9c.png

于是有网友进一步想到,如果能读取记忆的话,那么目击证人的证词似乎也会变得更可靠了:

8047886f0958e8bb628bec1a0fc2977f.png

还别说,就在去年真有一项研究基于GAN,通过fMRI收集到的大脑信号重建看到的人脸图像:

1e4a9ab3a092e4409606489a18319ad3.png

不过,重建出来的效果似乎不怎么样……

a931cdc930e1dcd3375dbfb434e772c3.png

显然,在人脸这种比较精细的图像生成上,AI“读脑术”还有很长一段路要走。

对于这种大脑信号重建的研究,也有网友提出了质疑。

例如,是否只是AI从训练数据集中提取出了相似的数据?

080b4bf7b0408bc99fd7cda87ae77361.png

对此有网友回复表示,论文中的训练数据集和测试集是分开的:

d3cfb89ba2d16a1f32e2d29ed299105c.png

作者们也在项目主页中表示,代码很快会开源。可以先期待一下~

6b66ebd7aa5cf0bce478d8a5fde39774.png

作者介绍

本研究仅两位作者。

一位是2021年才刚刚成为大阪大学助理教授的Yu Takagi,他主要从事计算神经科学和人工智能的交叉研究。

最近,他同时在牛津大学人脑活动中心和东京大学心理学系利用机器学习技术,来研究复杂决策任务中的动态计算。

另一位是大阪大学教授Shinji Nishimoto,他也是日本脑信息通信融合研究中心的首席研究员。

研究方向为定量理解大脑中的视觉和认知处理,谷歌学术引用3000+次。

97f05a7dbab49cd0658bb608b8cc14a8.png

那么,你觉得这波AI重建图像的效果如何?

项目地址:
https://sites.google.com/view/stablediffusion-with-brain/

参考链接:
[1]https://twitter.com/SmokeAwayyy/status/1631474973243236354
[2]https://twitter.com/blader/status/1631543565305405443
[3]https://news.berkeley.edu/2011/09/22/brain-movies/
[4]https://www.nature.com/articles/s41598-021-03938-w

下载1:OpenCV-Contrib扩展模块中文版教程

在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。


下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。


下载3:OpenCV实战项目20讲
在「小白学视觉」公众号后台回复:OpenCV实战项目20讲,即可下载含有20个基于OpenCV实现20个实战项目,实现OpenCV学习进阶。


交流群

欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值