《计算机视觉:模型、学习和推理》——第1章 绪论

本节书摘来自华章计算机《计算机视觉:模型、学习和推理》一书中的第1章,作者:(英)普林斯(Prince,J. D.)著, 更多章节内容可以访问云栖社区“华章计算机”公众号查看。

第1章 绪论

机器视觉旨在从图像中提取有用的信息,这已经被证实是一个极具挑战性的任务。在过去的四十年里,成千上万个聪慧和创造性的大脑致力于这一任务。尽管如此,我们还远远没有能够建立一个通用的“视觉机器”。
该问题的部分原因是可视数据复杂性所导致的。考虑图1-1中的图像。场景中有数百个物体。这些物体几乎都没有呈现出“特定”的姿态。几乎所有的物体都被部分遮挡。对于一个机器视觉算法,很难确定某个物体的结束和另一个物体开始的地方。譬如,背景中的天空和白色建筑物之间的边界上,图像在亮度上几乎没有变化。然而,即使没有物体的边界或材质的变化,前景中SUV后窗上的亮度也有明显的变化。
如果不是因为一个论证,我们可能已经对发展有用的计算机视觉算法的可能性感到沮丧。即我们有具体的证据证明计算机视觉是可研究的,因为我们自有的视觉系统能够毫不费力地处理如图1-1这样的复杂图像。如果要求你统计出该图像中的树的总数或绘制街道布局的草图,你可以很容易做到这点。甚至你可能通过提取微妙的视觉线索,比如人的种族、车和树的种类以及天气等,找出这张照片是在世界上哪个位置拍的。
image

图1-1 一个视觉场景包含许多物体,而几乎所有物体都是部分遮挡的。黑圈所示场景中几乎没有亮度的变化指示天空和建筑之间的边界。灰圈所示区域中有很大的亮度变化但这实际上跟亮度没关系,这里没有物体边界或物体材质的变化
因此,研究计算机视觉并非是不可能的,只是它非常具有挑战性。也许刚开始这并不能被大家重视,因为当我们看一个场景时,我们所能感知到的场景中的物体都已经是深加工过的。例如,在明亮的日光下观察一块煤炭,然后再到昏暗的室内看一张白纸,这一过程中眼睛从煤中单位面积上所接收到的光子数远远多于比从白纸上接收到的光子数。即便如此,我们仍然认为煤炭是黑的,纸是白的。脑视觉有很多这样的小把戏,但是,当我们建立视觉算法时,其不具备这种预处理效果。
尽管如此,广义理解的计算机视觉领域已取得显著进步,并在过去的十年里人们见证了计算机视觉技术在个人消费领域的首次大规模部署。例如,如今大多数数码相机已经嵌入人脸检测算法,在撰写本书时,微软Kinect(一种实时跟踪人体形态的外围设备)一直是销售最快的消费电子设备吉尼斯世界纪录的保持者。包括这两个在内的更多应用所涉及的原理在本书中都有详尽的解释。
计算机视觉近期的迅速发展有许多的原因。最为显而易见的原因是计算机的处理能力、内存以及存储能力有了巨大的提升。在鄙视早期计算机视觉先驱微小进步的时候,我们应该想到即使在内存中存储一幅高分辨率图片他们也需要专用硬件。该领域近期进步的另一个原因是机器学习的广泛使用。最近的20年见证了机器学习领域令人兴奋的发展,如今其已被广泛应用在视觉处理中。机器学习不仅提供了许多有用的工具,它还有助于我们以新的视角理解已知算法及其联系。
机器视觉的未来是令人激动的。随着我们日益增长的认识,人工视觉将会在未来十年里变得越来越流行。然而,这仍然是一个年轻的学科。处理如图1-1中复杂场景的工作直到最近仍是不可想象的。正如Szeliski(2010)所指出的,“计算机若要具备像两岁小孩那样能给出图片中所有物体名称和轮廓的能力,可能还得再过很多年。”然而,这本书提供了一张关于我们所取得成果的快照,以及这些成果背后的原理。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值