深度学习 -> 强化学习 ->迁移学习(杨强教授报告)

本文介绍了深度学习的局限性,包括表达能力限制和缺乏反馈机制,并提出强化学习和迁移学习作为解决方案。强化学习是智能系统通过与环境互动最大化奖励信号的学习,而迁移学习则解决数据量大小和有偏数据的问题,通过模型在不同领域的迁移应用。文中还探讨了四种迁移学习的方法:样本迁移、特征迁移、模型迁移和关系迁移,并指出它们在解决小数据和个性化问题上的潜力。
摘要由CSDN通过智能技术生成

李宏毅机器学习课程-Transfer Learning
深度学习 -> 强化学习 ->迁移学习(杨强教授报告)

链接: http://pan.baidu.com/s/1nu6DMRn 密码: an9q
深度学习的局限

表达能力的限制。因为一个模型毕竟是一种现实的反映,等于是现实的镜像,它能够描述现实的能力越强就越准确,而机器学习都是用变量来描述世界的,它的变量数是有限的,深度学习的深度也是有限的。另外它对数据的需求量随着模型的增大而增大,但现实中有那么多高质量数据的情况还不多。所以一方面是数据量,一方面是数据里面的变量、数据的复杂度,深度学习来描述数据的复杂度还不够复杂。

缺乏反馈机制。目前深度学习对图像识别、语音识别等问题来说是最好的,但是对其他的问题并不是最好的,特别是有延迟反馈的问题,例如机器人的行动,AlphaGo下围棋也不是深度学习包打所有的,它还有强化学习的一部分,反馈是直到最后那一步才知道你的输赢。还有很多其他的学习任务都不一定是深度学习才能来完成的。

针对深度学习的局限性,或许强化学习和迁移学习能够解决相应的问题。

这里写图片描述

强化学习是什么?

强化学习(Reinforcement Learning),就是智能系统从环境到行为映射的学习,以使奖励信号(强化信号)函数值最大。
强化学习不同于连接主义学习中的监督学习,主要表现在教师信号上,强化学习中由环境提供的强化信号是对产生动作的好坏作一种评价(通常为标量信号),而不是告诉强化学习系统RLS(reinforcement learning system)如何去产生正确的动作。由于外部环境提供的信息很少,RLS必须靠自身的经历进行学习。
通过这种方式,RLS在行动-评价的环境中获得知识,改进行动方案以适应环境。

之前ALPHGO 大战 李世石 4:1

这里写图片描述

目前的 Master 大战中日韩围棋世界冠军 60: 0

评论 5
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值