Ray，面向新兴AI应用的分布式框架

最新推荐文章于 2024-07-13 13:03:08 发布

「已注销」

最新推荐文章于 2024-07-13 13:03:08 发布

阅读量1.2k

点赞数 1

文章标签：分布式 java 大数据人工智能编程语言

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u011387521/article/details/108114594

版权

Ray是一款旨在解决新兴AI应用性能和弹性需求的分布式框架，支持动态执行引擎，融合了Task和Actor计算模型。通过自底向上的分布式调度与内存分布式对象存储，Ray实现了每秒百万级任务调度，适用于训练、模拟和服务。此外，Ray还提供了无状态Task和有状态Actor的编程模型，简化了分布式系统的开发和维护。

摘要由CSDN通过智能技术生成

下一代AI应用需要不断和环境进行交互，并且在交互中学习。这些应用暴露了新的系统需求：性能和弹性。本文提出了Ray解决上述问题。

Ray实现了动态执行引擎，可以表达任务并行和actor模型计算任务。它通过分布式调度器以及分布式容错存储来实现高性能与容错。

问题与方案

AI中的监督学习部分，已经出现了优秀的深度学习框架，使用定制的硬件加速计算。但是对于新兴的AI应用不仅要收集探索数据，还要采取动作不断和环境交互学习，这一类可以概括为强化学习。

强化学习提出了新的系统需求：

1.支持细粒度计算2.支持动态执行，RL需要模拟3.支持多样的资源：时间、CPU、内存等

因此，新兴RL应用需要动态计算框架，每秒处理百万级任务且延迟在毫秒级。

当前的一些框架无法完全满足上面的要求：

1.像MapReduce、Spark、Dryad一类BSP模型框架不支持细粒度模拟或策略服务2.CIEL和Dask的任务并行框架对分布式训练和模型服务支持很少3.分布式深度学习框架TensorFlow、MXNet不天然支持模拟和服务

因此，如果要开发端到端解决方案，需要使用不同的计算组件，分布式训练、模拟、模型服务等都需要一个组件。这种方法会带来大量的开发负担，而且系统紧耦合，不实用。

所以，Ray的目标是成为一款通用的计算框架，同时支持RL中的模拟、训练和服务这些需求。计算负载包括模拟这样的轻量、无状态的计算，也包括像训练这样长时、有状态的计算任务。对于无状态任务，Ray提供了Task抽象，对于有状态任务，Ray提供了actor抽象。这些抽象是建立在底层动态执行引擎上的。

Ray的贡献如下：

1.设计和实现了第一个统一训练、模拟和服务的分布式框架2.基于动态执行引擎实现了task和actor并行抽象3.将控制状态存储在共享的元数据存储中，其它系统组件都是无状态的4.自底向上的分布式调度策略

编程与计算模型

Ray实现了动态任务图计算模型，将应用建模成调度

最低0.47元/天解锁文章

「已注销」

关注

1
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。