【AI周报】DeepMind用700亿打败大数据库；OpenAI的DALL·E可二次创作；CVPR 2022论文分享

极链AI云

已于 2022-04-11 13:50:43 修改

阅读量1.6k

点赞数

分类专栏： AI周报文章标签：深度学习人工智能计算机视觉神经网络

于 2022-04-08 18:47:07 首次发布

本文链接：https://blog.csdn.net/m0_60673947/article/details/124048456

版权

DeepMind通过训练优化得出700亿参数模型，挑战2800亿参数模型的效率。OpenAI的DALL·E 2不仅提升文本生成图像的能力，还引入图像编辑功能。MosaicML推出PyTorch库Composer，加速模型训练。CVPR 2022中，DLB自蒸馏框架降低训练成本，提升模型性能。

摘要由CSDN通过智能技术生成

01 行业大事件

语言模型参数越多越好？DeepMind用700亿打败自家2800亿，训练优化出「小」模型

给定固定的 FLOPs 预算，应该如何权衡模型大小和训练 token 的数量？DeepMind 得出了与先前不同的结论。

最近一系列大型语言模型 (LLM) 正在崛起，其中最大的语言模型已经拥有超过 5000 亿个参数。这些大型自回归 transformer 通过使用各种评估协议（例如零样本、少样本和微调），在许多任务中表现出令人印象深刻的性能。

然而训练大型语言模型需要消耗巨大的计算和能源，并且这种消耗随着模型的增加而增加。在实践中，研究者事先分配的训练计算预算通常是预先知道的：有多少加速器可用以及我们想要使用它们多长时间。通常这些大模型只训练一次是可接受的，因此准确估计给定计算预算的最佳模型超参数至关重要。

Kaplan 等人研究 (2020) 表明，自回归语言模型 (LM) 中的参数数量与其性能之间存在幂律关系。结果是该领域一直在训练越来越大的模型，期望性能得到改善。Kaplan 等人(2020) 得出的一个值得注意的结论是，不应该将大型模型训练到其可能的最低损失，以获得计算的最佳化。

来自 DeepMind 的研究者得出了相同的结论，但他们估计大型模型可以训练的 token 数应该比作者推荐的更多。具体来说，假设计算预算增加 10 倍，其他研究者建议模型的大小应该增加 5.5 倍，而训练 token 的数量应该只增加 1.8 倍。相反，DeepMind 发现模型大小和训练 token 的数量应该以相等的比例扩展。

最低0.47元/天解锁文章

极链AI云

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
【AI周报】DeepMind用700亿打败大数据库；OpenAI的DALL·E可二次创作；CVPR 2022论文分享

01 行业大事件语言模型参数越多越好？DeepMind用700亿打败自家2800亿，训练优化出「小」模型给定固定的 FLOPs 预算，应该如何权衡模型大小和训练 token 的数量？DeepMind 得出了与先前不同的结论。最近一系列大型语言模型(LLM) 正在崛起，其中最大的语言模型已经拥有超过 5000 亿个参数。这些大型自回归 transformer 通过使用各种评估协议（例如零样本、少样本和微调），在许多任务中表现出令人印象深刻的性能。然而训练大型语言模型需要消耗巨大的...
复制链接

扫一扫

专栏目录