突发！OpenAI发布最强模型o1：博士物理92.8分，IOI金牌水平

最新推荐文章于 2024-10-13 21:11:07 发布

可乐鸡翅面

最新推荐文章于 2024-10-13 21:11:07 发布

阅读量565

点赞数 8

文章标签：人工智能 word 语言模型大数据 embedding

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_72959097/article/details/142213620

版权

来了来了！刚刚，OpenAI新模型无预警上新：

o1系列，可以进行通用复杂推理，每次回答要花费更长时间思考。

在解决博士水平的物理问题时，GPT-4o还是“不及格”59.5分，o1一跃来到“优秀档”，直接干到92.8分！

没错，传说中的「草莓」，终于来与大家见面了！

CEO奥特曼称它是一种新范式的开始：可以进行通用复杂推理的人工智能。

具体来说，o1系列是OpenAI首个经过强化学习训练的模型，在输出回答之前，会在产生一个很长的思维链，以此增强模型的能力。

换句话说，内部思维链越长，o1思考得越久，模型在推理任务上的表现就越好。

o1有多强呢？CEO奥特曼直给了答案：

在刚刚结束的2024 IOI信息学奥赛题目中，o1的微调版本在每题尝试50次条件下取得了213分，属于人类选手中前49%的成绩。

如果允许它每道题尝试10000次，就能获得362.14分，高于金牌选手门槛，可获得金牌。

另外它还在竞争性编程问题 (Codeforces) 中排名前89%，在美国数学奥林匹克 (AIME) 预选赛题目中跻身美国前500名学生之列。

与GPT-4o相比，o1在数理化生、英语法律经济等各种科目都有不同成绩改进。

汇总官方发布的各种消息来看，这次突然发布的o1系列又分为三个型号：

o1，新的大模型天花板，过于强大目前不方便对外公开。

o1-preiview，o1的早期版本，可以立即提供给ChatGPT付费用户和API用户。

o1-mini，速度更快、性价比更高，适用于需要推理和无需广泛世界知识的任务。

不少OpenAI员工都分别用“系统1”和“系统2”思考来科普o1系列与之前模型的区别。

连长期休假中的总裁Brockman都“诈尸”回归了。

思维链提示方法的原作者Jason Wei表示，这一次不是纯粹通过提示来完成思维链，而是使用强化学习训练模型以更好地执行链式思考。

在深度学习的历史中，人们一直试图扩展训练阶段的计算，但思维链是自适应计算的一种形式，现在也可以在推理时扩展。

新模型做了很多类似人类的事情，比如将棘手的步骤分解为更简单的步骤、识别和纠正错误以及尝试不同的方法。

游戏已被完全重新定义。

o1：AI能力新天花板

通过训练，o1模型学会完善自己的思维过程，尝试不同的策略，并认识到自己的错误。

不过作为早期模型，它尚不具备ChatGPT的许多有用功能，例如联网搜索以及上传文件和图像。

但对于复杂的推理任务来说，这是一个重大进步，OpenAI称代表了人工智能的最高水平。

鉴于此，他们决定将计数器重置，并将该系列模型命名为OpenAI o1。

随着更多的强化学习（训练时计算）和更多的思考时间（测试时计算），o1 的性能持续提高，新的Scaling Law诞生了。

不过这种方法的Scaling受到的限制与普通预训练有很大不同，OpenAI正在继续研究它们。

o1思考起来是什么样子？可以从官网示例中的编写Bash脚本的编程任务一窥究竟。

首先作为对比，GPT-4o会直接就开始写代码，遗憾得到错误结果。

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

而o1-preiview会先用自己的理解复述一遍要求，然后开始拆解要求，明确最终目标。

接下来它会给自己定义任务、分析限制条件、列出需要用到的方法。

进一步把任务拆解成明确的数个小步骤。

最后才动手编写代码，并保证一次性得到正确结果。

OpenAI表示，o1系列可以帮医疗保健研究人员来注释细胞测序数据，帮助物理学家可以生成量子光学所需的复杂数学公式，所有领域的开发人员可以使用o1来构建和执行多步骤工作流程。

而且不是说说而已，OpenAI已经邀请相关的人类专家学者试用了一波。

马克思普朗克研究所的量子物理学者Mario Krenn，展示了GPT-4o不能回答但o1-preview正确完成计算的复杂量子物理问题。

除了考试和学术基准之外，团队还评估了人们对o1-preview与GPT-4o在开放问题上的偏好。

在数据分析、编码和数学等推理密集型类别中，o1-preview明显优于gpt-4o。

然而o1-preview在某些自然语言任务上并不是首选，这表明它并不适合所有场景。

OpenAI科学家Noam Brown分享了更详细的个人测试结果。

在上个月的ACL会议上有一个所有当时大模型都无法解决的逻辑难题。o1-preview能够做对，o1满血版几乎每次尝试都能做对。

目前o1花费在思考上的时间是几秒到十几秒，但OpenAI未来的改进方向不是缩短，反而是努力增加这个时间，

目标是让未来的版本思考几个小时、几天甚至几周。

推理成本会更高，但你会为一种新的抗癌药物付多少钱？为了电池的突破、黎曼猜想的证明又付多少？

人工智能可以不仅仅是聊天机器人

在这里插入图片描述

谁可以访问o1？

根据OpenAI官方说法，ChatGPT Plus和Team用户最早可在几个小时内可以体验到o1系列模型。

在发布时，o1-preview限制为每周30条消息，o1-mini每周50条。

API访问权限将首先给Tier 5级用户，也就是已经在OpenAI API上花费超过1000美元的人。

OpenAI正在努力提高这些速率，并使ChatGPT能够针对给定的提示自动选择合适的模型。

快打开ChatGPT看看你是不是第一波吃草莓的人吧

那么，如何系统的去学习大模型LLM？

我在一线互联网企业工作十余年里，指导过不少同行后辈。帮助很多人得到了学习和成长。

作为一名热心肠的互联网老兵，我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。

但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

所有资料 ⚡️ ，朋友们如果有需要全套《LLM大模型入门+进阶学习资源包》，扫码获取~

篇幅有限，部分资料如下：

👉LLM大模型学习指南+路线汇总👈

💥大模型入门要点，扫盲必看！
在这里插入图片描述
💥既然要系统的学习大模型，那么学习路线是必不可少的，这份路线能帮助你快速梳理知识，形成自己的体系。

路线图很大就不一一展示了 （文末领取）
在这里插入图片描述

👉大模型入门实战训练👈

💥光学理论是没用的，要学会跟着一起做，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。
在这里插入图片描述

👉国内企业大模型落地应用案例👈

💥两本《中国大模型落地应用案例集》 收录了近两年151个优秀的大模型落地应用案例，这些案例覆盖了金融、医疗、教育、交通、制造等众多领域，无论是对于大模型技术的研究者，还是对于希望了解大模型技术在实际业务中如何应用的业内人士，都具有很高的参考价值。 （文末领取）
在这里插入图片描述

👉GitHub海量高星开源项目👈

💥收集整理了海量的开源项目，地址、代码、文档等等全都下载共享给大家一起学习！
在这里插入图片描述

👉LLM大模型学习视频👈

💥观看零基础学习书籍和视频，看书籍和视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。 （文末领取）
在这里插入图片描述

👉640份大模型行业报告（持续更新）👈

💥包含640份报告的合集，涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师，还是对AI大模型感兴趣的爱好者，这套报告合集都将为您提供宝贵的信息和启示。
在这里插入图片描述

👉获取方式：

这份完整版的大模型 LLM 学习资料已经上传CSDN，朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【`保证100%免费`】

😝有需要的小伙伴，可以Vx扫描下方二维码免费领取🆓

可乐鸡翅面

关注

8
点赞
踩
15

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。