阿里推出全新推理模型（因果语言模型），仅1/20参数媲美DeepSeek R1

AI仙人掌

已于 2025-03-09 11:43:23 修改

阅读量1.1k

点赞数 33

分类专栏：人工智能文章标签：深度学习自然语言处理人工智能语言模型开源

于 2025-03-06 08:49:27 首次发布

本文链接：https://blog.csdn.net/qq_36603091/article/details/146058004

版权

阿里Qwen 团队正式发布了他们最新的研究成果——QwQ-32B大语言模型！这款模型不仅名字萌萌哒(QwQ)，实力更是不容小觑！😎
QwQ-32B 已在 Hugging Face 和 ModelScope 开源，采用了 Apache 2.0 开源协议。大家可通过 Qwen Chat 直接进行体验！在这里插入图片描述

Qwen 团队却用320亿参数的 QwQ-32B，硬刚拥有6710亿参数的 DeepSeek-R1，并且在多项评测中取得了媲美甚至超越后者的惊人成绩！背后究竟是什么黑科技？答案就是——强化学习(Reinforcement Learning,RL)！

划重点：强化学习，大模型的新引擎！💪

Qwen 团队在博文中提到，他们深入探索了强化学习(RL)在提升大语言模型智能方面的巨大潜力。QwQ-32B 的成功发布，有力地证明了RL 是提升模型性能的强大引擎！

多项基准评测硬刚 DeepSeek-R1
官方给出基准评测结果，涵盖了数学推理、代码能力和通用问题解决等多个方面：
在这里插入图片描述
从数据中我们可以清晰地看到，在AIME24和IFEval等关键基准测试中，QwQ-32B 的表现甚至略微超过了参数量巨大的 DeepSeek-R1！而在其他基准测试中，也基本与 DeepSeek-R1 持平，远超其他对比模型。

这意味着 QwQ-32B 在仅有 DeepSeek-R1 约 1/20 参数量的情况下，用强化学习，实现了性能上的惊人跨越！

实例对比：我身高1.73米，拿着一根5.5米长的竹竿，能否通过高4米、宽3米的门？

这个问题目前只有腾讯元宝/问小白里的deepseek回答可以通过
在这里插入图片描述

技术揭秘：

冷启动+结果导向的强化学习策略

Qwen 团队在博文中也简单介绍了 QwQ-32B 背后的强化学习方法。他们采用了冷启动(cold-start checkpoint)的方式，并实施了结果导向(outcome-based rewards)的强化学习策略。

• 冷启动：从一个预训练模型的检查点开始训练。

• 结果导向：在初始阶段，主要针对数学和代码任务进行 RL 训练。

• 数学问题：使用准确率验证器(accuracy verifier)来确保答案的正确性。

• 代码生成：使用代码执行服务器(code execution server)来评估生成的代码是否能够成功运行。

• 通用奖励模型和规则验证器：后续阶段，会逐步引入更通用的奖励模型和规则验证器，提升模型在其他通用能力方面的表现。

这种策略的核心在于不依赖传统的奖励模型，而是直接根据任务结果（答案是否正确，代码是否运行成功）来指导模型的学习，更加高效和直接。

冷启动的基础上开展了大规模强化学习。在初始阶段，特别针对数学和编程任务进行了 RL 训练。与依赖传统的奖励模型（rewardmodel）不同，通过校验生成答案的正确性来为数学问题提供反馈，并通过代码执行服务器评估生成的代码是否成功通过测试用例来提供代码的反馈。随着训练轮次的推进，这两个领域中的性能均表现出持续的提升。在第一阶段的RL 过后，增加了另一个针对通用能力的 RL。此阶段使用通用奖励模型和一些基于规则的验证器进行训练。发现，通过少量步骤的通用RL，可以提升其他通用能力，同时在数学和编程任务上的性能没有显著下降。