今年,复旦大学的研究团队独辟蹊径,将目光聚焦在全新出炉的2024高考数学试卷上,并开创性地提出用高考题来评测大模型!
这无疑是一个极具创意和挑战性的尝试。
在这次评测中,阿里千问和讯飞星火分别获得了2024高考数学新Ⅰ卷的第一名和第二名,以及高考数学新Ⅱ卷的第二名和第一名。
两份考卷的评测中,GPT-4o均列第三名。GPT-4o居然只得了第三名?
GPT-4o深夜发布!Plus免费可用!https://www.zhihu.com/pin/1773645611381747712
没体验过OpenAI最新版GPT-4o?快戳最详细升级教程,几分钟搞定:
升级ChatGPT-4o Turbo步骤https://www.zhihu.com/pin/1768399982598909952
在新Ⅰ卷中,阿里千问和讯飞星火对14道数学客观题的准确率达到70%以上,大幅领先GPT-4o的57%。
字节豆包、智谱清言、百川等大模型紧随其后,准确率超过50%。 而在新Ⅱ卷的评测中,讯飞星火、阿里千问、GPT-4o的准确率均超过60%,
其他大模型的差距较小,除百川、DeepSeek和海螺之外,准确率均在50%以上。
最关键的是,数学能力一直是GPT-4o引以为傲的模块。
OpenAI在5月14日的发布会上推出大语言模型GPT-4o时,曾重点演示其数学能力!
本文教你如何使用WildCard正确方式打开GPT-4o,目前 WildCard 支持的服务非常齐全,可以说是应有尽有!
官网有更详细介绍:WildCard
推荐阅读: