大模型参与高考能力测试，阿里通义千问夺冠-99科技

6月19日，上海人工智能实验室旗下的司南评测体系OpenCompass公布了一项引人注目的测试结果：其首次针对七个大模型进行的高考“语文、数学、外语”全卷能力测试圆满结束。这一测试旨在全面评估大模型在复杂、综合性任务中的表现，进而反映其在处理现实世界问题时的智能水平。

据悉，此次测试的三科总满分为420分。在激烈的竞争中，阿里通义千问2-72B模型以303分的优异成绩荣登榜首，展现了其在高考模拟环境中的强大实力。紧随其后的是OpenAI的GPT-4o模型，它以296分的成绩紧随其后，再次证明了其在自然语言处理领域的领先地位。上海人工智能实验室的书生·浦语2.0模型则以出色的表现位列第三，进一步巩固了国内在大模型研究领域的领先地位。

这三大模型的得分率均超过了70%，展现了不俗的实力。相比之下，来自法国大模型初创公司的Mistral则排名末尾。

参与此次评测的模型来源广泛，包括阿里巴巴、零一万物、智谱AI、上海人工智能实验室、法国Mistral的开源模型，以及OpenAI的闭源模型GPT-4o。

为确保公平，实验室特别指出，由于无法确定闭源模型的更新时间，评测中仅将GPT-4o作为参考，并未纳入商用闭源模型。同时，所有参与评测的模型均在高考前（2024年4月-6月）开源，有效避免了“刷题风险”。

从评测结果来看，大模型在语文和英语方面的表现普遍较好，但在数学方面则普遍不及格。最高分仅为75分，由书生·浦语2.0获得，紧随其后的是GPT-4o的73分。语文方面，通义千问表现出色，而英语则由GPT-4o领跑。

数学成绩的不理想凸显出大模型在复杂推理能力方面的不足。这一能力是金融、工业等要求可靠场景落地所需的关键能力，也是大模型未来发展的重要方向。

大模型参与高考能力测试，阿里通义千问夺冠

《地下城与勇士：起源》手游下架部分安卓渠道

襄阳汽车职业技术学院打造全国首个“双万兆”校园

文章聚合

美国媒体：NASA无法研究中国带回的月球月背样品背后原因极其愚蠢

洪州大桥：世界级桥梁工程正式通车

微软Windows天气应用全新升级：首页焕新设计，信息展示更加全面

韩国釜山人口萎缩风险加剧，成为首个显现“消失阶段”迹象的大城市

三星Galaxy Ring智能戒指功能：集成心率、压力、体温监测等

河南许昌：女子错转226万元货款至陌生阿姨账户，对方全数退还

安耐美发布全新风晶凌LIQMAXFLO一体水散热器

华为宣布：Apollo Version即将发布，引领5G-A时代新篇章

Cybertruck越野旅行车与FSD自动驾驶技术新突破成焦点

TechInsights：2024年全球智能手机换机率将不再以北美为首

相关文章：