
在一片键盘敲击声中,174名北京大学化学专业的学生正与一群无形的对手进行着较量——GPT、Gemini、DeepSeek等全球顶尖AI模型在云端与他们同步解答着同一套化学试题。
北大化学与分子工程学院的这场特殊“期中考”,成了一场精心策划的图灵测试。这场测试背后的SUPERChem基准评测项目由北京大学化学与分子工程学院联合计算中心、计算机学院、元培学院团队共同完成。
测试结果显示,北大化学专业低年级本科生的平均准确率为40.3%,而参与评测的顶尖AI模型成绩仅与这一水平相当。
特殊考场
北京大学化学与分子工程学院的有机化学考试一直以挑战性著称。但今年的考试通知中出现了一条不同寻常的提示:“请注意,本次考试范围不仅限于有机化学。”
比起考试范围的扩展,考场上迎来的“特殊考生”更令人意外。GPT、Gemini、DeepSeek等全球顶尖AI模型,正在云端与174名北大化学专业的大二学生同步答题。
这些AI不需要座位,也不需要纸笔,却在与人类进行着一场无声的化学推理较量。这是一场精心设计的“图灵测试”,也是北大科研团队为衡量大语言模型在科学推理上的真实能力而设置的一道门槛。
这场测试不仅是AI与人类学生的竞赛,更是对当前人工智能在专业科学领域能力的一次系统性评估。
防作弊设计
要评估AI真正的化学推理能力,最大的挑战是如何避免它们依赖记忆。研究团队成员解释道:“因为大模型太会‘背书’了。”
现有化学领域的基准测试多关注基础化学能力和化学信息学任务,而缺乏对深度化学推理能力的系统考察。团队需要设计一套让AI“没见过”,必须依靠真实推理能力才能解答的题目。
SUPERChem的500道题目,源于高难度非公开化学竞赛模拟题、北大化院内部试题及专业文献改编。题库覆盖了结构与性质、化学反应与合成、化学原理与计算、实验设计与分析四大化学核心领域。
这些题目不仅考察化学知识,更侧重对**微观世界的空间想象和严密逻辑推演**。
学术游戏化共创
为了构建这套高质量评估题库,近百名北大师生参与其中,其中不乏国际化学奥林匹克获奖选手。他们将枯燥的命题工作变成了一场“学术游戏”。
团队搭建了一个专属协作平台,将出题、审题、修题变为循序渐进的“通关”流程。平台引入了积分激励系统,出题者如同在游戏中打怪升级。
一道题目从初稿编写到解析撰写,需经过初审与终审的严格审核,每个环节都有专人把关。终审通过的题目,甚至最多迭代过**15个版本**。
这种严谨的协作流程,确保了题目的科学性和防作弊特性,使AI无法通过简单的模式匹配来获得正确答案。
性能揭晓
考试结果揭晓,揭示了当前AI在专业科学领域的真实能力边界。作为人类基准,参与测试的174名北大化院本科生在闭卷条件下取得了40.3%的平均准确率。
AI的表现如何?在参与测试的前沿模型中,表现最佳的GPT-5准确率为38.5%,Gemini-2.5-Pro为37.9%,开源模型DeepSeek-V3.1-Think则为37.3%。这意味着即使是最先进的AI模型,其化学推理能力也仅与化学专业低年级本科生水平相当。
更关键的是,研究发现即使AI选对了答案,其解题步骤也常常经不起推敲。为此,团队为每道题目标注了详细的评分规则,通过评估推理路径一致性指标,能够有效区分模型是真正“理解”化学原理,还是仅凭启发式猜测偶然答对。
多模态困境
化学是一门需要处理丰富视觉信息的学科,分子结构、晶体结构图等都蕴含着解题的关键信息。然而测试结果暴露了AI在处理这类信息时的一个矛盾现象。
对部分模型而言,当题目引入图像信息时,其准确率**不升反降**。研究团队发现,随着模型推理能力的不同,视觉信息的影响方向与程度也不一。
对于推理能力较强的模型,图像输入可以带来准确率的提升;但对于推理能力较弱的模型,图像信息反而会成为干扰。这反映出当前AI在**将视觉信息转化为化学语义**时仍存在明显瓶颈。
推理断点分析
通过进一步的推理断点分析,研究团队发现AI的失败并非源于后续复杂计算步骤,而是主要集中在几个关键环节。AI的推理链条往往断裂于**产物结构预测、反应机理识别以及构效关系分析**等高阶任务。
尽管当前顶尖AI模型拥有海量的知识储备,但在处理需要严密逻辑和深刻理解的化学核心问题时,仍显得力不从心。这反映出它们虽然具备较强的计算与公式推导能力,但在涉及反应性与分子结构理解的化学核心任务上存在明显短板。
研究团队指出,这种表现差异表明当前大语言模型的智能呈现出明显的“锯齿状”分布——在某些领域表现卓越,在其他领域却存在明显弱点。
开源与共享
SUPERChem基准测试项目的诞生,填补了化学领域多模态深度推理评测的空白。但研究团队强调,发布这项成果的目的并非为了证明AI的短板,而是为了推动它走得更远。
“从通用的聊天机器人,到能够理解构效关系、推演反应机理的专业科学助手,中间还有很长的一段路要走。”团队成员表示,“那是从‘记住知识’到‘理解物理世界’的跨越。”
目前,SUPERChem项目已全面开源。团队希望这套源自北大的“试卷”能成为全球科学与人工智能领域的公共财富,促进技术的进步。或许在不久的将来,当研究者再次打开这套试卷时,AI能够交出一份满分的答卷。