介绍:主要考察模型在跨学科背景下理解和推导因果关系的能力。包括物理、化学、生物等在内的研究生级别科学数据集。 评价方式:基于参考答案的0/1评估,模型答案与参考答案一致得1分,反之得0分,不对回答过程进行评价。 1.海外头部奎断。 在科学推理任务中,海外模型包揽 了前四席,分别是GPT-5.2(high) (74.17分)、Claude-Opus-4.5- Rea soning(73.77分)和 Gemini-3- Pro-Preview(73.77分),国内仅有 DeepSeek-V3.2-Thinking进入前五名, Seed-1.8-251228(Thinking)紧随其后。 2.国内整体分布重心偏向中部。 整体偏后,在科学推理任务上,国 内整体更偏向于中部的位置,国内 大多数模型均分布于平均线附近。