介绍:主要考察模型运用数学概念和逻辑进行多步推理和问题解答的能力。包括但不限于几何学、代数学、概率论与数理统计等竞赛级别数据集。 评价方式:基于参考答案的0/1评估,模型答案与参考答案一致得1分,反之得0分,不对回答过程进行评价。 1.国内头部模型追平。 取得80.87分,并列全球第一 Kimi-K2.5-Thinking也以77.39分位 居全球第四,体现了国内模型在数 学推理领域的突破性进展。 2.国内整体梯队靠后。 数学推理Top10中,国内模型仅占4 席,海外模型密度更高;国内大多 数模型集中在平均分(67.49分)附 近的后半段,与国际顶尖模型差距