1.推理能力整体已高度对齐。 在数学推理和科学推理两大任务上, 海内外整体的平均分差距不大,整 体的推理能力相当。具体而言,国 内模型在数学推理有微弱领先,海 外模型在科学推理领先较多,主要 是头部模型的领先。 2.国内模型在代码和智能体任 大任务上,国内模型平均超过海外 两分以上。具体而言,在代码生成 任务上,国内模型整体趋于中上游 的位置,更有国内顶尖模型摘得桂 冠;在智能体任务上,国内模型整 外头部模型还存在一定的差距。 3.精确指令遵循和幻觉控制是 国内模型的短板。 不如海外模型。具体而言,精确指 令遵循是二者相差最大的维度,平 均分差超过7分,幻觉控制平均分 差近2分。