METR 研究显示在 2 个小时内的编程任务中,Claude 3.5 Sonnet 和 o1-preview表现均优于人类专家。根据 METR (Model Evaluation and Threat Research) 研究结果,AI 编程速度能以超越人类 10 倍速度生成并测试各种方案。给定 2 个小时,Claude 3.5 Sonnet 和 o1-preview 在 7 项具有挑战性研究工程中,击败了 50 多名人类专家。在一个需要编写自定义内核以优化前缀和运算的任务中,o1-preview 不仅完成了任务,还创造了惊人的成绩:将运行时间压缩到 0.64 毫秒,甚至超越了最优秀的人类专家解决方案(0.67 毫秒)。