SWE-benchVerified 是由Princeton/OpenAl等维护的"软件工程基准",任务来自GitHub真实issue(需理解代码库、定位bug、编写 补丁、通过测试)。2024年顶尖模型仅~20%,2026年Q1ClaudeOpus 4.6/Gemini3.1Pro双双突破80%,首次跨越"工程师可放心 托付"的临界线。 ?Google追平 Claude系列长期占据SWE-bench榜 首,Claude Code与Cursor/Windsurft均 Gemini 3.1 Pro以80.6%追平Claude, 且推理成本低40%,成为Cursor等应用 GPT-5.4达80.0%, 在SWE-bench Pro 更难任务上与Claude不相上下,但代码 SWE-bench仅衡量"能否修bug",不衡量代码可读性、可维护性、工程直觉。Cursor/Copilot/Claude Code之间的差距更多体现在上 下文工程、编辑器交互、Agent框架等产品层能力,而非模型原始得分。SWE-bench Pro上所有主流模型仅~23%,暴露真实工程复 杂度远未被攻克。 www.data17.cn·Al编程行业研究报告