AI Scientist的能力究竟如何?复旦NLP组通过一系列系统性基准测试给出了答案——CL-BENCH上所有模型平均解决率仅17.2%,CCTU复杂工具使用任务完成率低于20%,SciAgentGym中GPT-5的科学推理成功率从60.6%骤降至30.9%。这份报告介绍了CL-BENCH(上下文学习评测)、CCTU(约束工具使用评测)、SciAgentGym(科学工具使用交互环境)和MM-Doc-R1(多模态文档检索推理)四大基准测试的核心发现。虽然AI Scientist在某些特定领域已超越人类SOTA,但在通用科研能力上仍有显著短板,长周期科学工具使用是当前最大的能力瓶颈。
CL-BENCH——上下文学习能力评测
500个复杂场景、1899个任务、3.16万项验证标准
复旦NLP组开发的CL-BENCH基准测试聚焦于一个核心问题:模型能否从上下文中学习预训练中不存在的新知识并正确使用。基准包含500个复杂上下文场景、1,899个任务、3.16万项验证标准。
CL-BENCH将复杂上下文解决任务拆解为两个维度:Context中知识存在的类型(衡量模型能否正确调用知识)、如何利用Context中的知识(衡量模型能否解决该类问题)。
所有模型解决率均低于25%
评测结果显示,所有模型在CL-BENCH上的任务解决率均未超过25%。GPT-5.1为23.7%,Claude Opus 4.6为16.5%,Gemini 3 Pro为10.5%。平均解决率仅17.2%,揭示了大模型在处理需要从上下文中学习全新知识的科研任务时存在显著能力短板。
CCTU——复杂约束下的工具使用评测
12类约束、4个维度、平均7种约束/任务
CCTU基准将工具使用约束分为4个维度(资源约束、行为约束、工具集约束、响应约束)共12类。200个精心构造的测试用例平均包含7种约束类型、4,700+ tokens。
所有模型任务完成率低于20%
核心发现:所有模型的任务完成率(PSR)均低于20%,约束违反率超过50%。即使是最先进的GPT-5.2,在单跳任务中PSR仅32.67%,在多跳任务中降至17.33%。Claude Opus 4.6整体PSR为14.83%。这表明当前LLM在处理复杂、多约束的工具使用场景时能力严重不足。
SciAgentGym——科学工具使用交互环境
1780个工具、4大学科、259个任务
SciAgentGym是专为LLM Agent设计的科学实验室环境,包含1,780个领域专用工具,覆盖物理、化学、生物、材料科学4个自然科学学科。SciAgentBench包含259个任务、1,134个子问题,分为三级难度(L1≤3步、L2 4-7步、L3≥8步)。
评估指标包括成功率(SR,所有子问题回答正确)和SPL(成功率×路径效率)。核心设计理念是不考模型“背书”,而是考模型“实操”——模型需要操作分子模拟、查询数据库、编写数据分析代码。
长周期科学工具使用是关键瓶颈
核心发现:GPT-5成功率从L1的60.6%降至L3的30.9%,平均下降68%。工具增强不可或缺——Claude Sonnet-4工具使用提升13.5%。小模型可超越大模型——SciAgent-8B(30.1%)> Qwen3-235B-Inst(23.9%)。
学科间差异显著:生命科学工具依赖最强(+8.4%),材料科学整体最具挑战性。消融实验显示通用工具数据导致负迁移(-4.6%),错误恢复轨迹对鲁棒性至关重要,科学领域间正向跨域迁移已得到验证。
MM-Doc-R1——多模态文档检索与推理
迭代检索+视觉感知智能体
MM-Doc-R1针对传统RAG系统无法处理长文档中需要跨页面迭代信息收集的复杂多跳查询问题,设计了视觉感知智能体工作流,通过多轮RL(SPO)训练迭代信息发现能力。
系统架构包含文档解析(OCR→表格/图片/文本)、初始规划(构建TOC+按页分块)、工具箱(Search+Read)、迭代检索(Seeker动态生成子查询)、答案生成(综合证据推理)。
SPO训练显著提升推理能力
核心发现:未训练即超越最佳RAG基线10.4%;SPO+Qwen3-4B比GRPO高6.1%;SPO+Qwen3-8B比GRPO高5.0%;多证据多跳问题增益最显著(+10.0%);SPO训练收敛更快、曲线更平滑。