SuperCLUE2025年年度测评智能体(任务规划)总分对比
2026-02-04 14:57:38
35
相关数据
行业数据1
SuperCLUE测评基准2025年年度总体表现(数据截至2026年2月27日)
2026-03-16 08:15:43
29
原图定位
行业数据1
2025年全年SuperCLUE通用基准测评海内外大模型Top3
2026-02-04 14:57:38
37
原图定位
行业数据1
SuperCLUE2025年年度通用测评推理模型推理效能区间分布(含补测)
2026-02-04 14:57:38
29
原图定位
行业数据1
SuperCLUE2025年年度测评科学推理总分对比
2026-02-04 14:57:38
31
原图定位
行业数据1
SuperCLUE2025年年度测评精确指令遵循总分对比
2026-02-04 14:57:38
30
原图定位
行业数据1
SuperCLUE2025年年度测评开闭源大模型6大任务平均分对比
2026-02-04 14:57:38
33
原图定位
行业数据1
SuperCLUE2025年年度测评代码生成总分对比
2026-02-04 14:57:38
29
原图定位
行业数据1
SuperCLUE2025年年度测评幻觉控制总分对比
2026-02-04 14:57:38
24
原图定位
行业数据1
SuperCLUE2025年年度测评六大任务国内外Top20热力图
2026-02-04 14:57:38
38
原图定位
行业数据1
SuperCLUE2025年年度测评数学推理总分对比
2026-02-04 14:57:38
43
原图定位
行业数据1
SuperCLUE2025年年度通用测评性价比区间分布
2026-02-04 14:57:38
38
原图定位
行业数据1
SuperCLUE2025年年度基准测评Qwen3-Max-Thinking六大任务得
2026-02-04 14:57:38
35
原图定位
行业数据1
SuperCLUE2025年年度基准测评开源模型总分对比
2026-02-04 14:57:38
30
原图定位
行业数据1
SuperCLUE2025年年度基准测评Kimi-K2.5-Thinking六大任务得分
2026-02-04 14:57:38
39
原图定位
行业数据1
SuperCLUE2025年年度测评海内外大模型6大任务平均分对比
2026-02-04 14:57:38
30
原图定位
最新数据
行业数据1
图11 联合国全球数字和可持续贸易便利化调查评分,2025年
2026-04-03 08:30:00
21
原图定位
行业数据1
图10 印度尼西亚针对其前10大出口产品进入美国市场的主要竞争者及其最新的相应关税水平
2026-04-03 08:30:00
23
原图定位
行业数据1
图9 “最坏情况”贸易战对价格的影响,2025 到 2030 年
2026-04-03 08:30:00
16
原图定位
行业数据1
图 8 “最坏情况”贸易战对印度尼西亚前10大农业食品下游需求部门的影响,2025年至2030年
2026-04-03 08:30:00
12
原图定位
行业数据1
图6 印尼对美国的农业出口,2010年至2024年
2026-04-03 08:30:00
14
原图定位
行业数据1
图7 受到美国互惠关税影响最大的五种农业食品产品
2026-04-03 08:30:00
12
原图定位
介绍:主要考察模型在复杂任务场景中制定结构化行动方案的能力,包括且不限于生活服务、工作协作、学习成长、健康医疗等。要求模型基于给定目标和约束条件, 生成逻辑连贯、步骤清晰、可执行的行动计划。 评价方式:利用裁判模型根据行动方案对预设检查点的完成情况进行离散判定(0/1),或对方案整体质量进行连续评分(0-100)。 1.海外头部模型优势显著。 海外头部模型GPT-5.2(high)以81.39 分领跑榜单,Claude-Opus-4.5- Reasoning以74.87分紧随其后。国 内Qwen3-Max-Thinking (70.13分) 和Kimi-K2.5-Thinking(68.06分) 分居第三和第四,海内外头部模型 的差距超过10分,国产模型在任务 规划领域还有一定的进步空间。 2.行业整体水平跨度巨大,长 尾效应明显。 面的发展极不平衡,整体水平跨度 巨大,两极分化比较严重,最高分 和最低分相差了4倍之多。此外, 的,达到了13.78,说明该任务对于 当前大模型依然是极具挑战性的, 是区分大模型能力的关键。
行业数据
原图定位
相关数据
最新数据