一个成熟的Skill会越来越短——半年前需要20行指令才能可靠执行的任务,现在裸跑就行。FadeMem项目模仿遗忘曲线,存储量砍掉45%但关键事实保留了82.1%。评估的关键不是让AI学会自省,而是给它一个独立的评判系统。腾讯研究院这份报告拆解了AI记忆、技能与评估的工程化方法论——当AI能力以7个月翻一倍的速度增长,管理记忆的精度、精简技能的长度、设计评估的系统,正成为驾驭AI的核心能力。
记忆——精确遗忘比完美记忆更重要
记忆系统的基本动作:写入、管理、读取。大多数实现只做了写和读,跳过了管理。管理包含四件事:修剪(不重要的降权或删掉)、压缩(冗长历史提炼成关键事实)、巩固(反复出现的信息从短期升长期)、冲突解决(两条矛盾记忆决定保留哪个)。FadeMem项目量化了代价:忽视管理时多跳推理准确率(F1)仅5.17,有管理系统达29.43,差距近5倍。
FadeMem模仿艾宾浩斯遗忘曲线:长期记忆层半衰期约11天,短期约5天,存储量砍掉45%,关键事实保留了82.1%。消融实验显示拆掉记忆融合模块,准确率暴降53.7%。三条技术路线分化:MemO的选择性事实提取(语义记忆)、Anthropic的文档化自主管理(情景记忆)、Neo4J的结构化知识图谱(关系记忆)。不同场景天然需要不同类型,目前还没有一条路线通吃。
Skill——自己持续维护的才是最好用的
三条路径让Agent具备专业能力:微调(把知识训练进权重)、RAG(把知识放在外部文档,告诉Agent“知道什么”)、Skill(把“遇到这种情况应该怎么做”写成可复用指令模块,告诉Agent“怎么做”)。Skill是程序性知识的数字表达——政策变成决策规则,流程变成工作流脚本,指南变成Agent可遵循的指令集。
Skill用渐进式加载解决上下文瓶颈:第一层暴露约100tokens元数据(始终在线);第二层匹配后才加载SKILL.md全文;第三层按需访问脚本和参考资料。关键不是“有没有这些知识”,是“什么时候让模型看到”。
Anthropic数百个生产级Skill的经验:描述是触发条件集不是摘要,写给模型看不是给人看;聚焦推动Agent超越默认思路的信息;踩坑记录是最有价值的部分。成熟的Skill越短越好——半年前需要20行指令的任务,现在裸跑就行。最终留下三样:精准描述、不可替代的领域知识、从失败中学到的教训。
评估——分离生成者与评判者
一个开发者用同一模型生成107个训练样本,Agent自评100%通过率;同一模型开全新上下文独立审查,5.5/10,5个严重缺陷。技术根因是“上下文污染”——Agent在同一个推理上下文中既生成又评估,自动补全会复用相同推理路径。修复比想象中简单:不需要换更强的模型,只需要换一个新上下文。
Anthropic采用PGE三角色架构:规划者把任务分解为结构化规格说明,生成者按规格产出内容,评估者对照规格审查产出。生成者和评估者各自跑在独立上下文窗口里,靠文件系统通信。评估者配了浏览器自动化测试工具,能独立导航、点按钮、截图、检查交互。每轮跑5到15次迭代,有时长达4小时。随着模型能力提升,早期脚手架已移除,但生成者与评估者的分离始终保留。
三层信任梯度:确定性检查(地基,最可信但覆盖面最窄)、AI审查(楼层,能看到语义问题但有偏见)、人类判断(屋顶,覆盖面最广但最慢最贵)。组合起来才能覆盖彼此的盲区。评估的实用起点:把上周修的3个bug转化为评估任务,这就是回归测试套件的v0.1。