谷歌最新的代理框架侧重于持久性,而非重新训练
谷歌研究院推出了一款名为WikiSkill的系统,试图解决AI代理的一个常见弱点:它们通常完成任务后丢弃经验,在下次运行时对之前的错误几乎没有实际记忆。WikiSkill通过将代理与一个持久化的、类似维基的知识库配对来解决这个问题,该知识库记录失败和成功,并利用这些记录来改进未来的性能。
其前提很简单。该框架不是将每次运行视为一次性,而是捕获执行过程中发生的情况,将这些结果提炼为结构化知识,并将最有用的经验转化为可重用的行为指导。由此产生的指令被打包为“代理技能”(Agent Skills)模块,这些模块可以在不改变模型原始训练的情况下影响代理的行为。
这一区别很重要。WikiSkill并非在模型层面实现真正的持续学习。消息来源明确指出,持续学习仍然是一个未解决的问题。WikiSkill提供的是外部记忆和自我改进循环:代理为自己编写更好的指令,存储它们,并在以后参考。这是一种变通方法,但报告称其有效。
三层架构分离日志、知识和行动
WikiSkill将代理的工作空间组织为三层。底层是原始层(Raw Layer),存储完整的执行轨迹,包括工具调用和结果。该层是不可变的,作为代理实际所做事情的基础记录。其上是维基层(Wiki Layer),将原始轨迹转换为结构化观察,如成功策略和重复失败模式。最顶层是技能层(Skill Layer),包含代理在执行任务时使用的活动程序指令。
这种分离是框架最强大的设计选择之一。原始轨迹保留证据。维基将证据转化为累积知识。技能将知识转化为操作行为。通过这种方式拆分系统,WikiSkill避免了将所有内容折叠成一个不透明的记忆存储。

它还谨慎地处理修订。根据消息来源,维基层只增长,不会在迭代之间重置。技能层则更具临时性。如果新的技能更新损害性能,可以回滚。这意味着框架区分了持久知识和活动策略:知识累积,但行为保持可测试和可逆。
改进循环如何工作
更新循环有四个部分。首先,推理代理使用当前技能集执行任务并生成执行轨迹。然后,一个名为维基维护者(Wiki Maintainer)的组件分析这些轨迹,识别失败模式和有效策略,并将发现写入维基。技能提议者(Skill Proposer)利用更新后的维基和执行数据,建议对代理技能进行有针对性的更改。最后,门控机制在单独的验证集上评估提议的更新,并且仅在有助于性能时保留更改。
最后一步至关重要。如果接受每次修订,允许代理重写自身程序的系统可能会迅速退化。WikiSkill的验证门旨在阻止这种漂移。如果提议的技能未通过测试,系统会丢弃技能更新,但保留维基中记录的基础知识。
因此,即使失败的提议也会成为有用的输入。消息来源称,维基记录了尝试了什么以及为什么失败,这为后续迭代提供了更多上下文。实际上,系统不仅记住成功的策略,还记住无效的方向,并可以避免盲目重复。
为什么失败记忆对代理可靠性很重要
WikiSkill的更广泛意义不仅在于代理可以积累笔记,而在于失败成为第一手信息。在许多代理管道中,失败仅表现为直接的糟糕结果:任务未完成、工具被误用或指令链崩溃。除非开发人员手动检查日志并修改提示,否则这些错误不会转化为持久的操作知识。
WikiSkill试图自动化这种转化。通过在持久层记录失败模式和成功策略,该框架为代理提供了一种随时间改进行为的方法,而无需进行新一轮的模型训练。这在代理反复面对类似任务的环境中可能特别相关,在这些环境中,工具使用、排序和异常处理与原始语言能力同样重要。

该框架还反映了AI系统设计的一个增长趋势:将更多智能推入模型周围的脚手架,而不是模型权重本身。记忆、验证、回滚和结构化自我文档都是操作工程的形式。它们并不能解决最困难的学习问题,但仍可能带来可衡量的收益。
“LLM维基”从概念走向实现
这项工作借鉴了消息来源中与Andrej Karpathy相关的概念:“LLM维基”的想法,即AI系统可以构建并随时间查阅的累积经验存储。WikiSkill将该想法专门应用于代理开发。它不是通用的记忆转储,而是创建了一个将轨迹转化为可重用、可测试程序的过程。
这种对程序的关注很重要。代理不仅需要事实,还需要更好的行动感。它应该首先使用哪个工具?哪些失败模式应触发不同的路径?在类似情况下,哪种策略以前有效?WikiSkill的答案是将这些经验形式化为技能,同时保留其下的证据基础。
仍然存在权衡。消息来源指出,该方法可能比真正的学习更容易出错。外部知识存储可能编码有缺陷的解释,自我编写的指令如果不仔细验证可能会漂移为脆弱的启发式规则。但门控机制和回滚模型表明,研究人员正在将该风险视为设计问题的一部分。
目前,信息很明确:在真正持续学习解决之前,持久记忆可能是改进代理的最实用方法之一。WikiSkill表明,代理不需要重新训练就能在重复工作中变得更好。它们可能只需要一种结构化的方式来记住发生了什么、什么失败了,以及下次应该尝试什么。
本文基于The Decoder的报道。阅读原文。
Originally published on the-decoder.com


