El último framework de agentes de Google se centra en la persistencia, no en el reentrenamiento

Google Research ha presentado un sistema llamado WikiSkill que intenta resolver una debilidad familiar en los agentes de IA: a menudo terminan una tarea, descartan la experiencia y comienzan la siguiente ejecución con poca memoria práctica de lo que salió mal antes. WikiSkill aborda esto emparejando un agente con una base de conocimiento persistente, similar a una wiki, que registra fallos y éxitos y utiliza ese registro para mejorar el rendimiento futuro.

La premisa es sencilla. En lugar de tratar cada ejecución como desechable, el framework captura lo que sucedió durante la ejecución, destila esos resultados en conocimiento estructurado y convierte las lecciones más útiles en guías de comportamiento reutilizables. Las instrucciones resultantes se empaquetan como lo que la fuente describe como "Habilidades de Agente", módulos que pueden moldear cómo se comporta un agente sin cambiar el entrenamiento original del modelo.

Esa distinción importa. WikiSkill no se presenta como un verdadero aprendizaje continuo a nivel de modelo. La fuente señala explícitamente que el aprendizaje continuo sigue siendo un problema no resuelto. Lo que WikiSkill ofrece en cambio es una memoria externa y un bucle de auto-mejora: el agente escribe mejores instrucciones para sí mismo, las almacena y las consulta más tarde. Es un workaround, pero uno que el informe describe como efectivo.

Una arquitectura de tres capas separa registros, conocimiento y acción

WikiSkill organiza el espacio de trabajo del agente en tres capas. En la base está la Capa Bruta, que almacena trazas de ejecución completas, incluyendo llamadas a herramientas y resultados. Esta capa es inmutable y sirve como registro base de lo que el agente realmente hizo. Por encima está la Capa Wiki, donde esas trazas brutas se convierten en observaciones estructuradas, como estrategias exitosas y patrones de fallo recurrentes. En la cima está la Capa de Habilidades, que contiene las instrucciones procedimentales activas que el agente utiliza al realizar tareas.

Esta separación es una de las decisiones de diseño más fuertes del framework. Las trazas brutas preservan evidencia. La wiki convierte la evidencia en conocimiento acumulativo. Las habilidades traducen el conocimiento en comportamiento operativo. Al dividir el sistema de esta manera, WikiSkill evita colapsar todo en un almacén de memoria opaco.

El ciclo de WikiSkill en cuatro pasos. El agente de inferencia genera trazas de ejecución (Capa Bruta), el Mantenedor de Wiki destila patrones en la wiki persistente, el Proponente de Habilidades deriva actualizaciones de habilidades, y un mecanismo de compuerta verifica si el cambio realmente ayuda. La wiki crece continuamente, mientras que las habilidades pueden revertirse si el rendimiento cae. | Imagen: Tang et al., 2026
El ciclo de WikiSkill en cuatro pasos. El agente de inferencia genera trazas de ejecución (Capa Bruta), el Mantenedor de Wiki destila patrones en la wiki persistente, el Proponente de Habilidades deriva actualizaciones de habilidades, y un mecanismo de compuerta verifica si el cambio realmente ayuda. La wiki crece continuamente, mientras que las habilidades pueden revertirse si el rendimiento cae. | Imagen: Tang et al., 2026

También maneja la revisión con cuidado. Según la fuente, la Capa Wiki solo crece y no se reinicia entre iteraciones. La Capa de Habilidades es más provisional. Si una nueva actualización de habilidades perjudica el rendimiento, se puede revertir. Eso significa que el framework trata el conocimiento duradero y la política activa de manera diferente: el conocimiento se acumula, pero el comportamiento sigue siendo comprobable y reversible.

Cómo funciona el bucle de mejora

El ciclo de actualización tiene cuatro partes. Primero, un agente de inferencia ejecuta tareas utilizando el conjunto de habilidades actual y genera trazas de ejecución. Luego, un componente llamado Mantenedor de Wiki analiza esas trazas, identifica modos de fallo y tácticas efectivas, y escribe los hallazgos en la wiki. Un Proponente de Habilidades utiliza tanto la wiki actualizada como los datos de ejecución para sugerir cambios específicos en las habilidades del agente. Finalmente, un mecanismo de compuerta evalúa la actualización propuesta en un conjunto de validación separado y solo mantiene el cambio si ayuda.

Ese último paso es esencial. Los sistemas que permiten a los agentes reescribir sus propios procedimientos pueden degradarse rápidamente si se acepta cada revisión. La compuerta de validación de WikiSkill está diseñada para detener esa deriva. Si una habilidad propuesta falla la prueba, el sistema descarta la actualización de habilidad pero preserva el conocimiento subyacente registrado en la wiki.

Incluso las propuestas fallidas se convierten en entradas útiles. La fuente dice que la wiki documenta lo que se intentó y por qué falló, lo que da a las iteraciones posteriores más contexto. En efecto, el sistema no solo recuerda tácticas exitosas. También recuerda direcciones improductivas y puede evitar repetirlas a ciegas.

Por qué la memoria de fallos podría importar para la fiabilidad de los agentes

La importancia más amplia de WikiSkill no es meramente que los agentes puedan acumular notas. Es que el fallo se convierte en información de primera clase. En muchos pipelines de agentes, el fallo aparece solo como un resultado negativo inmediato: una tarea se pierde, una herramienta se usa mal, o una cadena de instrucciones colapsa. A menos que los desarrolladores inspeccionen manualmente los registros y revisen los prompts, esos errores no se convierten en conocimiento operativo persistente.

WikiSkill intenta automatizar esa conversión. Al documentar patrones de fallo y estrategias exitosas en una capa duradera, el framework da al agente una manera de mejorar el comportamiento con el tiempo sin requerir una nueva ronda de entrenamiento del modelo. Eso podría ser particularmente relevante en entornos donde los agentes se enfrentan repetidamente a tareas similares y donde el uso de herramientas, la secuenciación y el manejo de excepciones importan tanto como la habilidad lingüística bruta.

WikiSkill (amarillo) supera consistentemente a todos los otros métodos de evolución de habilidades y a la línea base sin habilidades. La brecha con la línea base crece con el tamaño del modelo, mostrando que los modelos más grandes se benefician más de las habilidades evolucionadas. | Imagen: Tang et al., 2026
WikiSkill (amarillo) supera consistentemente a todos los otros métodos de evolución de habilidades y a la línea base sin habilidades. La brecha con la línea base crece con el tamaño del modelo, mostrando que los modelos más grandes se benefician más de las habilidades evolucionadas. | Imagen: Tang et al., 2026

El framework también refleja una tendencia creciente en el diseño de sistemas de IA: empujar más inteligencia hacia el andamiaje alrededor del modelo en lugar de hacia los pesos del modelo mismo. Memoria, validación, reversión y auto-documentación estructurada son todas formas de ingeniería operativa. No resuelven el problema de aprendizaje más difícil, pero aún pueden ofrecer ganancias medibles.

Una "Wiki LLM" pasa de la idea a la implementación

El trabajo se basa en un concepto asociado en la fuente con Andrej Karpathy: la idea de una "Wiki LLM", un almacén acumulativo de experiencia que un sistema de IA puede construir y consultar con el tiempo. WikiSkill aplica esa idea específicamente al desarrollo de agentes. En lugar de un volcado de memoria general, crea un proceso para convertir trazas en procedimientos reutilizables y comprobables.

Ese enfoque en el procedimiento es importante. Un agente no solo necesita hechos; necesita un mejor sentido de cómo actuar. ¿Qué herramienta debería usar primero? ¿Qué patrones de fallo deberían desencadenar un camino diferente? ¿Qué estrategia ha funcionado antes en una situación similar? La respuesta de WikiSkill es formalizar esas lecciones como habilidades mientras preserva la base de evidencia debajo de ellas.

Todavía hay compensaciones. La fuente señala que el método es probablemente más propenso a errores que el aprendizaje genuino. Los almacenes de conocimiento externos pueden codificar interpretaciones defectuosas, y las instrucciones auto-escritas pueden derivar en heurísticas frágiles si no se validan cuidadosamente. Pero el mecanismo de compuerta y el modelo de reversión muestran que los investigadores están tratando ese riesgo como parte del problema de diseño.

Por ahora, el mensaje es claro: la memoria persistente puede ser una de las formas más prácticas de mejorar los agentes antes de que se resuelva el verdadero aprendizaje continuo. WikiSkill sugiere que los agentes no necesitan reentrenarse para mejorar en trabajos repetidos. Puede que solo necesiten una forma estructurada de recordar lo que sucedió, lo que falló y lo que debería intentarse la próxima vez.

Este artículo se basa en un reportaje de The Decoder. Leer el artículo original.

Originally published on the-decoder.com